700줄 C코드로 만든 현대 LLM — gemma4.c 프로젝트 공개
개발자가 Google Gemma 4 E2B 모델을 실행하는 700줄짜리 단일 C 파일 gemma4.c를 공개했다. 외부 의존성 없이 일반 CPU에서 실행되며, 코드 전체를 읽으면 LLM 추론 원리를 이해할 수 있다.
카테고리
Insights의 LLM 기사
개발자가 Google Gemma 4 E2B 모델을 실행하는 700줄짜리 단일 C 파일 gemma4.c를 공개했다. 외부 의존성 없이 일반 CPU에서 실행되며, 코드 전체를 읽으면 LLM 추론 원리를 이해할 수 있다.
Z.ai가 에이전틱 코딩과 사이버 방어에 특화된 GLM-5.3을 오픈 웨이트로 공개했다. GLM-5.2 대비 코딩 성능 50% 향상, Terminal Bench 3.0에서 오픈소스 최고 성능 달성.
톰슨 로이터가 4,000만 달러를 투자해 개발한 자체 AI 모델 '톰슨'을 8월 24일 공개했다. Westlaw·Practical Law·Reuters 독자 데이터로 파인튜닝됐으며 법인세 질의에서 ChatGPT·Claude를 능가했다.
Z.ai가 GLM-5.3의 오픈 웨이트를 Hugging Face에 공개했다. 743B 파라미터 MoE 모델에 MIT 라이선스를 적용했으며, 에이전트 코딩과 사이버 방어에 특화된 포스트 트레이닝이 특징이다.
Thomson Reuters가 4,000만 달러를 투자해 Westlaw·Practical Law·Checkpoint 등 독자 법률 콘텐츠로 훈련한 자체 LLM 'Thomson'을 8월 24일 공개했다. CoCounsel Legal 문서 분석에 첫 배치되며, 소형 오픈웨이트 버전은 Hugging Face에 무료 공개됐다.
Nvidia가 AI 코딩 스타트업 Poolside와 60억 달러 비독점 라이선스 계약을 체결하고 10억 달러 추가 투자를 단행했다. Poolside 기업 가치를 120억 달러로 끌어올린 이번 계약으로 100명 이상의 직원이 Nvidia의 오픈웨이트 Nemotron 모델 개발에 합류한다.
Cohere가 8월 27일 기업 문서 지능화 전용 2.3B 비전 언어 모델 Parse 5를 공개했다. PDF·PPT·이미지를 읽기 순서대로 구조화된 마크다운으로 변환하며, RAG 및 에이전트 파이프라인의 문서 전처리 병목을 단일 모델 호출로 해소한다.
알리바바 Qwen 팀이 Qwen4 아키텍처의 초기 프리뷰인 Qwen3.8-Flash-Next를 오픈웨이트로 공개했다. 125B 파라미터(활성 6B)와 51B N-gram 임베딩을 갖추고, Qwen3.7-Plus 대비 훈련 비용 9분의 1로 코딩·에이전트 성능에서 앞서는 결과를 보였다.
Z.ai가 GLM-5 시리즈 최초의 네이티브 멀티모달 모델 GLM-5.3-Flash를 공개했다. 320B 총 파라미터에 18B 활성 파라미터로, 태스크당 $0.045에 Claude Opus 4.8에 근접하는 코딩·에이전트 성능을 제공한다.
OpenRouter에 익명으로 공개돼 각종 벤치마크 상위권을 차지한 오픈소스 모델 Ox Alpha가 GLM 시리즈를 만든 중국 AI 연구소 Z.AI의 작품으로 밝혀졌다. 코딩·장기 에이전트·멀티모달 워크플로 특화 설계가 특징이다.
DeepSeek이 V4 Flash의 비전 확장 버전 V4-Flash-Vision-Exp를 공개하고 멀티모달 API 서비스를 시작했다. 텍스트 성능을 유지하면서 멀티모달 에이전트 벤치마크에서 Claude Opus 4.8에 근접한 수준을 기록했다.
OpenAI가 플래그십 모델 GPT-5.6 Sol의 API 가격을 대폭 낮췄다. 입력 토큰은 100만 개당 5달러에서 4달러로 20%, 출력 토큰은 30달러에서 20달러로 33% 인하된다. 최소 2026년 11월 21일까지 유지되며 종량제 API와 Codex 크레딧에 적용된다.