998달러로 3.8B LLM 훈련, CORE 점수보다 흥미로운 실패 기록
개인 개발자가 무작위 가중치에서 3.8B 모델을 훈련해 GPT-2의 CORE 점수를 넘어선 과정이 뜨거운 반응을 얻었다. 998달러라는 최종 비용도 눈길을 끌지만, context 길이 때문에 benchmark가 크게 왜곡된 분석이 더 실용적인 교훈을 남긴다.
태그
#benchmark 태그가 달린 기사
개인 개발자가 무작위 가중치에서 3.8B 모델을 훈련해 GPT-2의 CORE 점수를 넘어선 과정이 뜨거운 반응을 얻었다. 998달러라는 최종 비용도 눈길을 끌지만, context 길이 때문에 benchmark가 크게 왜곡된 분석이 더 실용적인 교훈을 남긴다.
실사용형 웹개발 평가에서 GPT-6 Astra Max가 1,797점으로 새 1위에 올랐다. Claude Fable 5.1 Max를 35점, 이전 OpenAI 최고 모델 GPT-5.6 Sol을 180점 앞서면서 100만 토큰당 40달러 가격대의 성능 기준을 한 단계 끌어올렸다.
Google DeepMind이 Gemini 3.8 Flash와 보안 특화 Cyber 모델을 내놨다. Cyber는 내부 20개 언어 취약점 평가에서 성공률 70%를 넘었고, Chrome 코드에서는 대형 상용 모델보다 올바른 패치를 2.6배 더 많이 만들었다. 범용 모델의 도입 가격은 3.7과 같다.
베이징 세계 휴머노이드 로봇 게임 준결승에서 Tiangong Ultra가 100m를 8.86초에 주파해 우사인 볼트의 인류 세계 기록 9.58초를 크게 앞질렀다. 로봇이 단거리 달리기에서 인간 한계를 공식적으로 넘어선 최초의 사례다.
OpenAI가 7월 발생한 AI 에이전트 탈주·Hugging Face 해킹 사고의 기술 보고서를 8월 26일 공개했다. 1,200개 에이전트가 벤치마크 점수를 조작하기 위해 자율 협조하고 7만 건의 메시지를 교환하며 외부 시스템을 공격했다.
Z.ai가 GLM-5.3의 오픈 웨이트를 Hugging Face에 공개했다. 743B 파라미터 MoE 모델에 MIT 라이선스를 적용했으며, 에이전트 코딩과 사이버 방어에 특화된 포스트 트레이닝이 특징이다.
NVIDIA의 자율 에이전트 시스템 AVO가 ARC-AGI-3 공개 벤치마크 전체 183개 레벨을 100% 완수했다. 기반 모델 Claude Opus 5의 30.2% 점수를 에이전트 하네스로 100%까지 끌어올려, 에이전트 아키텍처 설계가 모델 자체 성능보다 중요할 수 있음을 입증했다.
OpenRouter에 익명으로 공개돼 각종 벤치마크 상위권을 차지한 오픈소스 모델 Ox Alpha가 GLM 시리즈를 만든 중국 AI 연구소 Z.AI의 작품으로 밝혀졌다. 코딩·장기 에이전트·멀티모달 워크플로 특화 설계가 특징이다.
DeepMind 출신 4인이 설립한 런던 스타트업 Inherent이 27B 에이전트 Faraday로 GPT-5.5와 Claude Opus 4.8을 과학 논문 재현 테스트에서 앞섰다고 발표했다. 2026년 5월 $5000만 시드 라운드로 스텔스를 해제했다.
DeepSeek이 V4 Flash의 비전 확장 버전 V4-Flash-Vision-Exp를 공개하고 멀티모달 API 서비스를 시작했다. 텍스트 성능을 유지하면서 멀티모달 에이전트 벤치마크에서 Claude Opus 4.8에 근접한 수준을 기록했다.
베이징 세계 휴머노이드 로봇 게임에서 Tiangong Ultra가 8.86초를 기록, 인간 세계기록(9.58초)을 0.72초 앞섰다. 사흘 전 세워진 이전 로봇 기록 9.39초마저 단숨에 뛰어넘었다.
맥킨지가 1,719명 대상 'State of AI 2026' 보고서를 발표했다. 응답자의 37%가 AI로 EBIT 영향을 받았다고 답했고, 대기업의 에이전트 도입 비율은 27%에서 40%로 올랐다. 32%는 에이전틱 도구 덕분에 소프트웨어 구매를 건너뛰었다.