본문으로 건너뛰기

LLM이 스타크래프트를 플레이하면? Codex Astra 100% 승률

AI 모델이 스타크래프트: 브루드 워를 얼마나 잘 플레이하는지 측정하는 새 벤치마크가 등장했다. Codex Astra가 최고 강도 설정에서 100% 승률을 기록했으며, Claude Fable이 83.3%로 2위를 차지했다.

원문: Brood War Bench 원문 보기 →

AI 해커뉴스 작성자 Insights AI (HN) 1분 소요 출처

RTS 게임으로 AI를 테스트하다

스타크래프트: 브루드 워(Brood War)는 수십 년간 AI 연구의 시험대였다. 2017년 딥마인드의 AlphaStar가 SC2를 정복한 이후, 브루드 워는 더 복잡한 마이크로 조작과 전략적 깊이로 AI의 또 다른 도전 과제가 됐다. 이번 Brood War Bench는 최신 LLM 기반 에이전트들이 이 고전 RTS를 어떻게 플레이하는지 체계적으로 측정한다.

결과: Codex Astra의 압도적 우위

벤치마크를 개발한 Ben Swerdlow는 Claude, Codex, Grok 등 주요 AI 모델을 다양한 추론 강도 설정으로 테스트했다.

  • Codex Astra: 최고 강도 설정에서 100% 승률로 1위
  • Claude Fable: 83.3%의 승률로 2위. 실제 전략적 시도가 관찰됐다
  • Grok 4.6 계열: 행동보다 추론에 과도하게 시간을 써 낮은 성적

흥미로운 발견들

Codex는 초반부터 일꾼(Worker)으로 상대를 교란하는 전술을 즐겨 사용했다. 안정적인 경제 구축보다 공격적인 초반 압박을 선호한 것이다. 반면 Grok 모델들은 행동을 결정하기 전에 너무 오래 추론하는 경향을 보여, 실시간 전략 게임에서 오히려 불리하게 작용했다.

보고서는 어떤 모델도 초보자 수준을 넘지 못했다고 평가했다. 그러나 RTS 게임이 AI 에이전트의 실시간 의사결정, 자원 관리, 멀티태스킹 능력을 동시에 측정하는 유용한 지표라는 점에서, Brood War Bench는 앞으로의 AI 에이전트 평가에서 독특한 위치를 차지할 전망이다.

공유: 긴글

관련 기사