Opus 4.8, GDPval-AA에서 GPT-5.5보다 121점 앞선 첫 외부 벤치마크
Original: Opus 4.8 leads GPT-5.5 by 121 points on GDPval-AA benchmark View original →
Claude Opus 4.8의 경쟁력은 단순한 모델 출시 소식보다 벤치마크 격차에서 더 선명하다. Artificial Analysis는 Opus 4.8이 GDPval-AA에서 1890점을 기록했고, 다음 순위 모델인 GPT-5.5 xhigh보다 121점 앞섰다고 공개했다. 이 수치는 같은 작업 세트에서 약 67%의 head-to-head 승률을 뜻한다고 설명했다.
Artificial Analysis는 트윗에서 “1890 on GDPval-AA”, “+121 points ahead”라고 요약했다.
원문 트윗은 Anthropic이 공개 전 접근 권한을 제공했고, 전체 Artificial Analysis Intelligence Index 결과는 아직 진행 중이라고 덧붙였다. 이 계정은 주요 LLM의 가격, 속도, 품질 지표를 표준화해 비교하는 벤치마크 계정으로, 공급사 블로그보다 비교 축을 넓혀 보여주는 역할을 해왔다.
맥락은 Anthropic의 Opus 4.8 출시 글과 맞물린다. Anthropic은 Opus 4.8이 Opus 4.7보다 판단과 자기 검증이 좋아졌고, 코드 결함을 그냥 넘길 가능성이 약 4배 낮아졌다고 설명했다. 또 Claude Code에는 더 긴 작업을 맡기는 dynamic workflows, claude.ai에는 effort control, API에는 대화 중 system entries를 넣는 변경이 함께 들어갔다.
GDPval-AA는 “실제 업무형 에이전트 작업”을 겨냥한 평가라는 점에서 SWE-bench류 코딩 점수와 다른 신호를 준다. 다만 최종 Index가 아직 나오지 않았기 때문에, 이 점수가 토큰 비용, 지연 시간, 실패 복구율까지 포함해 얼마나 재현되는지가 다음 확인 지점이다. 개발팀은 Opus 4.8을 바로 기본 모델로 바꾸기보다 내부 작업 세트에서 GPT-5.5, 기존 Opus 4.7과 같은 프롬프트와 예산으로 다시 비교할 필요가 있다.
Related Articles
Claude Fable 5가 GDPval-AA 1932점으로 에이전트형 지식 업무 벤치마크 1위에 올랐다. Anthropic 모델이 상위 4개 중 3개를 차지했다는 점은 장시간 업무형 모델 경쟁이 성능표 중심으로 재편되고 있음을 보여준다.
Anthropic는 Feb 17, 2026, Claude Sonnet 4.6를 공개하며 coding, computer use, long-context reasoning, agent planning 전반을 강화했다고 밝혔다. 가격은 Sonnet 4.5와 같은 $3/$15를 유지하면서 1M token context window와 다수 tool 기능을 추가했다.
Anthropic이 Claude Opus 4.7을 모든 Claude 제품, API, Amazon Bedrock, Vertex AI, Microsoft Foundry에 GA로 풀었다. $5/$25 per million token 가격은 유지하면서 2,576px 장변 이미지와 xhigh effort를 더해 coding agent와 multimodal 업무의 기준선을 끌어올렸다.