본문으로 건너뛰기

GPT-6 Astra, Code Arena 웹개발 1위…Claude Fable 5.1에 35점 차

실사용형 웹개발 평가에서 GPT-6 Astra Max가 1,797점으로 새 1위에 올랐다. Claude Fable 5.1 Max를 35점, 이전 OpenAI 최고 모델 GPT-5.6 Sol을 180점 앞서면서 100만 토큰당 40달러 가격대의 성능 기준을 한 단계 끌어올렸다.

원문: GPT-6 Astra takes first place on Code Arena WebDev by 35 points 원문 보기 →

LLM X/Twitter 작성자 Insights AI (Twitter) 2분 소요 출처

웹개발 작업에서 1,797점

GPT-6 Astra Max가 Code Arena의 WebDev 순위에서 1,797점을 기록해 선두를 바꿨다. 커뮤니티 평가 플랫폼 Arena.ai가 공개한 초기 집계에서 2위 Claude Fable 5.1 Max는 1,762점, 3위 Claude Opus 5 Max는 1,688점이었다. Astra의 우위는 각각 35점과 109점이다. OpenAI의 이전 항목인 GPT-5.6 Sol xHigh와 비교하면 180점 상승했고, 그 모델의 순위는 13위였다.

“There is a new #1 on Code Arena - GPT-6 Astra (Max)!”

Code Arena는 정답이 하나로 고정된 짧은 코딩 문제보다 실제 제품 제작에 가까운 웹개발 결과를 사람이 비교하는 평가를 운영한다. 계정 소개에서도 커뮤니티 기반 평가로 현실의 AI 성능을 측정한다고 밝히고 있다. 이번 게시물은 Astra가 데이터·분석, 소비자 제품, 콘텐츠 제작 도구 부문에서 1위를 기록했고 게임·시뮬레이션에서는 2위라고 설명했다. 브랜드·마케팅, 참조 디자인, 풀스택 등 일부 세부 부문의 투표는 아직 진행 중이어서 전체 순위는 바뀔 수 있다.

가격과 성능을 함께 봐야 하는 결과

Astra Max의 표시 가격은 100만 토큰당 40달러로, Arena.ai는 최신 Claude 모델과 같은 가격대라고 비교했다. 따라서 이번 결과의 핵심은 최고 점수만이 아니라 같은 비용 구간에서 성능-가격 경계가 이동했다는 데 있다. 다만 사용자 선호 투표형 평가는 프롬프트 구성, 생성 결과의 시각적 매력, 표본 수에 영향을 받는다. 35점 차가 통계적으로 얼마나 안정적인지 판단하려면 투표가 더 쌓인 뒤 신뢰구간과 세부 과제별 승률을 함께 확인해야 한다.

세부 순위는 모델의 강점이 균일하지 않다는 사실도 보여준다. 데이터·분석과 콘텐츠 제작에서는 선두였지만 게임·시뮬레이션에서는 2위였다. 하나의 종합 점수만으로 모든 개발 업무의 우열을 결론 내리기 어렵다는 뜻이다. 팀이 실제 도입을 검토한다면 자체 코드베이스에서 기능 완성도, 테스트 통과율, 사람이 수정한 줄 수, 총 토큰 비용을 별도로 측정해야 한다. 공개 리더보드는 후보를 좁히는 출발점이지 구매 결정을 대신하는 성적표는 아니다.

개발팀이 주목할 부분은 웹 결과물의 첫인상뿐 아니라 수정 가능성, 접근성, 코드 구조, 장기 유지보수성에서도 같은 우위가 유지되는지다. Max 설정의 높은 추론 비용과 응답 시간도 실제 배포 환경에서는 중요한 변수다. 다음 업데이트에서는 세부 부문 투표의 마감 결과, 동일 프롬프트 재현성, 더 낮은 추론 설정과의 비용 차이를 확인할 필요가 있다. 수치와 진행 중인 평가 상태는 Arena.ai 원문 게시물에서 볼 수 있다.

공유: 긴글

관련 기사