Grok 4.6, 지능지수 61로 GPT-5.6 Sol과 동률… 작업당 $0.84로 성능·비용 격차 축소
Original: Grok 4.6 Scores 61, Matching GPT-5.6 Sol at $0.84 per Task View original →
61점과 작업당 $0.84가 바꾼 경쟁 구도
Grok 4.6은 독립 평가기관 Artificial Analysis의 Intelligence Index에서 61점을 받아 GPT-5.6 Sol의 최대 설정과 동률을 기록했다. Claude Opus 5 최대 설정의 63점, Claude Fable 5의 62점과도 1~2점 차이다. 더 중요한 수치는 작업당 비용이다. 평가에 든 비용은 $0.84였고, 입력과 출력 가격은 각각 100만 토큰당 $2와 $6으로 제시됐다. 최고 성능 모델을 고르는 문제가 이제 단순 점수표를 넘어 실제 작업을 얼마에 끝내는지로 옮겨가고 있다.
“Grok 4.6은 Artificial Analysis 지능지수 61점으로 GPT-5.6 Sol과 같은 프런티어에 합류했다.”
이 문장은 Artificial Analysis의 원문 게시물에서 핵심을 압축한 대목이다. 게시물은 2026년 8월 12일 15시 39분 UTC에 올라왔으며, Grok 4.5보다 지능지수가 5점 상승했고 Grok 4.3과 비교하면 23점 높아졌다고 설명한다. 같은 날 SpaceXAI의 출시 게시물은 Grok 4.5와 같은 가격에서 성능을 높였다고 밝혔다.
에이전트 평가에서 드러난 강점
종합 점수보다 세부 결과가 실무 선택에 더 직접적이다. Grok 4.6은 장기 지식 작업을 재는 AA-Briefcase에서 Elo 1577을 얻어 Fable 5 수준에 자리했다. 평균 약 53번의 턴과 5억 개 입력 토큰으로 작업을 마쳤는데, Claude Opus 5 최대 설정은 약 103번의 턴과 20억 개 입력 토큰을 사용했다. 은행 업무 평가인 τ³-Banking에서는 50.7%로 Qwen3.8 Max의 51.3%에 근접했고, Terminal-Bench v2.1에서는 88.4%를 기록했다. 같은 모델이라도 긴 계획, 도구 호출, 오류 복구가 이어지면 턴 수 차이가 지연과 청구 비용을 동시에 키운다.
Artificial Analysis는 모델 가격, 속도, 품질과 에이전트 성능을 반복 측정하는 독립 분석 계정이다. 이번 결과는 업체의 출시 문구보다 비교 기준과 실행 비용을 함께 제공한다는 점에서 유용하다. 다만 단일 종합 점수는 업무별 실패 유형이나 출력 품질 차이를 모두 설명하지 못한다. 비공개 AA-Briefcase 결과 역시 외부 연구자가 같은 조건에서 재현하기 어렵다는 한계가 있다.
다음 검증 포인트
앞으로 확인할 것은 500K 컨텍스트에서 장시간 실행할 때의 안정성, 캐시 적중 비용 상승이 반복 작업에 미치는 영향, 그리고 독립 코딩·도구 사용 평가에서 61점이 실제 생산성으로 이어지는지다. Grok 4.6이 낮은 토큰 단가뿐 아니라 적은 턴과 입력량을 계속 유지한다면, 프런티어 모델의 경쟁 축은 최고 점수에서 완료 작업당 총비용으로 더 빠르게 이동할 수 있다.
Related Articles
30B 모델을 소비자용 GPU 한 장에 올리는 구체적인 방법에 관심이 모였다. Meta의 Muse Glimmer는 Apache 2.0 weights, 4-bit 양자화, DFlash speculative decoding을 묶어 로컬 agent를 겨냥한다.
718점짜리 HN 논점은 단순한 순위가 아니라 비용, 속도, 코딩 실전성이 한꺼번에 움직인다는 점에 모였다.
오픈웨이트 모델 경쟁이 가격 실험을 넘어 실제 에이전트 배치 문제로 이동했다. OpenRouter는 DeepSeek V4 Flash, GLM 5.2, MiniMax M3, Nemotron 3 Ultra 등 4개 모델을 June 2026 핵심 후보로 제시하며 SWE-bench 79.0%, 1M context, 최대 150x 비용 차이를 근거로 들었다.