Gemini 3.7 Flash, 코딩 정확도 43.6%·업무 자동화 30.4%·가격 반값 공개
3주 만의 후속 모델이 코딩과 업무 자동화 성능을 두 자릿수 폭으로 끌어올렸다. FrontierCode 1.1은 34.4%에서 43.6%로 상승했고, 연말까지 출력 100만 토큰당 3.75달러다. Google AI Studio와 Android Studio에서 바로 쓸 수 있다.
Insights
기사 92개
3주 만의 후속 모델이 코딩과 업무 자동화 성능을 두 자릿수 폭으로 끌어올렸다. FrontierCode 1.1은 34.4%에서 43.6%로 상승했고, 연말까지 출력 100만 토큰당 3.75달러다. Google AI Studio와 Android Studio에서 바로 쓸 수 있다.
Grok 4.6이 Artificial Analysis 지능지수 61점으로 GPT-5.6 Sol과 나란히 섰다. 작업당 비용은 $0.84로 집계돼, 프런티어 모델 경쟁이 성능뿐 아니라 에이전트 효율과 비용으로 이동하고 있음을 보여준다.
코딩 에이전트 평가는 이제 pass@1만으로 부족하다. Together AI는 DeepSWE 분석에서 Kimi K3가 Fable 5에 근접한 pass@1을 보이면서 rollout 비용은 약 3분의 1이었다고 밝혔다.
235개 댓글의 관심은 “모델이 맞힌 답”보다 “그 답에 붙은 reasoning trace가 실제 이유인지”에 모였다.
일상형 고성능 모델 경쟁의 초점이 최고점보다 비용당 성능으로 옮겨갔다. Claude Opus 5는 Fable 5에 가까운 코딩·지식 작업 성능을 절반 가격으로 내세우며, API 가격은 입력 $5/M·출력 $25/M 토큰으로 책정됐다.
보안 코드 분석에서 최고 성능과 반복 비용의 간극이 커지고 있다. Malte Ubl은 비공개 Deepsec 평가에서 GPT-5.6 Sol이 최고 재현율·정밀도를 보였지만 실행 비용은 차점 모델의 7배 이상이라고 밝혔다.
OpenAI가 AI 비용 논쟁의 기준을 토큰 가격에서 성공한 작업당 비용으로 옮기려 한다. GPT-5.6 Sol은 DeepSWE v1.1에서 72.7%를 기록했고, Claude Fable 5의 69.9%보다 높으면서 추정 API 비용은 36.2% 낮다고 제시됐다.
OpenAI가 SWE-Bench Pro 공개 과제의 30%가 깨져 frontier coding 역량을 안정적으로 재지 못한다고 밝혔다. 숨은 요구사항, 충돌하는 지시, 과도한 테스트가 정답을 실패로 처리할 수 있다는 지적이다.
OpenAI가 GPT-5.6 Sol·Terra·Luna를 ChatGPT, Codex, API에 풀기 시작했다. 스레드에는 Coding Agent Index 80.0, Claude Fable 5 대비 +2.8점, 비용 약 3분의 1 절감이라는 비교가 함께 제시됐다.
agent 성능 개선이 항상 새 모델이나 fine-tuning을 뜻하지는 않는다. Microsoft Research의 SkillOpt는 GPT-5.5 direct chat 6개 benchmark 평균을 58.8에서 82.3으로 올렸고, 52개 평가 셀에서 최고 또는 공동 최고를 기록했다.
생물학용 AI 에이전트 평가는 단순 Q&A에서 실제 연구 판단 재현으로 이동하고 있다. OpenAI의 GeneBench-Pro는 129개 계산생물학 문제를 제시하며, GPT-5.6 Sol도 최고 추론 설정에서 28.7%, Pro mode에서 31.5%에 그쳤다.
벤치마크 숫자보다 HN 댓글이 파고든 지점은 작은 모델을 실제 코딩 루프에 넣었을 때의 속도와 안정성이다.