Gemini 3.7 Flash, 실무 분석 60.0%로 Claude Opus 5보다 6.2%p 앞서
Original: Gemini 3.7 Flash Leads Analyst Benchmark at 60.0%, 6.2 Points Clear View original →
실무형 데이터 분석에서 속도를 앞세운 Gemini 3.7 Flash가 최고급 추론 모델들을 넘어섰다. Artificial Analysis의 AA-AnalystAgent 평가에서 Gemini 3.7 Flash(high)는 60.0%를 기록했고, Claude Opus 5는 53.8%, GPT-5.5는 50.0%에 머물렀다. 단순한 일회성 정답률이 아니라 같은 문제를 다섯 번 모두 맞힌 비율이므로, 업무 자동화에서 중요한 반복 신뢰성을 직접 겨룬 결과다.
“AA-AnalystAgent 벤치마크에서 60.0%를 기록해 1위에 올랐다.”
원문 트윗은 Gemini 3.7 Flash가 Claude Opus 5의 53.8%, GPT-5.5의 50.0%, Claude Fable 5의 48.8%, GPT-5.6 Sol의 47.5%, Grok 4.6의 41.3%를 차례로 앞섰다고 정리했다. 작성자 Dan은 프로필에서 빠른 AI 뉴스, 모델 유출 정보, 벤치마크 분석을 다룬다고 밝힌 계정이다. 이번 수치는 작성자의 자체 시험이 아니라 독립 평가기관 Artificial Analysis의 공개 리더보드를 인용한 것이다.
60.0%가 뜻하는 것
AA-AnalystAgent는 실제 업무에 가까운 스프레드시트와 문서를 바탕으로 정량 질문에 답하게 한다. 비즈니스와 과학을 포함한 14개 분야의 80개 질문을 사용하고, 모델마다 각 질문을 다섯 번씩 실행한다. 대표 지표인 pass^5는 다섯 번 모두 정답을 낸 문제의 비율이다. 한 번 우연히 맞히는 능력보다 방법 선택, 예외 처리, 계산, 근거 해석을 일관되게 반복하는 능력에 더 높은 점수를 준다.
60.0%는 80개 질문 가운데 48개를 다섯 번 연속 해결했다는 뜻이다. Claude Opus 5의 53.8%와 비교하면 약 다섯 문제에 해당하는 차이다. 반복 실패는 검토 시간과 재시도 비용으로 이어지므로, 작은 백분율 차이도 대규모 업무에서는 운영 부담을 크게 바꾼다. 특히 표 구조가 일정하지 않거나 문서마다 예외 조건이 다른 환경에서는 평균 점수보다 결과의 흔들림이 더 중요한 구매 기준이 된다.
다만 이 결과 하나로 모든 종류의 지능이나 코딩 능력을 일반화할 수는 없다. 문제와 정답은 오염을 줄이기 위해 비공개이며, 특정 에이전트 하네스와 도구 구성도 순위에 영향을 줄 수 있다. 따라서 모델 자체뿐 아니라 평가 환경까지 함께 봐야 한다.
다음 확인 지점
관전 포인트는 세 가지다. 먼저 Gemini 3.7 Flash가 다른 독립 분석 평가에서도 같은 반복성을 유지하는지, 다음으로 실제 API 비용과 처리 시간이 60.0%의 정확도와 어떤 균형을 이루는지, 마지막으로 경쟁사가 같은 하네스에서 재평가될 때 순위가 유지되는지다. 기업 사용자는 최고 점수보다 실패 편차와 재시도 비용을 함께 측정해야 한다. Flash 계열의 이 우위가 재현된다면, 분석 에이전트의 기본 모델을 비싼 최고급 모델로 고정하던 설계가 바뀔 수 있다.
Related Articles
3주 만의 후속 모델이 코딩과 업무 자동화 성능을 두 자릿수 폭으로 끌어올렸다. FrontierCode 1.1은 34.4%에서 43.6%로 상승했고, 연말까지 출력 100만 토큰당 3.75달러다. Google AI Studio와 Android Studio에서 바로 쓸 수 있다.
Gemini 3.7 Flash가 Pro와 Ultra 두 유료 등급 전체에 배포됐다. Google은 수십 개 파일과 이메일의 관계를 찾아 하나의 문서로 만드는 다단계 작업의 추론 정확도를 높였다고 밝혔다.
936점을 모은 관심의 초점은 단순한 신모델 출시가 아니라, 3주 만의 세대 교체와 연말까지 적용되는 절반 가격이다. 코딩·문서 처리·업무 자동화 지표가 함께 올랐지만, 실제 비용과 품질은 각자의 agent workflow에서 확인해야 한다.