Google I/O 2026: Gemini 3.5 Flash 공개 — 플래그십 성능에 Flash 속도
Google이 I/O 2026에서 Gemini 3.5 Flash를 GA 출시했다. Gemini 3.1 Pro를 코딩·에이전트 벤치마크에서 능가하면서도 출력 속도는 4배 빠르고 비용은 40% 저렴하다.
태그
#benchmark 태그가 달린 기사
Google이 I/O 2026에서 Gemini 3.5 Flash를 GA 출시했다. Gemini 3.1 Pro를 코딩·에이전트 벤치마크에서 능가하면서도 출력 속도는 4배 빠르고 비용은 40% 저렴하다.
Anthropic과 PwC가 전략적 제휴를 확대해 Claude Code와 Cowork를 미국팀 시작으로 글로벌 전체에 배포하며, 3만 명 인증 과정과 공동 AI 센터를 설립한다. 보험 인수 주기는 10주에서 10일로 단축됐다.
DELEGATE-52 연구에 따르면 Gemini 3.1 Pro, Claude 4.6 Opus, GPT 5.4 등 최첨단 LLM도 긴 위임 워크플로우에서 문서 내용의 평균 25%를 조용히 손상시킨다.
에이전트 벤치마크 FoodTruck Bench에서 DeepSeek V4 Pro가 GPT-5.2와 사실상 동등한 성능을 기록했다. GPT-5.2 테스트 대비 10주 만에, 비용은 약 17배 저렴하다.
동일한 어드민 패널 작업을 비전 에이전트와 구조화된 API 에이전트로 비교한 결과, 비전 방식이 약 45배 비쌌다. 비전 에이전트는 상세 가이드 없이 작업 완료에도 실패했다.
Poolside AI가 4월 28일 첫 오픈 웨이트 모델 Laguna XS.2를 Apache 2.0으로 공개했다. 33B/3B 활성 MoE 구조로 단일 GPU에서 구동 가능하며, SWE-bench Verified 68.2%로 에이전틱 코딩 특화 모델에서 최상위권이다.
Mistral이 128B 파라미터 오픈 웨이트 모델 Mistral Medium 3.5를 4월 29일 공개했다. 기존 Medium, Magistral, Devstral 2를 하나로 통합했으며, SWE-bench Verified 77.6%를 기록했다.
OpenAI가 ChatGPT 기본 모델을 GPT-5.5 Instant으로 교체했다. 의료·법률·금융 등 고위험 분야에서 환각 오류가 52.5% 줄었고, 응답 길이도 30.2% 단축됐다.
하버드 의대와 Beth Israel Deaconess가 Science에 게재한 연구에서 OpenAI o1 모델이 실제 응급실 케이스 76건 중 67%를 정확히 진단했다. 두 내과 전문의의 정확도(55%, 50%)를 웃도는 결과다.
AGI 수준 평가 벤치마크 ARC-AGI-3에서 GPT-5.5 High가 0.43%, Claude Opus 4.7이 0.18%를 기록했다. 최강 모델들도 이 벤치마크 앞에서는 사실상 제로에 수렴한다.
LocalLLaMA 댓글은 토큰 속도보다 끝까지 굴러가는 결과물에 더 민감했다. 같은 MacBook Pro M5 Max에서 Qwen 3.6 27B는 더 길고 빠르게 썼지만, Gemma 4 31B는 훨씬 적은 토큰으로 게임 로직과 상호작용을 먼저 정리했다.
AI의 바이오 역량 논쟁에 처음으로 꽤 단단한 숫자가 붙었다. Anthropic은 Claude를 실제 생물 데이터 기반 99문항에 투입했고, 전문가도 막힌 23문항 가운데 최근 모델이 약 30%를 풀었다고 적었다.