Gemini 3.5 Flash GA, Google Search까지 agent 표면으로 확장
Google I/O 2026의 핵심은 Gemini를 앱 안의 챗봇보다 넓은 실행 계층으로 밀어 올리는 흐름이다. Gemini 3.5 Flash는 API와 Antigravity, Search, Gemini app에 풀렸고, Gemini Omni는 video 생성과 편집을 전면에 세웠다.
카테고리
Insights의 LLM 기사
Google I/O 2026의 핵심은 Gemini를 앱 안의 챗봇보다 넓은 실행 계층으로 밀어 올리는 흐름이다. Gemini 3.5 Flash는 API와 Antigravity, Search, Gemini app에 풀렸고, Gemini Omni는 video 생성과 편집을 전면에 세웠다.
AI coding agent 시장에서 독립 플레이어가 아직 끝나지 않았다는 신호다. Cognition은 $1B 이상을 조달해 valuation $26B를 기록했고, Devin의 run-rate revenue는 $492M까지 커졌다고 밝혔다.
Opus 4.8의 fast mode는 같은 모델을 약 2.5배 빠르게 쓰는 선택지다. Claude 계정은 이전 fast mode보다 가격을 3분의 1로 낮췄다고 밝혔다.
Claude Opus 4.8의 강점이 코딩 벤치마크를 넘어 실제 업무형 에이전트 평가로 확장됐다. Artificial Analysis는 max effort 기준 1890점을 기록해 GPT-5.5 xhigh보다 121점 앞섰다고 밝혔다.
Zai의 ZCube 사례에서 관심은 새 GPU가 아니라 같은 GPU·같은 software stack으로 throughput 15%와 first-token tail latency 40.6% 개선을 냈다는 점에 모였다.
LocalLLaMA의 관심은 “AI 도구 취약점”이라는 큰 말보다 FastAPI·Starlette 기반 agent 서버가 실제로 노출돼 있는지에 모였다.
속도만 빠른 kernel은 연구 결과까지 오염시킬 수 있다는 사례가 올라왔다. 관심은 “verifier 통과”가 실제 training 안전성을 보장하지 못한다는 점에 모였다.
새 Opus는 같은 가격, 더 싼 fast mode, Claude Code의 dynamic workflows로 논점이 좁혀졌다. 커뮤니티 반응은 “대형 발표”보다 실제 agent 작업에서 체감될 개선 폭을 따지는 쪽에 가까웠다.
Le Chat이 Vibe로 바뀌며 장시간 업무 처리와 코딩 에이전트가 같은 제품 안으로 들어왔다. 웹·모바일 Work Mode, 원격 Code Mode, VS Code 확장, CLI가 함께 열렸고 Pro는 월 $14.99부터 시작한다.
오염 없는 113개 장기 코딩 과제가 공개 벤치마크의 촘촘한 순위를 흔들었다. DeepSWE에서는 GPT-5.5가 70.0%, Claude Opus 4.7이 54.2%를 기록했다.
벤치마크 점수 경쟁의 약한 고리가 문제 자체라는 연구가 나왔다. ABA는 168개 벤치마크를 훑어 평가 과제의 25.7% 이상에서 치명적 결함을 찾았고, 필터링 뒤 SWE-bench Verified 평균 성능은 9.9% 달라졌다.
모델을 하나 고르는 시대보다, 요청마다 비용·속도·성능을 갈아타는 운영층에 돈이 몰리고 있다. OpenRouter는 주간 25조 토큰, 400개 이상 모델, 800만 명 이상 사용자라는 숫자로 $113 million Series B를 끌어냈다.