Google의 새 Gemini Flash 라인업에서 관심은 모델 이름보다 토큰 효율과 agent workflow 비용에 모였다. 3.6 Flash는 3.5 Flash보다 출력 토큰을 17% 줄였고, Cyber 모델은 CodeMender와 묶였다.
agentic RL 학습의 병목은 모델 계산보다 환경 대기 시간인 경우가 많다. Google Tunix는 asynchronous rollout과 producer-consumer pipeline으로 TPU idle time을 줄이는 JAX-native post-training library를 전면에 세웠다.
AI 생성물 출처 표시가 실험 단계를 넘어 대규모 배포로 이동했다. Google은 SynthID가 이미지와 영상 1000억 건, 오디오 6만 년 분량에 워터마크를 적용했고 검증은 5000만 회를 넘었다고 밝혔다.
Google의 개인 AI 에이전트가 Mac, MCP, 5개 외부 앱 연결로 확장된다. Canva, Dropbox, Instacart, OpenTable, Zillow Rentals까지 붙으면서 Spark는 챗봇보다 작업 실행 도구에 가까워졌다.
Google의 새 on-device 최적화는 모델을 다시 학습하지 않고도 속도를 끌어올리는 방식이다. Pixel 9·10의 Gemini Nano v3에 frozen Multi-Token Prediction을 붙여 token 생성 50% 이상, standalone drafter 대비 130MB 절감을 제시했다.
Google 지원을 받은 UC San Diego 연구진이 퇴역 스마트폰 메인보드를 모아 저탄소 클라우드 컴퓨팅 플랫폼을 만든다. 계획된 2,000대 Pixel 클러스터는 수업·채점·연구 워크로드를 처리하며, 25~50대가 현대 서버 1대급 역할을 맡는 구조다.
피부 증상을 검색어로 설명하기 어려운 사람에게 AI가 단순 진단 후보를 넘어 다음 행동 판단까지 도움을 줄 수 있다는 대규모 실험 결과가 나왔다. Google Research는 JAMA Dermatology 논문과 CHI 연구를 묶어, 2,345명 규모 평가에서 AI 기반 정보 도구의 효과와 한계를 함께 제시했다.
Google DeepMind가 26B MoE open model DiffusionGemma를 공개했다. 256-token 블록을 병렬로 다듬는 text diffusion 방식으로 전용 GPU에서 최대 4x 빠른 생성을 노린다.
검색 AI의 오답 책임을 어디까지 물을 수 있느냐가 HN 논쟁의 중심이었다. 뮌헨 법원은 AI Overview가 단순 링크가 아니라 Google의 자체 진술이라고 봤다.
기업 RAG의 약점은 답을 모르는 것이 아니라, 필요한 근거가 다른 저장소에 흩어졌을 때 너무 일찍 멈추는 데 있다. Google Research는 충분한 문맥을 검사하고 다시 검색하는 Agentic RAG로 factuality 데이터셋 정확도를 최대 34% 높였다고 밝혔다.
Google이 Gemma 4 QAT 체크포인트를 공개하며 엣지 장치와 소비자 GPU용 로컬 추론을 겨냥했다. 모바일 포맷 기준 Gemma 4 E2B 메모리 사용량은 1GB까지 낮아진다.
Google이 2026년 10월부터 2029년 6월까지 SpaceX에 월 $920M을 내고 약 110,000개 NVIDIA GPU와 관련 컴퓨팅 자원을 쓰기로 했다. Gemini Enterprise 수요가 예상보다 커지면서, 자체 인프라 강자인 Google도 외부 AI compute를 단기 조달한다.