LLM Jun 27, 2026 1 min read
Google의 새 on-device 최적화는 모델을 다시 학습하지 않고도 속도를 끌어올리는 방식이다. Pixel 9·10의 Gemini Nano v3에 frozen Multi-Token Prediction을 붙여 token 생성 50% 이상, standalone drafter 대비 130MB 절감을 제시했다.
Google의 새 on-device 최적화는 모델을 다시 학습하지 않고도 속도를 끌어올리는 방식이다. Pixel 9·10의 Gemini Nano v3에 frozen Multi-Token Prediction을 붙여 token 생성 50% 이상, standalone drafter 대비 130MB 절감을 제시했다.
반응은 “브라우저만 있으면 로컬 LLM”이라는 편의성과 WebGPU·모델 정체성에 대한 정정 사이에서 갈렸다.
구글 크롬이 사용자 동의 없이 4GB 크기의 Gemini Nano 모델 가중치를 디바이스에 자동 설치하고 있다는 사실이 밝혀졌다. 삭제해도 재설치되며, GDPR 위반 소지와 함께 수십만 톤 규모의 탄소 배출 문제까지 제기됐다.
HN은 로컬 추론, API 키 없는 흐름, 프라이버시 강화라는 장점을 바로 알아봤다. 동시에 브라우저 안 AI가 실제 제품이 되려면 저장공간과 하드웨어 요구사항부터 넘겨야 한다는 반응도 바로 붙었다.