q8_0이면 거의 공짜라는 통념, LocalLLaMA가 깨뜨린 KV 캐시 데이터
LocalLLaMA가 반응한 이유는 단순한 수치 비교가 아니었다. 많은 로컬 추론 사용자가 사실상 상식처럼 받아들이던 규칙을 정면으로 건드렸고, 특히 Gemma 쪽에서 모델별 차이가 크다는 점을 보여 줬기 때문이다. 2026년 4월 25일 크롤링 시점 기준 스레드는 324점, 58댓글이었다.
태그
#gemma 태그가 달린 기사
LocalLLaMA가 반응한 이유는 단순한 수치 비교가 아니었다. 많은 로컬 추론 사용자가 사실상 상식처럼 받아들이던 규칙을 정면으로 건드렸고, 특히 Gemma 쪽에서 모델별 차이가 크다는 점을 보여 줬기 때문이다. 2026년 4월 25일 크롤링 시점 기준 스레드는 324점, 58댓글이었다.
r/LocalLLaMA에서 올라온 번역 실험담은 benchmark가 아니라 체감 사례지만, local model이 drift와 censorship risk를 피하는 실용적 선택지로 보인다는 커뮤니티 감각을 잘 보여 준다.
Reddit이 크게 반응한 건 또 하나의 거대한 GPU 머신이 아니라, 스마트폰을 Gemma 4 서버로 바꿔버린 실전 해킹이었다. 이 정도가 진짜 우리가 보고 싶은 로컬 AI라는 반응이 나온 이유가 분명했다.
Google DeepMind는 2026년 4월 9일 X에서 Gemma 4가 출시 첫 주 10M downloads를 넘었고 Gemma family 전체는 500M downloads를 돌파했다고 밝혔다. Google은 Gemma 4를 reasoning과 agentic workflows, 로컬 하드웨어 배치를 겨냥한 open model family로 포지셔닝하고 있다.
Show HN에 올라온 Parlor는 브라우저의 음성·카메라 입력을 Gemma 4 E2B와 Kokoro로 처리해 로컬에서 바로 음성 응답을 돌려준다. Apple M3 Pro 기준 2.5~3.0초 수준의 end-to-end latency를 공개한 점이 눈에 띈다.
Google DeepMind의 2026년 4월 2일 X 게시물은 Gemma 4를 reasoning과 agentic workflows를 겨냥한 새 open model family로 소개했다. Google은 E2B, E4B, 26B MoE, 31B Dense 구성을 공개하고 function calling, structured JSON, 긴 context window를 핵심 차별점으로 제시했다.
LocalLLaMA에 올라온 PokeClaw는 LiteRT-LM 기반으로 Gemma 4를 Android 기기에서 로컬 실행하고, tap·swipe·text input·app 실행·message 전송·auto reply 등을 cloud 없이 처리하는 open-source mobile agent prototype다.
Show HN 스레드에서 주목받은 Gemma Gem은 Chrome extension 안에서 Gemma 4를 WebGPU로 직접 실행하고, page 읽기·click·type·scroll·screenshot·JavaScript 실행까지 로컬에서 처리하는 on-device browser agent다.
LocalLLaMA의 한 기술 글은 Gemma 4 E2B/E4B의 효율성이 Per-Layer Embeddings에서 나온다고 설명한다. 핵심 주장은 이 파라미터들이 항상 활성화되는 연산 블록이 아니라 큰 token lookup table처럼 동작하기 때문에 VRAM 부담과 추론 비용의 균형이 달라진다는 것이다.
Reddit는 Google의 Gemma 4 edge 발표를 통해 on-device Agent Skills와 LiteRT-LM runtime을 주목했다. 1.5GB 미만 메모리, 128K context, Raspberry Pi 5와 Qualcomm NPU benchmark가 핵심 포인트다.
LocalLLaMA 스레드가 Gemma 4 31B의 예상 밖 FoodTruck Bench 성과를 끌어올렸다. 토론은 곧 장기 계획 능력과 benchmark 신뢰성 문제로 이어졌다.
r/artificial의 한 게시물은 Google DeepMind의 Gemma 4 공개를 가리켰고, 이 모델은 Apache 2.0 아래에서 advanced reasoning과 agentic feature를 묶어 제공한다. Google은 네 가지 크기의 family, larger model 기준 최대 256K context, 그리고 Hugging Face부터 llama.cpp까지 이어지는 day-one ecosystem support를 강조했다.