본문으로 건너뛰기

Gemma 4 Local Agent Stack: edge 배포와 커뮤니티 실측

9 편 2026년 4월 15일 업데이트 #gemma-4#gemma#agents#llama-cpp

현재 상황

Gemma 4 공개와 첫 주 10M downloads, RTX·DGX·Jetson 최적화, on-device agentic workflow, long context·quantization·audio 지원까지 local agent stack이 다져지는 흐름을 시간순으로 묶습니다.

최근 변화

  • 48GB GPU 대신 샤오미 폰 한 대, Reddit이 꽂힌 헤드리스 Gemma 4 서버
  • LocalLLaMA가 들썩인 Gemma-4 audio 지원, llama-server에서 STT가 바로 돈다
  • Quantized Gemma 4 31B, 메모리 절반으로 tokens/sec를 거의 두 배 끌어올리다

핵심 쟁점

낙관론: Gemma 4 Local Agent Stack: edge 배포와 커뮤니티 실측이(가) 실질적이고 누적되는 레버리지를 만들어냅니다.
신중론: Gemma 4 Local Agent Stack: edge 배포와 커뮤니티 실측의 신뢰성·비용·통제 문제는 아직 해결되지 않았습니다.

주목할 신호

  • ‘gemma-4’ 관련 모멘텀과 새로운 보도
  • ‘gemma’ 관련 모멘텀과 새로운 보도
  • ‘agents’ 관련 모멘텀과 새로운 보도

타임라인

최신
최근 전개
LLM 레딧

LocalLLaMA가 들썩인 Gemma-4 audio 지원, llama-server에서 STT가 바로 돈다

LocalLLaMA가 이 thread를 크게 띄운 이유는 local agent stack에서 가장 귀찮은 별도 음성 파이프라인 하나를 치울 수 있다는 기대 때문이다. 게시물은 llama.cpp의 llama-server가 Gemma-4 E2A와 E4A 모델로 STT를 처리할 수 있게 됐다고 전했고, 댓글은 곧바로 Whisper와 Voxtral 비교로 넘어갔다.

2분 소요 52 조회
최근 전개
최근 전개
최근 전개
LLM 해커뉴스

Hacker News가 주목한 Gemma 4 local-agent 실전기: Codex CLI를 cloud 밖으로 옮기는 법

Daniel Vaughan의 Gemma 4 실험은 “local model도 Codex CLI에서 쓸 만한 agent가 될 수 있는가”를 실제 설정값과 실패 사례까지 포함해 검증했다. 핵심은 Apple Silicon에서 Ollama를 포기하고 llama.cpp와 `--jinja`, KV cache quantization, `web_search = "disabled"` 같은 세부 설정을 맞춰야 한다는 점이다.

2분 소요 48 조회
최근 전개
LLM

Google, Gemma 4로 on-device agentic workflow 확장

Google AI Edge Team은 April 2, 2026에 Gemma 4가 Apache 2.0 license 아래서 phone, desktop, edge hardware에 multi-step agentic workflow를 가져온다고 밝혔다. 이번 발표는 open model, Agent Skills, LiteRT-LM deployment tooling을 함께 묶는다.

2분 소요 65 조회
최근 전개
최근 전개
최근 전개
공유: 긴글