MacBook Air M5 32GB에서 37개 LLM을 비교한 LocalLLaMA 벤치마크
LocalLLaMA에 공유된 Mac LLM Bench 결과는 32GB Apple Silicon 환경에서 MoE 모델이 dense 32B 계열보다 더 나은 latency-to-capability 균형을 보일 수 있음을 시사한다. 중요한 점은 숫자 하나보다 재현 가능한 benchmark workflow 자체다.
카테고리
Insights의 LLM 기사
LocalLLaMA에 공유된 Mac LLM Bench 결과는 32GB Apple Silicon 환경에서 MoE 모델이 dense 32B 계열보다 더 나은 latency-to-capability 균형을 보일 수 있음을 시사한다. 중요한 점은 숫자 하나보다 재현 가능한 benchmark workflow 자체다.
LocalLLaMA에서 화제가 된 이 실험은 stock iMac G3에 Karpathy의 TinyStories 260K 모델을 포팅해 32 tokens를 1초 이내에 생성한다. 핵심은 tiny checkpoint와 classic Mac OS 환경에 맞춘 집요한 시스템 수정이다.
Hacker News의 Show HN에서 주목받은 GuppyLM은 60K 합성 대화 데이터와 단순한 transformer 구조로 LLM 학습 전 과정을 드러낸다. Colab과 브라우저에서 바로 실행할 수 있는 교육용 초소형 모델이라는 점이 핵심이다.
GitHub의 2026년 4월 6일 X 게시물은 Copilot cloud agent가 더 이상 pull request workflow에 묶이지 않는다고 밝혔다. GitHub changelog는 이제 agent가 PR 없이 branch에서 작업하고, implementation plan을 만들고, codebase deep research까지 수행할 수 있다고 설명한다.
Google DeepMind의 2026년 4월 2일 X 게시물은 Gemma 4를 reasoning과 agentic workflows를 겨냥한 새 open model family로 소개했다. Google은 E2B, E4B, 26B MoE, 31B Dense 구성을 공개하고 function calling, structured JSON, 긴 context window를 핵심 차별점으로 제시했다.
LocalLLaMA에 올라온 PokeClaw는 LiteRT-LM 기반으로 Gemma 4를 Android 기기에서 로컬 실행하고, tap·swipe·text input·app 실행·message 전송·auto reply 등을 cloud 없이 처리하는 open-source mobile agent prototype다.
Hacker News에 오른 Nanocode는 tokenizer training, pretraining, synthetic data generation, agentic SFT, DPO를 pure JAX와 TPU workflow로 묶어 Claude Code 스타일 coding model을 재현하려는 end-to-end open project다.
Show HN 스레드에서 주목받은 Gemma Gem은 Chrome extension 안에서 Gemma 4를 WebGPU로 직접 실행하고, page 읽기·click·type·scroll·screenshot·JavaScript 실행까지 로컬에서 처리하는 on-device browser agent다.
GitHub는 4월 5일 X post에서 Squad를 조명했다. 이 open-source 프로젝트는 GitHub Copilot 위에서 저장소 안에 미리 구성된 AI team을 초기화하며, GitHub는 thin coordinator, versioned repo file 기반 shared memory, parallel specialist agent라는 구조를 핵심 패턴으로 설명한다.
GitHub는 4월 4일 X post에서 Agentic Workflows를 다시 전면에 내세웠다. 이 technical preview는 저장소 작업을 Markdown으로 기술하고 GitHub Actions 안에서 coding agent로 실행하게 해주며, write action은 reviewable safe outputs를 거치도록 설계됐다.
LocalLLaMA의 데모 글은 Gemma 4 E2B와 Kokoro TTS를 이용해 음성·비전 대화를 전부 로컬에서 처리하는 Parlor를 소개했다. README 기준 Apple M3 Pro에서 end-to-end latency는 약 2.5~3.0초, decode speed는 약 83 tokens/sec다.
LocalLLaMA의 한 기술 글은 Gemma 4 E2B/E4B의 효율성이 Per-Layer Embeddings에서 나온다고 설명한다. 핵심 주장은 이 파라미터들이 항상 활성화되는 연산 블록이 아니라 큰 token lookup table처럼 동작하기 때문에 VRAM 부담과 추론 비용의 균형이 달라진다는 것이다.