GuppyLM, 언어 모델을 쉽게 풀어낸 8.7M 파라미터 Show HN 프로젝트
Hacker News의 Show HN에서 주목받은 GuppyLM은 60K 합성 대화 데이터와 단순한 transformer 구조로 LLM 학습 전 과정을 드러낸다. Colab과 브라우저에서 바로 실행할 수 있는 교육용 초소형 모델이라는 점이 핵심이다.
원문: Show HN: I built a tiny LLM to demystify how language models work 원문 보기 →
최근 Hacker News Show HN 글에서 소개된 GuppyLM은 LLM을 거대한 블랙박스로 보지 않게 만드는 데 초점을 둔 프로젝트다. 저장소 설명은 분명하다. Colab 노트북 하나와 짧은 PyTorch 코드만으로 데이터 생성, tokenizer 준비, 모델 학습, 추론, 브라우저 실행까지 한 번에 보여주겠다는 것이다.
모델 자체도 의도적으로 단순하다. GuppyLM은 8.7M parameters, 6 layers, hidden size 384, attention heads 6, BPE vocab 4,096, context window 128 tokens로 구성된 vanilla transformer다. 작성자는 60개 주제에 걸친 60,000개의 synthetic conversations를 바탕으로 처음부터 학습했다고 설명한다. 결과물은 물, 먹이, 빛, 수조 생활만 이해하는 작은 물고기 캐릭터이지만, 바로 그 제약이 모델 구조를 읽기 쉽게 만든다.
흥미로운 부분은 성능 경쟁이 아니라 관찰 가능성이다. README는 왜 GQA, RoPE, SwiGLU, early exit 같은 최신 기법을 넣지 않았는지까지 설명한다. 목적은 복잡한 최적화가 아니라 transformer의 핵심 루프를 최대한 직접적으로 보여주는 데 있기 때문이다. 저장소에는 데이터 생성기, 학습 루프, inference 코드, ONNX export, 그리고 quantized model을 WebAssembly로 로컬 실행하는 브라우저 데모까지 포함돼 있다.
왜 HN에서 반응했나
교육용 LLM 프로젝트는 많지만, 실제로 손으로 뜯어볼 수 있게 패키징된 사례는 많지 않다. GuppyLM은 Colab에서 바로 돌려볼 수 있고, 브라우저에서도 서버 없이 실행된다. 덕분에 애플리케이션 개발자도 tokenization, short context, small-model behavior를 거대한 연구 환경 없이 직접 체감할 수 있다.
- 학습 목표는 single T4 GPU에서 약 5분 안에 끝나는 재현 가능한 파이프라인이다.
- 배포 목표는 약 10 MB 수준의 quantized ONNX model을 브라우저에서 로컬 추론하는 것이다.
- 대가로 얻는 것은 범용 능력이 아니라 transparency와 reproducibility다.
GuppyLM은 실사용 assistant를 표방하지 않는다. 대신 오늘의 LLM 스택을 한 afternoon 안에 읽고, 실행하고, 수정할 수 있는 크기로 줄여 놓는다. Show HN 커뮤니티가 주목한 이유도 바로 여기에 있다.
관련 기사
Reddit가 주목한 Stanford의 공개 CS25 Transformers 강의, Spring 2026 시작
Stanford의 공개 CS25 강의는 Zoom, recordings, Discord를 통해 campus 밖까지 확장된 Transformer 연구 학습 채널로 다시 작동하고 있다.
Qwen3.8-Flash-Next 오픈소스 공개 — Qwen4 아키텍처 미리 보기
알리바바 Qwen 팀이 Qwen4 아키텍처의 초기 프리뷰인 Qwen3.8-Flash-Next를 오픈웨이트로 공개했다. 125B 파라미터(활성 6B)와 51B N-gram 임베딩을 갖추고, Qwen3.7-Plus 대비 훈련 비용 9분의 1로 코딩·에이전트 성능에서 앞서는 결과를 보였다.
GLM-5.3-Flash 공식 출시 — 중국 AI 칩으로 구동되는 멀티모달 고효율 모델
Z.ai가 GLM-5 시리즈 최초의 네이티브 멀티모달 모델 GLM-5.3-Flash를 공개했다. 320B 총 파라미터에 18B 활성 파라미터로, 태스크당 $0.045에 Claude Opus 4.8에 근접하는 코딩·에이전트 성능을 제공한다.