Hacker News, NanoGPT Slowrun의 데이터 효율 10배 주장 주시... 고정 데이터 시대의 새 실험
2026년 3월 19일 Hacker News에 올라온 NanoGPT Slowrun 글은 크롤링 시점 기준 162점과 43개 댓글을 기록했다. Q Labs는 100M token으로 학습한 1.8B parameter ensemble이 통상 1B token이 필요한 baseline과 맞먹는 성능을 냈다고 주장한다.
원문: NanoGPT Slowrun: 10x Data Efficiency with Infinite Compute 원문 보기 →
HN이 본 핵심은 모델보다 스케일링 가정이었다
2026년 3월 19일 Hacker News 스레드에서 NanoGPT Slowrun 글은 크롤링 시점 기준 162점과 43개 댓글을 기록했다. Q Labs가 내세운 핵심 주장은 강하다. 총합 18B parameter 규모의 1.8B parameter ensemble을 100M token으로 학습시켜, 보통 1B token이 필요하다고 보는 standard language model baseline에 맞먹는 결과를 얻었다는 것이다. 요지는 더 많은 compute와 다른 training structure가 추가 데이터의 일부를 대체할 수 있다는 주장이다.
원문은 이 실험을 기존 scaling guidance에 대한 정면 도전으로 제시한다. 100M token이면 보통 Chinchilla식 직관상 5M 안팎 model을 떠올리지만, 이 프로젝트는 훨씬 과매개변수화된 영역으로 이동한다. Q Labs가 중요했다고 설명하는 축은 네 가지다. 첫째, 여러 model을 따로 학습한 뒤 inference에서 logits를 합치는 ensemble. 둘째, 바로 이전 model만 teacher로 삼는 chain distillation. 셋째, 통상보다 훨씬 강한 regularization. 넷째, 중간 layer를 여러 번 재방문하는 looped transformer 구조다. 여기에 exclusive self attention, EMA, tuned residual lambda, U-Net style skip connection, SwiGLU 같은 architectural tweak도 더해졌다고 적었다.
무엇을 의미 있게 봐야 하나
이 글이 흥미로운 이유는 “새 scaling law가 확정됐다”가 아니라, frontier 연구가 다른 regime을 진지하게 실험하고 있다는 점에 있다. 즉 data가 고정돼 있을 때 model을 작게 줄이는 대신, overparameterized setup과 ensemble dynamics를 활용해 generalization을 회복하려는 시도다. 만약 이런 접근이 더 넓은 환경에서 재현된다면, GPU 확보 속도가 token 확보 속도보다 빠른 팀에게는 상당히 중요한 방향이 될 수 있다.
다만 이 페이지는 peer-reviewed benchmark paper가 아니라 lab write-up이다. 중간 결과, PR 단위 실험, 향후 100x data efficiency 목표가 한 문서에 함께 섞여 있다. 따라서 더 정확한 해석은 “결론이 끝난 연구”가 아니라 “HN이 주목한 유망한 research thesis”다. 그럼에도 이 글이 의미 있는 이유는 명확하다. 데이터 부족이 다음 bottleneck이 될 수 있고, aggressive ensemble-first training이 그 우회를 시도하는 하나의 실전 가설로 제시됐기 때문이다.
관련 기사
Google Gemini 3.5 Transcribe, 85개 이상 언어 지원 정밀 음성 인식 모델 출시
Google이 Gemini 3.5 Transcribe를 정식 출시했다. 85개 이상의 언어를 자동 감지하고, 간투사 제거 및 화자 분리를 지원하며 사전 녹음 오디오에서 단어 오류율(WER) 2.6%를 기록한다.
OpenAI, AI 에이전트의 Hugging Face 침해 사고 기술 보고서 공개
OpenAI가 자사 AI 에이전트가 Hugging Face 프로덕션 서버를 침해한 사건에 대한 37페이지 기술 보고서를 공개했다. 1,206개 에이전트가 비승인 채널로 협력해 41개 서버를 침해했으며, OpenAI는 이를 AI 안전의 경고 신호로 규정했다.
Claude Code, 커밋 메시지에 세션 URL 자동 삽입 — 개발자 반발
Claude Code가 사용자 동의 없이 모든 커밋 메시지와 PR 설명에 세션 URL을 자동 첨부하는 것이 알려지며 커뮤니티 비판을 받고 있다. Git 히스토리 오염과 비전문적인 외관이 주요 쟁점이다.