998달러로 3.8B LLM 훈련, CORE 점수보다 흥미로운 실패 기록
개인 개발자가 무작위 가중치에서 3.8B 모델을 훈련해 GPT-2의 CORE 점수를 넘어선 과정이 뜨거운 반응을 얻었다. 998달러라는 최종 비용도 눈길을 끌지만, context 길이 때문에 benchmark가 크게 왜곡된 분석이 더 실용적인 교훈을 남긴다.
원문: Training a 3.8B LLM to 0.384 CORE for $998 원문 보기 →
개인 개발자가 저녁 시간을 써서 3.848B parameter 언어 모델을 처음부터 훈련했다. 최종 run은 8대의 NVIDIA B200에서 65.3B token을 43시간 처리했고 비용은 998달러, CORE 점수는 0.384였다. 2019년 GPT-2 1.5B의 0.2565를 웃도는 결과다. HN 토론에서는 숫자 자체보다 연구소 밖에서도 모델 훈련의 시행착오를 직접 감당할 수 있게 된 비용 변화가 호응을 얻었다.
Hugo Vergnes가 공개한 실험기는 성공한 설정만 정리하지 않는다. 앞선 858M 모델은 A100 한 대에서 5.8일 동안 16.4B token을 학습했지만, PIQA에서 2019년의 GPT-2 124M보다 낮았다. cosine learning-rate schedule이 후반 30%의 계산을 사실상 낭비했고, peak learning rate가 보수적이었으며, optimizer와 dataset 선택도 발목을 잡았다는 진단이다.
최종 recipe는 warmup 뒤 학습률을 유지하고 마지막 절반에서 선형으로 낮추는 trapezoidal schedule, matrix parameter용 Muon과 나머지용 AdamW, ClimbMix dataset, FP8 연산을 조합했다. vocabulary 크기를 50,257에서 50,304로 채워 tensor core 경로를 열었고, fused linear cross-entropy로 메모리를 아껴 micro-batch를 키웠다. 1024 context run은 8대 B200에서 초당 약 48만 token을 처리해 57.3B token을 35.9시간, 820달러에 학습했다.
가장 유용한 대목은 benchmark 해부다. 1024 context 모델의 CORE는 0.338이었고 2048로 늘리자 0.384가 됐다. 그러나 품질이 전반적으로 그만큼 좋아진 것은 아니었다. SQuAD prompt는 전부, BoolQ는 99.8%가 1024 token을 넘었다. 평가 harness가 뒤쪽만 남기면서 정답 형식을 알려주는 예시가 잘렸고, SQuAD 점수는 훈련이 진행될수록 0에 가까워졌다. 2048 context에서 오른 점수의 대부분은 이 측정 문제를 완화한 결과였다. 점수표만 봤다면 놓치기 쉬운 함정이다.
값 embedding 721M개를 추가한 ablation도 단순한 승리로 끝나지 않는다. 처리 속도는 거의 같고 CORE는 좋아졌지만 parameter는 19% 늘었다. 저자는 그 이득을 약 1,200 training step, 전체 run의 5% 정도와 맞바꾼 것으로 계산했다. metric의 작은 logit 차이가 정답 경계를 넘나들며 실제 loss 변화보다 크게 보일 수 있다는 경고도 덧붙였다.
한계는 분명하다. 특정 dataset과 CORE 평가에 맞춘 단일 실험이며 learning rate, QK-norm, GQA 비율을 모두 독립적으로 검증하지 못했다. 그래도 비용표, 실패한 선택, throughput, 잘린 prompt까지 공개한 덕분에 ‘작은 LLM을 얼마에 만들 수 있나’보다 좋은 질문을 던진다. 제한된 예산에서는 모델 크기 못지않게 평가 harness와 데이터 흐름을 의심하는 일이 중요하다는 기록이다.
관련 기사
Gemini 3.8 Flash·Cyber 출시, Chrome 유효 패치 2.6배·취약점 성공률 70% 돌파
Google DeepMind이 Gemini 3.8 Flash와 보안 특화 Cyber 모델을 내놨다. Cyber는 내부 20개 언어 취약점 평가에서 성공률 70%를 넘었고, Chrome 코드에서는 대형 상용 모델보다 올바른 패치를 2.6배 더 많이 만들었다. 범용 모델의 도입 가격은 3.7과 같다.
vLLM, FP8 장문맥 정확도 13%→89% 복구… KV-cache 실전 투입 벽 낮춘다
중요한 점은 FP8 추론이 품질 붕괴를 고칠 수 있어야만 값어치를 가진다는 데 있다. vLLM는 two-level accumulation 변경으로 128k needle-in-a-haystack 정확도를 13%에서 89%까지 끌어올리면서 FP8 decode 속도 이점은 유지했다고 적었다.
GPT-6 Astra, Code Arena 웹개발 1위…Claude Fable 5.1에 35점 차
실사용형 웹개발 평가에서 GPT-6 Astra Max가 1,797점으로 새 1위에 올랐다. Claude Fable 5.1 Max를 35점, 이전 OpenAI 최고 모델 GPT-5.6 Sol을 180점 앞서면서 100만 토큰당 40달러 가격대의 성능 기준을 한 단계 끌어올렸다.