인터랙티브로 배우는 MicroGPT: Karpathy의 200줄 GPT 완전 분석
growingSWE가 Andrej Karpathy의 200줄 순수 Python GPT 구현체를 인터랙티브 시각화로 풀어냈다. 토크나이저부터 softmax, 역전파, 어텐션 히트맵까지 단계별로 직접 체험할 수 있다.
카테고리
Insights의 LLM 기사
growingSWE가 Andrej Karpathy의 200줄 순수 Python GPT 구현체를 인터랙티브 시각화로 풀어냈다. 토크나이저부터 softmax, 역전파, 어텐션 히트맵까지 단계별로 직접 체험할 수 있다.
r/LocalLLaMA 커뮤니티에서 Qwen 3.5-35B-A3B 모델이 GPT-OSS-120B보다 뛰어난 성능을 보이면서도 크기는 1/3에 불과하다는 평가가 높은 공감을 얻고 있습니다.
파이낸셜 타임스가 DeepSeek V4가 다음 주 출시될 것이라고 보도했습니다. 이미지와 동영상 생성 기능을 탑재하여 미국 경쟁사에 새로운 도전장을 내밀 것으로 예상됩니다.
AI 연구자 안드레이 카르파티가 LLM 시대의 핵심 기술 과제로 메모리와 연산 자원의 최적 조합을 제시했다. 온칩 SRAM과 외부 DRAM의 트레이드오프를 이해하고 추론·훈련 워크플로우에서 최고의 처리량·지연시간·비용 효율을 달성하는 것이 현재 가장 흥미로운 기술적 과제라고 강조했다.
r/MachineLearning의 프로젝트 공유 글(점수 71, 댓글 12)은 Karpathy의 <code>Microgpt</code>에서 영감을 받은 최소 텍스트 diffusion 구현을 소개했다. 작성자는 143줄 NumPy 버전부터 413줄 PyTorch Transformer 버전까지 같은 diffusion loop를 비교 가능한 형태로 공개했다.
r/LocalLLaMA의 게시글(점수 180, 댓글 53)은 CPU/GPU 하이브리드 MoE runtime <code>Krasis</code>의 장문 벤치마크를 공유했다. 핵심 주장은 “GPU로 prefill, CPU로 decode” 분리를 통해 VRAM이 부족한 환경에서 긴 컨텍스트 응답 대기 시간을 줄일 수 있다는 점이다.
Hacker News에서 점수 732, 댓글 120을 기록한 <code>Microgpt</code> 토론은 GPT의 핵심 알고리즘을 순수 Python 단일 파일로 축약한 교육용 구현에 주목했다. 데이터셋, tokenizer, autograd, Transformer, Adam, inference까지 한 흐름으로 확인할 수 있다는 점이 핵심 평가 포인트였다.
Hacker News에서 주목받은 Context Mode는 Claude Code 도구 출력의 컨텍스트 사용량을 315 KB에서 5.4 KB로 줄였다고 보고했다.
NVIDIA는 2026년 1월 5일 Nemotron, Cosmos, Alpamayo, Isaac GR00T, Clara를 포함한 오픈 모델·데이터·도구 확장을 발표했다. 회사는 10 trillion 언어 토큰과 100 terabytes 차량 센서 데이터를 포함한 대규모 오픈 자산을 제시하며 enterprise AI 개발 속도와 배포 효율 개선을 강조했다.
Anthropic는 2026년 2월 25일 Vercept 인수를 발표하며 Claude의 computer use 기능 고도화를 목표로 제시했다. 발표문에서 Anthropic는 Sonnet 4.6의 OSWorld 지표 개선과 Vercept 외부 제품 종료 계획을 함께 언급했다.
LLmFit가 하드웨어별 실행 가능 모델을 추천하는 도구로 주목받았지만, Reddit 댓글에서는 호환성 가정과 추천 정확도 검증 필요성이 함께 제기됐다.
r/LocalLLaMA 고득점 스레드에서 Unsloth의 Qwen3.5-35B-A3B Dynamic GGUF 업데이트가 공유되며, KLD/PPL 지표와 실제 다운스트림 검증 필요성이 함께 제기됐다.