확산 언어 모델 직접 만들기 — 자기회귀보다 5~10배 빠른 이유
코넬대 Kuleshov 그룹이 확산 언어 모델 구축 방법을 단계별로 설명했다. 마스킹 확산 기법을 기반으로 전체 시퀀스를 동시에 생성하며, 자기회귀 모델 대비 병렬 처리 속도가 5~10배 빠르다.
원문: How to build a diffusion language model 원문 보기 →
확산 언어 모델이란
기존 GPT 계열의 자기회귀(autoregressive) 모델이 토큰을 왼쪽에서 오른쪽으로 순차 생성하는 것과 달리, 확산 언어 모델은 초기 추정치에서 시작해 전체 시퀀스를 동시에 반복적으로 정제한다. HN에서 160점을 기록한 코넬대 Kuleshov 그룹의 튜토리얼이 그 구축 방법을 상세히 공개했다.
마스킹 확산의 핵심 원리
학습 과정은 놀랍도록 직관적이다. 무작위 비율로 토큰을 마스킹한 뒤 모델이 이를 복원하도록 훈련하는 방식으로, 연구진은 이를 "무작위 마스킹 비율을 가진 BERT"라고 표현한다.
- 순방향 과정(Forward process): 점진적으로 토큰을 마스킹해 데이터를 오염시킨다.
- 역방향 과정(Reverse process): 학습된 모델이 마스킹을 단계적으로 해제하며 완성된 시퀀스로 수렴한다.
실용적 확장 기법
- 블록 확산: 가변 길이 생성을 지원하기 위해 토큰을 설정 가능한 블록 단위로 처리한다.
- 인코더-디코더 구조: 표현 학습과 노이즈 제거를 분리해 연산 효율을 높인다.
- 오류 수정: 리마스킹(remasking) 메커니즘으로 이미 확정된 토큰도 재수정할 수 있다.
- 균일 상태 확산: 마스크 대신 무작위 어휘 항목으로 대체해 더 유연한 정제를 지원한다.
주요 장점
확산 방식의 가장 큰 강점은 병렬 생성이다. 자기회귀 모델 대비 5~10배 빠른 처리 속도를 달성하며, 내장된 오류 수정 메커니즘과 분류기 기반 제어 생성도 지원한다.
출처: Kuleshov Group Blog — How to build a diffusion language model
관련 기사
Inception Labs, 초당 1,009 토큰 처리하는 확산 기반 추론 LLM 'Mercury 2' 출시
AI 스타트업 Inception Labs가 확산(diffusion) 기반 언어 모델 Mercury 2를 공개했다. 기존 자기회귀 방식을 탈피해 병렬 정제 방식을 사용하며, 속도와 비용 양면에서 주요 경쟁사를 압도한다.
Qwen3.8-Flash-Next 오픈소스 공개 — Qwen4 아키텍처 미리 보기
알리바바 Qwen 팀이 Qwen4 아키텍처의 초기 프리뷰인 Qwen3.8-Flash-Next를 오픈웨이트로 공개했다. 125B 파라미터(활성 6B)와 51B N-gram 임베딩을 갖추고, Qwen3.7-Plus 대비 훈련 비용 9분의 1로 코딩·에이전트 성능에서 앞서는 결과를 보였다.
GLM-5.3-Flash 공식 출시 — 중국 AI 칩으로 구동되는 멀티모달 고효율 모델
Z.ai가 GLM-5 시리즈 최초의 네이티브 멀티모달 모델 GLM-5.3-Flash를 공개했다. 320B 총 파라미터에 18B 활성 파라미터로, 태스크당 $0.045에 Claude Opus 4.8에 근접하는 코딩·에이전트 성능을 제공한다.