NVIDIA, 128K 컨텍스트 시대엔 커널보다 attention 구조가 병목
Original: NVIDIA says attention design now sets long-context serving speed View original →
긴 컨텍스트 추론의 한계가 모델 구조로 이동
128K 같은 긴 컨텍스트가 일반화되면, 추론 속도는 단순히 더 빠른 커널을 붙이는 문제로 끝나지 않는다. NVIDIA AI는 2026년 8월 3일 X에서 장문맥 모델의 serving speed가 학습 시작 전 attention 설계에 크게 좌우된다고 적었다.
A long-context model's serving speed is largely decided before training starts.
연결된 NVIDIA Technical Blog는 DeepSeek-R1 예시에서 4K, 32K, 128K 컨텍스트로 갈수록 attention이 prefill 시간에서 차지하는 비중이 18%에서 85%로 상승한다고 설명한다. 글은 dense attention 성능을 group size, head dimension, KV-cache 크기, 병렬화 전략이라는 네 가지 축으로 분석한다. 특히 decode 단계에서는 KV cache를 HBM에서 읽는 비용이 커져 memory-bound가 되며, group size를 키우면 KV head 수가 줄어 토큰당 읽는 데이터가 감소한다.
NVIDIA 계정은 GPU, 추론 최적화, 모델 공동설계 관련 글을 주로 다루는 채널이다. 이번 트윗의 의미는 모델을 다 만든 뒤 serving만 최적화하는 방식의 한계를 짚었다는 데 있다. 블로그는 head dimension을 128 또는 256으로 맞추고, 유효 KV 상태를 줄이며, KV head 수에 맞춰 tensor parallelism, attention data parallelism, KV parallelism을 선택하라고 권한다.
다음 관전점은 이 체크리스트가 Nemotron 3 같은 NVIDIA 모델뿐 아니라 공개 장문맥 모델의 설계에도 반영되는지다. 128K 이상 컨텍스트에서 사용자 체감 속도를 높이려면, attention의 모양 자체가 제품 성능의 일부가 된다. Source tweet
Related Articles
대형 모델 서빙의 병목이 가중치 이동으로 좁혀졌다. NVIDIA는 ModelExpress로 DeepSeek-V4 Pro 시작 시간을 8분에서 1분 44초 수준으로 줄였다고 밝혔다.
모델 성능 경쟁이 추론 비용 경쟁으로 옮겨가고 있다. OpenAI는 GPT-5.6 Sol을 배포 뒤 자체 최적화에 투입해 서빙 비용 20% 절감, 토큰 생성 효율 15% 이상 개선을 얻었다고 밝혔다.
Kimi-K3는 단순한 모델 공개보다 운영비와 커스터마이징 가능성 때문에 HN 논의가 커졌다.