NVIDIA, 128K 컨텍스트 시대엔 커널보다 attention 구조가 병목
긴 컨텍스트 모델의 속도는 학습 전 attention 설계에서 사실상 결정된다. NVIDIA는 4K에서 128K로 갈수록 attention 비중이 18%에서 85%까지 커진다고 설명했다.
원문: NVIDIA says attention design now sets long-context serving speed 원문 보기 →
긴 컨텍스트 추론의 한계가 모델 구조로 이동
128K 같은 긴 컨텍스트가 일반화되면, 추론 속도는 단순히 더 빠른 커널을 붙이는 문제로 끝나지 않는다. NVIDIA AI는 2026년 8월 3일 X에서 장문맥 모델의 serving speed가 학습 시작 전 attention 설계에 크게 좌우된다고 적었다.
A long-context model's serving speed is largely decided before training starts.
연결된 NVIDIA Technical Blog는 DeepSeek-R1 예시에서 4K, 32K, 128K 컨텍스트로 갈수록 attention이 prefill 시간에서 차지하는 비중이 18%에서 85%로 상승한다고 설명한다. 글은 dense attention 성능을 group size, head dimension, KV-cache 크기, 병렬화 전략이라는 네 가지 축으로 분석한다. 특히 decode 단계에서는 KV cache를 HBM에서 읽는 비용이 커져 memory-bound가 되며, group size를 키우면 KV head 수가 줄어 토큰당 읽는 데이터가 감소한다.
NVIDIA 계정은 GPU, 추론 최적화, 모델 공동설계 관련 글을 주로 다루는 채널이다. 이번 트윗의 의미는 모델을 다 만든 뒤 serving만 최적화하는 방식의 한계를 짚었다는 데 있다. 블로그는 head dimension을 128 또는 256으로 맞추고, 유효 KV 상태를 줄이며, KV head 수에 맞춰 tensor parallelism, attention data parallelism, KV parallelism을 선택하라고 권한다.
다음 관전점은 이 체크리스트가 Nemotron 3 같은 NVIDIA 모델뿐 아니라 공개 장문맥 모델의 설계에도 반영되는지다. 128K 이상 컨텍스트에서 사용자 체감 속도를 높이려면, attention의 모양 자체가 제품 성능의 일부가 된다. Source tweet
관련 기사
LLM이 직접 고르는 attention 범위, KV cache 읽기 절반으로
긴 문맥 전체를 매 토큰마다 훑지 말고 모델이 필요한 구간을 직접 선언하게 하자는 단순한 발상이 연구자들의 눈길을 끌었다. Declarative Attention은 기존 모델을 재학습하지 않고도 총 attention 대상 토큰을 최대 52.0% 줄였지만 정확도 손실과 실제 지연 시간 검증이 과제로 남는다.
LocalLLaMA가 본 NVIDIA gpt-oss-puzzle-88B, gpt-oss-120b를 더 싸게 서빙하려는 88B 재설계
2026년 3월 26일 NVIDIA의 `gpt-oss-puzzle-88B` 모델 카드를 링크한 r/LocalLLaMA 글은 크롤링 시점 기준 284 points와 105 comments를 기록했다. NVIDIA는 이 88B MoE 모델이 Puzzle post-training NAS 파이프라인으로 파라미터와 KV-cache 부담을 줄이면서도 reasoning 정확도를 부모 모델 수준으로 유지하거나 소폭 높인다고 설명한다.
NVIDIA, multi-agent AI용 Nemotron 3 Super 공개
NVIDIA AI Developer는 2026년 3월 11일 Nemotron 3 Super를 공개하며, 12B active parameters를 사용하는 오픈 120B-parameter hybrid MoE 모델과 native 1M-token context를 강조했다. NVIDIA는 이 모델이 이전 Nemotron Super 대비 최대 5배 높은 throughput으로 agentic workload를 겨냥한다고 설명했다.