본문으로 건너뛰기
부식 중

NVIDIA, 128K 컨텍스트 시대엔 커널보다 attention 구조가 병목

긴 컨텍스트 모델의 속도는 학습 전 attention 설계에서 사실상 결정된다. NVIDIA는 4K에서 128K로 갈수록 attention 비중이 18%에서 85%까지 커진다고 설명했다.

원문: NVIDIA says attention design now sets long-context serving speed 원문 보기 →

LLM X/Twitter 작성자 Insights AI (Twitter) 1분 소요 19 조회 출처

긴 컨텍스트 추론의 한계가 모델 구조로 이동

128K 같은 긴 컨텍스트가 일반화되면, 추론 속도는 단순히 더 빠른 커널을 붙이는 문제로 끝나지 않는다. NVIDIA AI는 2026년 8월 3일 X에서 장문맥 모델의 serving speed가 학습 시작 전 attention 설계에 크게 좌우된다고 적었다.

A long-context model's serving speed is largely decided before training starts.

연결된 NVIDIA Technical Blog는 DeepSeek-R1 예시에서 4K, 32K, 128K 컨텍스트로 갈수록 attention이 prefill 시간에서 차지하는 비중이 18%에서 85%로 상승한다고 설명한다. 글은 dense attention 성능을 group size, head dimension, KV-cache 크기, 병렬화 전략이라는 네 가지 축으로 분석한다. 특히 decode 단계에서는 KV cache를 HBM에서 읽는 비용이 커져 memory-bound가 되며, group size를 키우면 KV head 수가 줄어 토큰당 읽는 데이터가 감소한다.

NVIDIA 계정은 GPU, 추론 최적화, 모델 공동설계 관련 글을 주로 다루는 채널이다. 이번 트윗의 의미는 모델을 다 만든 뒤 serving만 최적화하는 방식의 한계를 짚었다는 데 있다. 블로그는 head dimension을 128 또는 256으로 맞추고, 유효 KV 상태를 줄이며, KV head 수에 맞춰 tensor parallelism, attention data parallelism, KV parallelism을 선택하라고 권한다.

다음 관전점은 이 체크리스트가 Nemotron 3 같은 NVIDIA 모델뿐 아니라 공개 장문맥 모델의 설계에도 반영되는지다. 128K 이상 컨텍스트에서 사용자 체감 속도를 높이려면, attention의 모양 자체가 제품 성능의 일부가 된다. Source tweet

공유: 긴글

관련 기사

LLM 레딧

LLM이 직접 고르는 attention 범위, KV cache 읽기 절반으로

긴 문맥 전체를 매 토큰마다 훑지 말고 모델이 필요한 구간을 직접 선언하게 하자는 단순한 발상이 연구자들의 눈길을 끌었다. Declarative Attention은 기존 모델을 재학습하지 않고도 총 attention 대상 토큰을 최대 52.0% 줄였지만 정확도 손실과 실제 지연 시간 검증이 과제로 남는다.

2분 소요 1 조회
LLM 레딧

LocalLLaMA가 본 NVIDIA gpt-oss-puzzle-88B, gpt-oss-120b를 더 싸게 서빙하려는 88B 재설계

2026년 3월 26일 NVIDIA의 `gpt-oss-puzzle-88B` 모델 카드를 링크한 r/LocalLLaMA 글은 크롤링 시점 기준 284 points와 105 comments를 기록했다. NVIDIA는 이 88B MoE 모델이 Puzzle post-training NAS 파이프라인으로 파라미터와 KV-cache 부담을 줄이면서도 reasoning 정확도를 부모 모델 수준으로 유지하거나 소폭 높인다고 설명한다.

2분 소요 53 조회
LLM X/Twitter

NVIDIA, multi-agent AI용 Nemotron 3 Super 공개

NVIDIA AI Developer는 2026년 3월 11일 Nemotron 3 Super를 공개하며, 12B active parameters를 사용하는 오픈 120B-parameter hybrid MoE 모델과 native 1M-token context를 강조했다. NVIDIA는 이 모델이 이전 Nemotron Super 대비 최대 5배 높은 throughput으로 agentic workload를 겨냥한다고 설명했다.

2분 소요 49 조회