LLM이 직접 고르는 attention 범위, KV cache 읽기 절반으로
긴 문맥 전체를 매 토큰마다 훑지 말고 모델이 필요한 구간을 직접 선언하게 하자는 단순한 발상이 연구자들의 눈길을 끌었다. Declarative Attention은 기존 모델을 재학습하지 않고도 총 attention 대상 토큰을 최대 52.0% 줄였지만 정확도 손실과 실제 지연 시간 검증이 과제로 남는다.
태그
#attention 태그가 달린 기사
긴 문맥 전체를 매 토큰마다 훑지 말고 모델이 필요한 구간을 직접 선언하게 하자는 단순한 발상이 연구자들의 눈길을 끌었다. Declarative Attention은 기존 모델을 재학습하지 않고도 총 attention 대상 토큰을 최대 52.0% 줄였지만 정확도 손실과 실제 지연 시간 검증이 과제로 남는다.
긴 컨텍스트 모델의 속도는 학습 전 attention 설계에서 사실상 결정된다. NVIDIA는 4K에서 128K로 갈수록 attention 비중이 18%에서 85%까지 커진다고 설명했다.
arXiv에 공개된 Δ-Mem 논문이 HN에서 142점을 기록했다. 고정 크기 온라인 메모리 상태를 통해 LLM의 장기 기억 능력을 크게 향상시키며, MemoryAgentBench에서 기준 대비 1.31배 성능 개선을 달성했다.
r/MachineLearning의 한 실험 글이 dot-product attention을 Euclidean distance 기반 RBF attention으로 바꾸며 생기는 구현 문제와 작은 성능 신호를 정리해 화제가 됐다.
2026년 3월 20일 Hacker News에서 Attention Residuals가 논의되며, 고정 residual addition 대신 learned depth-wise attention을 쓰는 접근과 낮은 overhead의 의미가 부각됐다.
Kimi Team의 AttnRes 논문은 PreNorm residual이 모든 이전 layer 출력을 고정 가중치로 더하면서 깊은 stack에서 정보 희석을 만든다고 주장한다. 해결책으로 layer 간 selective aggregation과 메모리 비용을 줄인 Block AttnRes를 제시한다.
r/MachineLearning의 인기 토론에서 Attention의 본질을 d^2 최적화 기하로 해석하는 비공식 증명 글이 공유됐다. 커뮤니티 반응은 흥미와 회의가 공존하며, 엄밀한 검증과 재현 실험의 필요성이 강조됐다.