본문으로 건너뛰기

Insights

기사

기사 7개

LLM 레딧

LLM이 직접 고르는 attention 범위, KV cache 읽기 절반으로

긴 문맥 전체를 매 토큰마다 훑지 말고 모델이 필요한 구간을 직접 선언하게 하자는 단순한 발상이 연구자들의 눈길을 끌었다. Declarative Attention은 기존 모델을 재학습하지 않고도 총 attention 대상 토큰을 최대 52.0% 줄였지만 정확도 손실과 실제 지연 시간 검증이 과제로 남는다.

2분 소요 1 조회