LLM
DeepSeek V4.1-Flash, 입력 8B만 활성화…KV 캐시 HBM 4분의 1로 축소
552B MoE 모델이 입력 처리에는 8B, 출력 생성에는 16B 파라미터만 활성화한다. 이전 세대보다 KV 캐시의 HBM 요구량은 4분의 1, SSD 저장량은 8분의 1로 줄었고, DeepSeek는 기존 V4-Pro 트래픽까지 새 Flash 모델로 돌릴 계획이다.
2분 소요
태그
#v4.1-flash 태그가 달린 기사
552B MoE 모델이 입력 처리에는 8B, 출력 생성에는 16B 파라미터만 활성화한다. 이전 세대보다 KV 캐시의 HBM 요구량은 4분의 1, SSD 저장량은 8분의 1로 줄었고, DeepSeek는 기존 V4-Pro 트래픽까지 새 Flash 모델로 돌릴 계획이다.