본문으로 건너뛰기

태그

#mixture-of-experts

#mixture-of-experts 태그가 달린 기사

RSS 피드
LLM 해커뉴스

DeepSeek V4, 프런티어급 성능에 1/10 가격 — 1.6조 파라미터 오픈웨이트 공개

DeepSeek이 DeepSeek-V4-Pro와 V4-Flash 두 가지 모델을 공개했다. Pro는 1.6조 파라미터(활성 49B)의 Mixture-of-Experts 구조로, 현재까지 공개된 오픈웨이트 모델 중 최대 규모다. 가격은 GPT-5.4와 Gemini 3.1 Pro 대비 절반 이하로, 비용 효율성이 핵심 차별점이다.

1분 소요 39 조회
LLM 레딧

r/LocalLLaMA가 본 NVIDIA Nemotron 3 Super 공개

NVIDIA의 Nemotron 3 Super는 120B total / 12B active hybrid Mamba-Transformer MoE, native 1M-token context, 그리고 open weights·datasets·recipes를 함께 내세운다. LocalLLaMA discussion은 이 openness와 efficiency claim이 실제 home-lab deployment로 이어질 수 있는지에 집중했다.

1분 소요 38 조회