DeepSeek 시각 토큰 추론, LocalLLaMA가 더 크게 반응한 건 아이디어와 삭제 타이밍
LocalLLaMA가 크게 반응한 건 DeepSeek가 점과 박스를 추론 단위로 끌어올렸기 때문이다. 저장소가 곧바로 비공개로 바뀌면서 관심은 더 커졌다.
태그
#deepseek 태그가 달린 기사
LocalLLaMA가 크게 반응한 건 DeepSeek가 점과 박스를 추론 단위로 끌어올렸기 때문이다. 저장소가 곧바로 비공개로 바뀌면서 관심은 더 커졌다.
이 사안이 커진 이유는 모델 복제 논쟁이 더 이상 로비 문서와 기업 간 공방에 머물지 않기 때문이다. Reuters는 4월 26일 미국 국무부가 전 세계 외교 공관에 DeepSeek를 포함한 중국 AI 기업의 증류 의혹을 외국 정부에 설명하라고 지시했다고 보도했다.
캐시 적중 요금은 장문 컨텍스트 제품의 원가를 좌우하기 때문에 이번 인하는 파급력이 크다. DeepSeek는 전체 API 시리즈의 입력 캐시 가격을 기존의 10분의 1로 낮췄고 V4-Pro 75% 할인도 유지한다고 적었다.
중요한 점은 model launch의 성패가 가중치보다 serving과 training 지원에서 갈린다는 데 있다. LMSYS는 Day-0 stack이 B200에서 199 tok/s, H200에서 266 tok/s를 기록했고 900K context에서도 흐름이 유지된다고 적었다.
중요한 점은 open model 진영에서 긴 context와 실제 배포용 구성을 함께 내놓는 경우가 드물다는 데 있다. DeepSeek는 1M context, 1.6T·49B Pro, 284B·13B Flash라는 숫자를 한 번에 제시했다.
HN은 이번 스레드를 단순한 모델 공개로 보지 않았다. API 문서보다 먼저 Hugging Face 가중치와 base 모델이 모습을 드러내자, 커뮤니티의 관심은 홍보보다 실물 검증으로 곧장 옮겨갔다.
LocalLLaMA가 반긴 건 또 하나의 성능표가 아니라, MoE 배관을 실제로 더 빠르게 돌릴 수 있는 공개 인프라였다. 댓글도 DeepSeek가 내부 성과를 묶어두지 않고 통신·커널 작업을 밖으로 내놓는 데 꽂혔다.
DeepSeek R1 모멘트 이후 13개월 동안 로컬 AI 실행 환경이 얼마나 빠르게 발전했는지를 보여주는 놀라운 비교: $6,000짜리 서버에서 겨우 5 TPS로 실행되던 프론티어 모델이, 이제 $600 미니 PC에서 같은 속도로 훨씬 강력한 모델을 실행할 수 있다.
파이낸셜 타임스가 DeepSeek V4가 다음 주 출시될 것이라고 보도했습니다. 이미지와 동영상 생성 기능을 탑재하여 미국 경쟁사에 새로운 도전장을 내밀 것으로 예상됩니다.
r/LocalLLaMA에서 화제가 된 DualPath 논문은 KV-Cache 로딩 경로를 분리해 I/O 병목을 완화하는 시스템 설계를 제안한다. arXiv 초록 기준으로 오프라인 최대 1.87배, 온라인 평균 1.96배 처리량 개선을 보고했다.
앤스로픽이 중국 AI 기업 딥시크, 문샷 AI, 미니맥스가 2만 4천 개의 허위 계정으로 클로드와 1,600만 건 이상의 대화를 생성해 모델 역량을 추출했다고 폭로했습니다. 가짜 계정 수 및 교환 횟수 모두 전례 없는 규모입니다.
Anthropic이 DeepSeek, Moonshot AI(Kimi), MiniMax 등 중국 AI 기업 3곳이 24,000개 이상의 허위 Claude 계정을 생성하고 1,600만 건의 대화에서 훈련 데이터를 무단 추출(distillation)했다고 고발했습니다. Wall Street Journal이 보도한 이번 사건은 AI 업계의 지식재산권 논쟁에 새로운 국면을 열었습니다.