DeepSeek V4 공개 — 1조 파라미터·100만 토큰 컨텍스트 오픈 웨이트 코딩 모델
중국 AI 스타트업 DeepSeek이 음력 설날인 2월 17일 V4를 공개했다. 1조 개 파라미터, 100만 토큰 컨텍스트, mHC 아키텍처를 갖춘 오픈 웨이트 모델로 코딩 벤치마크에서 Claude 3.5 Sonnet·GPT-4o를 능가한다고 주장한다.
태그
#open-source 태그가 달린 기사
중국 AI 스타트업 DeepSeek이 음력 설날인 2월 17일 V4를 공개했다. 1조 개 파라미터, 100만 토큰 컨텍스트, mHC 아키텍처를 갖춘 오픈 웨이트 모델로 코딩 벤치마크에서 Claude 3.5 Sonnet·GPT-4o를 능가한다고 주장한다.
Ollama가 2월 22일 버전 0.17을 출시해 자체 추론 엔진을 도입했다. NVIDIA GPU에서 프롬프트 처리 최대 40%, 토큰 생성 18% 향상됐으며, 개선된 멀티-GPU 텐서 병렬 처리와 AMD RDNA 4 지원도 추가됐다.
Cohere가 인도 AI 정상회의에서 70개 이상 언어를 지원하는 소형 오픈 웨이트 모델 'Tiny Aya'를 발표했다. 33.5억 파라미터로 인터넷 연결 없이도 노트북에서 구동 가능하며 MIT 라이선스로 자유롭게 활용할 수 있다.
ESP32 마이크로컨트롤러에서 단 888KB로 실행되는 Claw 기반 개인 AI 어시스턴트 'zclaw'가 공개됐습니다. Hacker News에서 161포인트를 받으며 임베디드 AI 가능성을 보여줬습니다.
CPU RAM을 우회하고 NVMe 저장장치에서 GPU로 직접 가중치를 스트리밍하는 방식으로, RTX 3090 단일 소비자용 GPU에서 700억 파라미터 Llama 3.1 모델을 실행하는 오픈소스 프로젝트가 공개됐습니다.
Andrej Karpathy가 새로운 AI 에이전트 패러다임 "Claws"를 소개했습니다. OpenClaw와 같은 시스템이 LLM 에이전트 위에서 오케스트레이션, 스케줄링, 컨텍스트, 도구 호출, 지속성을 제공하는 새로운 AI 스택 레이어입니다.
LocalLLaMA에서 높은 반응을 얻은 KittenTTS v0.8 게시물은 80M/40M/14M 모델 구성을 공유했고, Apache-2.0 라이선스와 로컬 CPU 중심 배포 가능성을 강조했다.
Hacker News 고득점 스레드는 ggml-org/llama.cpp 공지 #19759를 조명했다. ggml.ai 핵심 팀은 Hugging Face에 합류하지만, ggml/llama.cpp는 기존처럼 오픈소스·커뮤니티 중심으로 운영된다고 명시했다.
LocalLLaMA 인기 스레드에서 Kitten TTS v0.8이 주목받았다. 80M/40M/14M 오픈 모델과 CPU 구동, 25MB 미만 경량 모델이 핵심 포인트로 제시됐다.
LocalLLaMA에서 주목받은 PR #19726은 ik_llama.cpp의 IQ*_K 계열 quantization 경로를 mainline llama.cpp로 포팅하는 초안으로, CPU backend 구현과 초기 KLD 비교를 함께 제시했다.
Hacker News에서 높은 반응을 얻은 Step 3.5 Flash는 196B total parameter와 약 11B active parameter를 내세운 MoE foundation model로 소개됐으며, 256K context와 coding/agent benchmark 수치를 함께 공개했다.
NVIDIA는 2026년 2월 12일, Baseten·DeepInfra·Fireworks AI·Together AI가 Blackwell 기반 추론 스택으로 token cost를 크게 낮추고 있다고 밝혔다. 발표에는 Hopper 대비 최대 10배 절감, 개별 고객사별 지연시간·비용 개선 수치가 포함됐다.