DeepSeek V4 공개 — 1조 파라미터·100만 토큰 컨텍스트 오픈 웨이트 코딩 모델
중국 AI 스타트업 DeepSeek이 음력 설날인 2월 17일 V4를 공개했다. 1조 개 파라미터, 100만 토큰 컨텍스트, mHC 아키텍처를 갖춘 오픈 웨이트 모델로 코딩 벤치마크에서 Claude 3.5 Sonnet·GPT-4o를 능가한다고 주장한다.
카테고리
Insights의 LLM 기사
중국 AI 스타트업 DeepSeek이 음력 설날인 2월 17일 V4를 공개했다. 1조 개 파라미터, 100만 토큰 컨텍스트, mHC 아키텍처를 갖춘 오픈 웨이트 모델로 코딩 벤치마크에서 Claude 3.5 Sonnet·GPT-4o를 능가한다고 주장한다.
Qwen3의 TTS 모델이 목소리를 1024차원 벡터로 인코딩해 성별·음높이·감정을 수학적으로 조작하는 보이스 임베딩 기능을 지원합니다. 경량 독립형 모델로 추출돼 HuggingFace에 공개됐습니다.
스타트업 Taalas가 LLM의 가중치와 모델 아키텍처를 단일 실리콘 칩에 직접 구워, 초당 17,000 토큰 이상과 1밀리초 미만의 지연 시간을 달성했다고 주장합니다. Reddit r/singularity에서 814점을 받으며 AI 하드웨어 혁신 논의를 촉발했습니다.
Ollama가 2월 22일 버전 0.17을 출시해 자체 추론 엔진을 도입했다. NVIDIA GPU에서 프롬프트 처리 최대 40%, 토큰 생성 18% 향상됐으며, 개선된 멀티-GPU 텐서 병렬 처리와 AMD RDNA 4 지원도 추가됐다.
Google이 Gemini 3.1 Pro를 출시하며 ARC-AGI-2 벤치마크에서 77.1%를 기록했다. 이전 모델 대비 추론 성능이 2배 이상 향상되었으며, 복잡한 문제 해결을 위한 고급 추론 기능이 개발자와 일반 사용자에게 폭넓게 제공된다.
Qwen 연구팀이 GPQA와 HLE(Humanity's Last Exam) 벤치마크 데이터셋의 품질에 심각한 문제가 있음을 공식 논문을 통해 확인했습니다. OCR 오류, 잘못된 정답, 검증 불가능한 문항들이 포함돼 있어 현재 AI 모델 평가의 신뢰성에 의문이 제기되고 있습니다.
한 사용자가 Gemini 3.1 Pro와의 몇 시간 대화만으로 완전히 플레이 가능한 우주 탐험 게임을 만들어냈습니다. 퍼포먼스 최적화, 사운드트랙 생성, UI 디자인 등 모든 과정을 자연어 지시만으로 완성했으며, 최종 결과물은 약 1,800줄의 HTML 코드로 구성됐습니다.
Google DeepMind가 Gemini 3.1 Pro를 출시했다. 전작 대비 추론 성능이 2배 이상 향상됐으며 ARC-AGI-2에서 77.1%를 달성했다. 18개 추적 벤치마크 중 12개에서 1위를 기록하면서 API 가격은 $2/$12로 그대로 유지된다.
스타트업 타알라스(Taalas)가 Llama 3.1 8B 모델의 가중치를 실리콘에 물리적으로 새긴 ASIC 칩을 출시했습니다. 초당 17,000 토큰을 생성하며 GPU 기반 시스템 대비 10배 빠르고 10배 저렴하며 10배 적은 전력을 소비합니다.
Cohere가 인도 AI 정상회의에서 70개 이상 언어를 지원하는 소형 오픈 웨이트 모델 'Tiny Aya'를 발표했다. 33.5억 파라미터로 인터넷 연결 없이도 노트북에서 구동 가능하며 MIT 라이선스로 자유롭게 활용할 수 있다.
바이트댄스가 음력 설을 앞두고 Doubao 2.0을 출시했다. AIME 2025 98.3점, Codeforces 3020 등 주요 벤치마크에서 GPT-5.2와 비슷한 성능을 주장하면서도 가격은 서구 경쟁사 대비 약 10분의 1에 불과하다.
Claude Opus 4.6이 METR의 소프트웨어 작업 벤치마크에서 50% 완료 시간 기준으로 약 14.5시간을 달성해 모든 예측을 뛰어넘었습니다. 배가 시간이 3개월 미만으로 측정되며 AI 역량이 지수적으로 성장하고 있음을 보여줍니다.