DeepSeek, 멀티모달 API 출시 — V4 Flash Vision Exp, Opus 4.8에 근접
DeepSeek, 멀티모달 API 서비스 시작
DeepSeek이 2026년 8월 21일 V4-Flash-Vision-Exp를 공개하며 멀티모달 API 서비스를 시작했다. V4 Flash 아키텍처를 기반으로 이미지 이해 능력을 추가한 실험적 모델로, 텍스트 성능을 그대로 유지하면서 이미지·차트·문서 분석 기능을 더했다.
아키텍처와 성능
V4-Flash-Vision-Exp는 총 284B 파라미터 규모의 희소 MoE(Mixture-of-Experts) 구조로, 추론 시 13B 파라미터만 활성화된다. 컨텍스트 윈도우는 1,048,576 토큰이며 이미지는 최대 384 토큰으로 처리된다.
텍스트 전용 작업(에이전트, 추론, 세계 지식)에서 V4 Flash와 동일한 성능을 유지하면서 멀티모달 에이전트 벤치마크에서는 Claude Opus 4.8에 근접한 수준을 기록했다.
가격과 활용 분야
입력 토큰 기준 $0.14/M(캐시 미스), 출력 $0.28/M으로 V4 Flash와 동일한 가격 정책을 적용한다. 문서·차트 이해, 시각적 질의응답, 텍스트와 이미지를 교차하는 멀티모달 에이전트 워크플로에 적합하다. 자세한 내용은 DeepSeek API 문서에서 확인할 수 있다.
Related Articles
OpenRouter에 익명으로 공개돼 각종 벤치마크 상위권을 차지한 오픈소스 모델 Ox Alpha가 GLM 시리즈를 만든 중국 AI 연구소 Z.AI의 작품으로 밝혀졌다. 코딩·장기 에이전트·멀티모달 워크플로 특화 설계가 특징이다.
실제 스프레드시트·문서를 다루는 독립 평가에서 Gemini 3.7 Flash가 60.0%를 기록해 Claude Opus 5의 53.8%를 6.2%포인트 앞섰다. 빠른 Flash 계열이 최고급 모델보다 반복 정확도에서 우위를 보이면서, 분석 에이전트의 비용·속도·신뢰성 조합을 다시 따져볼 근거가 생겼다.
OpenAI가 GPT-5.2를 발표하며 400K 토큰 컨텍스트 윈도우와 AIME 2025 수학 벤치마크 100% 달성을 선보였다. GPT-5.2 Thinking 버전은 GDPval 벤치마크에서 전문가 대비 70.9% 승률을 기록했다.