DeepSeek V4 Pro, 프론티어 대비 17배 저렴하면서 GPT-5.2와 성능 동률
에이전트 벤치마크 FoodTruck Bench에서 DeepSeek V4 Pro가 GPT-5.2와 사실상 동등한 성능을 기록했다. GPT-5.2 테스트 대비 10주 만에, 비용은 약 17배 저렴하다.
원문: DeepSeek V4 Pro matches GPT-5.2 on FoodTruck Bench, our agentic benchmark — 10 weeks later, ~17x cheaper 원문 보기 →
FoodTruck Bench란
FoodTruck Bench는 모델이 34개 도구(위치, 가격, 재고, 직원, 날씨, 이벤트)를 통해 30일간 푸드 트럭을 운영하는 에이전트 벤치마크다. 지속적 메모리와 일별 반성이 포함된 실제 에이전트 성능을 평가한다.
결과
DeepSeek V4 Pro는 전체 4위를 기록했다. 순위는 Claude Opus 4.6, GPT-5.2, Grok 4.3에 이어 4번째다. Grok 4.3과는 결과 동점이며, GPT-5.2 중앙값 대비 오차 3% 이내다. 중국 모델 최초로 프론티어 티어에 진입했다는 점이 주목된다.
비용 측면
GPT-5.2 테스트(2월 중순) 이후 10주 만에 동등 성능 달성, 비용은 약 17배 저렴하다. 커뮤니티에서는 클라우드 API 비용 대비 로컬 모델(Qwen3.6 27B 등)로 대체 가능한 작업이 예상보다 훨씬 많다는 실측 데이터도 공유됐다.
시사점
프론티어 성능 격차가 수주~수개월 만에 좁혀지는 반면 가격 차이는 크게 유지되는 패턴이 재확인됐다. DeepSeek의 추격 속도는 프론티어 모델 업체들에 대한 가격 경쟁 압력으로 작용할 전망이다.
관련 기사
DeepSeek, 멀티모달 API 출시 — V4 Flash Vision Exp, Opus 4.8에 근접
DeepSeek이 V4 Flash의 비전 확장 버전 V4-Flash-Vision-Exp를 공개하고 멀티모달 API 서비스를 시작했다. 텍스트 성능을 유지하면서 멀티모달 에이전트 벤치마크에서 Claude Opus 4.8에 근접한 수준을 기록했다.
앤트로픽, DeepSeek·Moonshot·MiniMax의 산업 규모 모델 증류 공격 적발
앤트로픽이 중국 AI 기업들이 2만 4,000개 이상의 허위 계정으로 Claude에서 1,600만 건의 훈련 데이터를 무단 추출했다고 고발했습니다.
DeepSeek V4에 HN 폭주, 문서 링크보다 더 크게 번진 건 곧바로 뜬 가중치
HN은 이번 스레드를 단순한 모델 공개로 보지 않았다. API 문서보다 먼저 Hugging Face 가중치와 base 모델이 모습을 드러내자, 커뮤니티의 관심은 홍보보다 실물 검증으로 곧장 옮겨갔다.