NVIDIA, Nemotron Nano 12B v2 VL을 온프레미스 영상 이해용 경량 오픈 모델로 전면 배치
NVIDIA는 2026년 3월 25일 Nemotron Nano 12B v2 VL이 온프레미스 video understanding을 지원하며, 자사 설명 기준으로 MediaPerf benchmark에서 30B급 대안에 가까운 성능을 더 작은 footprint로 낸다고 밝혔다. NVIDIA 모델 카드는 이를 multi-image reasoning, video understanding, visual Q&A, summarization을 위한 상용 가능 멀티모달 모델로 소개한다.
원문: Our Nemotron Nano 12B v2 VL brings video understanding on-prem. MediaPerf benchmark launched by Coactive ranks our 12B model on par with 30B-size models at less than half the footprint: ✅ Cost Efficiency: Lowest cost for Tagging Refinement workload. ✅ Pro-Grade Quality: 0.299 F1 on real-world media tasks. ✅ Massive Throughput: 4.48 hrs video/hr - 15% faster than the leading 30B OS alternative. ✅ Sovereignty: Self-hostable, open model for every developer worldwide. ✅ Transparency: Open training datasets, techniques, and libraries. 🔗 https://mediaperf.org/ 원문 보기 →
NVIDIA가 X에서 밝힌 내용
2026년 3월 25일, NVIDIA AI Developer는 Nemotron Nano 12B v2 VL을 온프레미스 video understanding용 오픈·self-hostable 모델로 전면에 내세웠다. 게시물에서 가장 중요한 주장은 성능 대비 크기다. NVIDIA는 Coactive가 시작한 MediaPerf benchmark에서 자사 12B 모델이 절반 이하 footprint로 30B급 모델에 근접한 결과를 냈다고 설명했다.
회사는 같은 게시물에서 구체적 수치도 제시했다. NVIDIA에 따르면 이 모델은 Tagging Refinement workload에서 가장 낮은 비용을 기록했고, 실제 미디어 작업에서 0.299 F1을 달성했으며, 시간당 4.48시간 분량의 비디오를 처리했다. 또한 선두 30B 오픈소스 대안보다 약 15% 빠르다고 주장했다. 다만 이 숫자는 NVIDIA가 직접 제시한 값이므로, 실제 도입 전에는 각 조직이 자기 데이터와 하드웨어 환경에서 재검증할 필요가 있다.
공식 페이지가 추가한 정보
NVIDIA 모델 카드는 Nemotron Nano 12B v2 VL을 multi-image reasoning, video understanding, visual Q&A, summarization을 지원하는 상용 가능 멀티모달 모델로 설명한다. 같은 페이지는 이 모델이 여러 이미지와 긴 텍스트 프롬프트를 함께 처리해야 하는 document 및 media workflow를 겨냥한다고 적고 있다.
함께 연결된 MediaPerf 사이트는 moderation부터 summarization까지 실제 미디어 업무에 중요한 태스크에서 foundation model을 평가한다고 소개한다. 따라서 benchmark의 방향성 자체는 video pipeline을 구축하는 고객에게 의미가 있지만, 최종 모델 선택은 여전히 도메인별 품질 요구, 하드웨어 수급, 총소유비용 같은 요소에 달려 있다.
왜 중요한가
더 큰 신호는 NVIDIA가 작은 오픈 멀티모달 모델을 엔터프라이즈 미디어 워크플로우의 현실적 선택지로 밀고 있다는 점이다. 만약 12B 모델이 유의미한 태스크에서 30B급 결과에 가까워지면서도 self-hostable 특성을 유지한다면, privacy, sovereignty, 비용 예측성을 중시하는 조직은 자사 인프라 안에서 video와 document understanding을 더 쉽게 도입할 수 있다.
남은 쟁점은 이 benchmark 결과가 다른 데이터셋과 운영 환경에서도 유지되는지다. 그럼에도 오픈 배포 스토리, 구체적인 benchmark 수치, 상용 가능 모델 카드가 한 번에 제시됐다는 점에서 Nemotron Nano 12B v2 VL은 단순한 모델 카탈로그 업데이트보다 훨씬 실무적인 의미를 가진다.
관련 기사
Gemini 영상 분석, 정확도 높이고 토큰 사용량 최대 88% 줄이는 동적 프레임 추출 도입
최신 Gemini가 영상 전체를 고정 간격으로 읽는 대신 필요한 순간의 프레임을 동적으로 골라 토큰 사용량을 최대 88% 줄였다. 정확도까지 개선됐다는 결과는 장시간 영상 에이전트의 비용과 지연시간을 함께 낮출 가능성을 보여준다. 실제 평균 절감률과 지원 모델은 아직 공개되지 않았다.
Mistral AI, NVIDIA와 open frontier models 공동 개발… Nemotron Coalition 합류
Mistral AI는 2026년 3월 16일 NVIDIA와 frontier open-source AI models를 공동 개발하는 전략적 파트너십에 들어간다고 밝혔다. 이어진 Mistral 공식 글은 Mistral이 NVIDIA Nemotron Coalition의 founding member로 참여하며 large-scale model development와 multimodal capabilities를 제공한다고 설명한다.
NVIDIA, 256K 문맥의 30B 옴니 모델 공개… 기업형 영상 추론 처리량은 최대 9.2배
멀티모달 에이전트는 아직 비전·오디오·텍스트 모델을 따로 엮느라 비용과 지연을 치른다. NVIDIA는 Nemotron 3 Nano Omni로 30B 파라미터, 256K 문맥, 동일 반응성 기준 영상 추론 시스템 용량 최대 9.2배를 내세웠다.