NVIDIA MOTIVE, video model 학습 clip 선별로 74.1% 선호도 확보
Original: NVIDIA MOTIVE picks motion-critical video clips and wins 74.1% preference View original →
video generation의 병목은 더 많은 clip을 넣는 문제가 아니라 어떤 clip이 움직임을 개선하는지 고르는 문제로 좁혀지고 있다. NVIDIA AI는 7월 7일 X 게시물에서 MOTIVE가 “74.1% human preference”를 얻었다고 밝혔다. 비교 대상은 base model이며, 평가 초점은 appearance가 아니라 temporal dynamics다.
트윗의 생성 시각은 2026년 7월 7일 19:28:29 UTC다. 조회수는 약 1만2천 회로 대형 제품 출시보다 작지만, 내용은 연구 신호가 분명하다. NVIDIA AI 계정은 GPU나 플랫폼 홍보뿐 아니라 NVIDIA Research 논문, project page, ICML·NeurIPS 같은 학회 성과를 자주 공유한다. 이번 트윗도 MOTIVE project page와 연결되어 있으며, 해당 페이지는 MOTIVE를 “motion-centric, gradient-based data attribution framework”라고 설명한다.
MOTIVE의 핵심은 fine-tuning data의 기여도를 motion 기준으로 다시 계산하는 것이다. 일반적인 video model은 정적인 배경이나 외형 정보에도 많은 학습 신호를 쓴다. MOTIVE는 움직이는 영역에 학습 신호를 더 주고, 정적인 배경의 영향은 낮춘 뒤 각 clip이 motion 개선에 얼마나 영향을 주는지 점수화한다. 그 결과 작은 high-influence subset만 골라 fine-tuning해도 시간적 움직임을 더 자연스럽게 만들 수 있다는 설명이다.
다음 확인 지점은 이 방식이 어떤 base video model과 dataset에서 반복되는지, 그리고 VBench dynamics 외의 실제 제작 workflow에서도 같은 이점이 유지되는지다. ICML 2026 Oral과 Outstanding Paper Honorable Mention이라는 맥락은 학술적 신뢰도를 더하지만, 배포 관점에서는 재현 가능한 코드, dataset 선택 기준, 계산 비용이 중요하다. MOTIVE가 널리 쓰이면 video model 학습은 데이터 양 경쟁에서 clip 영향도 관리로 이동할 수 있다.
Related Articles
NVIDIA Research의 Spatial-IQ는 3D 물체 세기를 9개 하위 과제로 쪼개 모델의 실패 지점을 분리한다. 인간 정확도 82.1%에 비해 최고 범용 멀티모달 모델은 17.7%였고, Qwen2.5-VL-32B는 훈련 후 2.9%에서 62.6%로 올랐다.
지원되는 Hugging Face 모델을 ONNX 중간 변환 없이 두 명령으로 TensorRT 추론 번들로 만들 수 있게 됐다. NVIDIA의 TensorRT Model Connect는 같은 번들을 네이티브 C++ API에서 실행하며, 전체 프로젝트는 Codex 에이전트와 사람의 검토로 구축됐다.
AI 동영상 생성 스타트업 Runway가 General Atlantic 주도의 $315M 투자를 유치하며 밸류에이션이 $5.3B로 상승했다. 월드 모델 GWM-1과 Gen-4.5로 로봇·영상 생성 시장을 공략한다.