LLM X/Twitter
Gemini 영상 분석, 정확도 높이고 토큰 사용량 최대 88% 줄이는 동적 프레임 추출 도입
최신 Gemini가 영상 전체를 고정 간격으로 읽는 대신 필요한 순간의 프레임을 동적으로 골라 토큰 사용량을 최대 88% 줄였다. 정확도까지 개선됐다는 결과는 장시간 영상 에이전트의 비용과 지연시간을 함께 낮출 가능성을 보여준다. 실제 평균 절감률과 지원 모델은 아직 공개되지 않았다.
2분 소요 2 조회
태그
#video-understanding 태그가 달린 기사
최신 Gemini가 영상 전체를 고정 간격으로 읽는 대신 필요한 순간의 프레임을 동적으로 골라 토큰 사용량을 최대 88% 줄였다. 정확도까지 개선됐다는 결과는 장시간 영상 에이전트의 비용과 지연시간을 함께 낮출 가능성을 보여준다. 실제 평균 절감률과 지원 모델은 아직 공개되지 않았다.
NVIDIA는 2026년 3월 25일 Nemotron Nano 12B v2 VL이 온프레미스 video understanding을 지원하며, 자사 설명 기준으로 MediaPerf benchmark에서 30B급 대안에 가까운 성능을 더 작은 footprint로 낸다고 밝혔다. NVIDIA 모델 카드는 이를 multi-image reasoning, video understanding, visual Q&A, summarization을 위한 상용 가능 멀티모달 모델로 소개한다.