Gemini 영상 분석, 정확도 높이고 토큰 사용량 최대 88% 줄이는 동적 프레임 추출 도입
최신 Gemini가 영상 전체를 고정 간격으로 읽는 대신 필요한 순간의 프레임을 동적으로 골라 토큰 사용량을 최대 88% 줄였다. 정확도까지 개선됐다는 결과는 장시간 영상 에이전트의 비용과 지연시간을 함께 낮출 가능성을 보여준다. 실제 평균 절감률과 지원 모델은 아직 공개되지 않았다.
Insights
기사 76개
최신 Gemini가 영상 전체를 고정 간격으로 읽는 대신 필요한 순간의 프레임을 동적으로 골라 토큰 사용량을 최대 88% 줄였다. 정확도까지 개선됐다는 결과는 장시간 영상 에이전트의 비용과 지연시간을 함께 낮출 가능성을 보여준다. 실제 평균 절감률과 지원 모델은 아직 공개되지 않았다.
Google이 Gemini Omni 1.1 Flash를 Gemini API와 Google AI Studio에 정식 출시했다. 4K 업스케일, 첫/마지막 프레임 지정, 장면 확장 등 강화된 영상 생성·편집 기능이 추가됐으며, Video Arena에서 1위에 오른 모델이다.
알리바바가 8월 24일 WAN 3.0을 정식 공개했다. 최대 30초 1080p 영상과 음성을 한 번에 생성하며, PDF·PPT·엑셀 등 문서 파일을 영상으로 직접 변환하는 기능을 지원한다.
Z.ai가 GLM-5 시리즈 최초의 네이티브 멀티모달 모델 GLM-5.3-Flash를 공개했다. 320B 총 파라미터에 18B 활성 파라미터로, 태스크당 $0.045에 Claude Opus 4.8에 근접하는 코딩·에이전트 성능을 제공한다.
DeepSeek이 V4 Flash의 비전 확장 버전 V4-Flash-Vision-Exp를 공개하고 멀티모달 API 서비스를 시작했다. 텍스트 성능을 유지하면서 멀티모달 에이전트 벤치마크에서 Claude Opus 4.8에 근접한 수준을 기록했다.
댓글의 관심은 크기보다 방식에 모였다. 고정 분류표 대신 정책을 자연어 질문으로 넣는 moderation 모델이다.
Mistral의 Shieldstral은 3B급 공개 가중치 안전 분류기를 텍스트와 이미지 moderation에 투입한다. Hugging Face 모델 카드 기준 32k 컨텍스트와 Apache 2.0 라이선스를 제공한다.
LLM 평가가 짧은 프롬프트 그림 생성에서 장시간 실행 코드 생성으로 넓어지고 있다. Karpathy는 Opus 5가 약 $10의 1M 토큰 예산과 2시간 실행으로 5,500줄 Three.js 코드를 만들었다고 전했다.
2.4T MoE 모델이 공개 가중치까지 예고하면서 폐쇄형 코딩 모델의 가격 기준이 압박받는다. Qwen은 Qwen3.8-Max 입력 $2, 출력 $6/M 토큰과 1M 컨텍스트를 함께 제시했다.
NVIDIA Research의 Spatial-IQ는 3D 물체 세기를 9개 하위 과제로 쪼개 모델의 실패 지점을 분리한다. 인간 정확도 82.1%에 비해 최고 범용 멀티모달 모델은 17.7%였고, Qwen2.5-VL-32B는 훈련 후 2.9%에서 62.6%로 올랐다.
NVIDIA AI가 Thinking Machines의 Inkling-Small NVFP4 체크포인트를 공개적으로 가리키며 오픈 가중치 멀티모달 모델 경쟁에 새 선택지가 추가됐다. Hugging Face 메타데이터는 Apache-2.0, MoE, 이미지·오디오 입력 태그와 25,000회 이상 다운로드를 보여준다.
시각 생성 모델 논의가 이미지 품질 비교를 넘어, 영상·소리·행동 예측을 같은 backbone에 넣을 수 있느냐로 옮겨갔다.