초기 상태 128개 숫자로 6,573프레임 생성…417K RNN의 Bad Apple 실험
시간 좌표도 다음 프레임 입력도 없이 0.5KB 초기 상태에서 영상 전체를 자율 생성한 소형 순환 모델이 화제다. 417,129개 파라미터와 RTX 4080 기준 200FPS를 제시했지만, 학습 중 여러 조건을 함께 바꾼 탐색적 프로젝트라는 한계도 공개했다.
태그
#video-generation 태그가 달린 기사
시간 좌표도 다음 프레임 입력도 없이 0.5KB 초기 상태에서 영상 전체를 자율 생성한 소형 순환 모델이 화제다. 417,129개 파라미터와 RTX 4080 기준 200FPS를 제시했지만, 학습 중 여러 조건을 함께 바꾼 탐색적 프로젝트라는 한계도 공개했다.
Google이 Gemini Omni 1.1 Flash를 Gemini API와 Google AI Studio에 정식 출시했다. 4K 업스케일, 첫/마지막 프레임 지정, 장면 확장 등 강화된 영상 생성·편집 기능이 추가됐으며, Video Arena에서 1위에 오른 모델이다.
알리바바가 8월 24일 WAN 3.0을 정식 공개했다. 최대 30초 1080p 영상과 음성을 한 번에 생성하며, PDF·PPT·엑셀 등 문서 파일을 영상으로 직접 변환하는 기능을 지원한다.
오픈 영상 생성 스택이 더 넓어지고 있다. MiniMax H3는 33B 파라미터 모델로 텍스트·이미지·참조 입력을 받아 4~15초 영상과 32kHz 스테레오 오디오를 생성한다.
시각 생성 모델 논의가 이미지 품질 비교를 넘어, 영상·소리·행동 예측을 같은 backbone에 넣을 수 있느냐로 옮겨갔다.
AI가 만든 영상으로 특정 시각 뇌 영역의 반응을 최대화한다는 연구에 관심과 불안이 동시에 붙었다. NEvo는 뇌의 “digital twin”을 보상 함수처럼 쓰며, 연구 도구와 superstimulus 사이의 경계를 드러낸다.
Meta가 Muse Image를 Meta AI, meta.ai, 미국 Instagram Stories, 일부 국가의 WhatsApp에 투입했다. 이미지 생성 모델이 검색·코드 실행·자기수정을 쓰고, Arena 기준 3개 이미지 작업에서 모두 2위에 오른 점이 핵심이다.
NVIDIA Research의 MOTIVE는 video model fine-tuning에서 움직임에 실제로 기여하는 clip을 골라내는 방법이다. ICML 2026 Outstanding Paper Honorable Mention을 받았고, base model 대비 74.1% human preference를 기록했다.
Meituan LongCat 팀이 음성·이미지·텍스트 기반 아바타 영상 모델 LongCat-Video-Avatar 1.5를 공개했다. Hugging Face 모델 카드는 MIT 라이선스와 Diffusers 사용 예시를 제공한다.
구글 딥마인드가 Google I/O 2026에서 텍스트·이미지·오디오·영상 등 모든 입력으로 영상을 생성하는 Gemini Omni를 공개했다. Gemini의 지능과 구글 생성형 미디어 기술의 결합으로, Gemini 앱과 YouTube Shorts를 통해 즉시 이용 가능하다.
구글이 I/O 2026 키노트(5월 19일)에서 Gemini Omni를 발표했다. Sora·Runway 등 기존 AI 영상 생성기와 달리 물리 환경의 인과관계를 이해하는 '세계 모델'로, 자연어 명령만으로 배경·조명·카메라 앵글을 실시간 수정하는 대화형 편집이 핵심이다. 발표 당일 Veo를 대체해 Google AI 구독자에게 즉시 제공됐다.
NVIDIA 연구팀이 최대 1분 길이의 720p 해상도 영상을 생성할 수 있는 2.6B 파라미터 오픈소스 월드 모델 SANA-WM을 공개했다. 상대적으로 작은 모델 크기와 오픈소스 공개가 특징이다.