注目点はサンプルの見栄えだけではなく、生成と行動予測を同じmultimodal backboneに載せるという設計思想にある。
#video-generation
RSSフィード議論は、研究上の有用性と悪用への不安に分かれた。NEvoは視覚脳のdigital twinを報酬モデルのように使い、対象領域の予測活性を最大化するAI生成動画を探索する。
MetaはMuse ImageをMeta AI、meta.ai、米国のInstagram Stories、一部国のWhatsAppに投入した。検索、コード実行、自己修正、Content Sealを備えた画像生成がソーシャル面に入る点が大きい。
NVIDIA ResearchのMOTIVEは、video modelのfine-tuningで動きを改善するclipを特定する手法だ。ICML 2026で評価され、base modelに対して74.1%のhuman preferenceを示した。
Meituan LongCat TeamがLongCat-Video-Avatar 1.5を公開した。Hugging FaceにはMITライセンス、Diffusers利用例、音声・画像・テキストから動画を作るタグが並ぶ。
Google DeepMindはGoogle I/O 2026にて、テキスト・画像・音声・動画などあらゆる入力から動画を生成するGemini Omniを発表した。GeminiのインテリジェンスとGoogleのメディア生成システムを統合し、GeminiアプリやYouTube Shortsで即日利用可能だ。
GoogleがI/O 2026(5月19日)で「世界モデル」Gemini Omniを発表した。Sora・Runwayなど既存のAI動画生成ツールと異なり、物理環境の因果関係を理解した上で自然言語の指示に応じてシーンを編集できる。VeoをGeminiアプリで置き換え、同日から提供開始となった。
NVIDIA Labsが、最大1分・720p解像度の動画を生成できる2.6Bパラメータのオープンソース世界モデル「SANA-WM」を公開した。比較的小さなモデルサイズとオープンソース公開が動画生成研究のアクセシビリティを高める。
Googleの未発表ビデオ生成モデル「Omni」と見られる映像が流出し、r/singularityで1,300票以上を集めた。既存モデルの弱点だったテキストレンダリングの一貫性が大幅に改善されているとして注目された。
Google は Veo 3.1 Lite を、自社で最も cost-effective な video generation model として発表した。Veo 3.1 Fast の 50% 未満のコストで同じ speed を提供し、paid tier の Gemini API と Google AI Studio を通じて高ボリュームの video app 開発を狙う。
Redditで広がったNetflixのVOIDは、videoからobjectだけでなく、そのobjectが生んだinteractionまで除去しようとするopen research modelだ。CogVideoXベースの2-pass pipeline、Gemini+SAM2によるmask生成、40GB+ VRAM要件が技術的な核心になっている。
Together AIは2026年4月3日、Alibaba CloudのWan 2.7を自社platformに導入すると発表した。併せて公開された製品記事では、text-to-videoを今すぐ提供し、image-to-video、reference-to-video、video editを同じAPI・認証・課金面に広げていく方針を示している。