FLUX 3、画像生成から動画・音声・行動予測まで広げる構想
Original: Flux 3 View original →
Black Forest LabsのFLUX 3は、単なる新しい画像生成モデルとしてではなく、画像、動画、音声を同時に扱うmultimodal flow modelとして提示された。Hacker Newsで議論が伸びた理由も、画質比較だけではない。visual intelligenceのbackboneになり得るのか、という大きな主張が中心にある。
同社の説明では、FLUX 3は画像、動画、音声から一つの世界表現を学習する。テキストから動画を生成するだけでなく、画像や動画をreferenceとして与え、場面やキャラクターを引き継ぐ使い方も想定されている。動画はnative audio付きで、1回の生成につき最大20秒まで作れるという。
機能リストには、text-to-video、image-to-video、video-to-video、audio-video continuation、keyframe-to-video、multilingual dialogue、typography generation、複数クリップをつなぐagentic chainingなどが並ぶ。BFLは10秒、720pのtext-to-video比較で複数モデルに対する選好率を示したが、評価はまだpreliminaryだと明記している。
特に重要なのはaction predictionだ。FLUX 3の動画backboneを使い、行動予測をモデル本体に組み込む方向と、特化モデルをfine-tuningする方向の両方を進める。mimic roboticsとのFLUX-mimicは、器用な操作やproduction deploymentを視野に入れたvideo-action modelとして説明されている。
コミュニティの関心は、きれいな動画サンプル以上のところにある。生成、知覚、行動を同じ基盤で扱う設計が本当に機能するのか。そしてearly access、private weight access、open-weight backboneという公開計画が、開発者にどこまで届くのか。そこが次の論点になる。
Related Articles
Together AIは2026年4月3日、Alibaba CloudのWan 2.7を自社platformに導入すると発表した。併せて公開された製品記事では、text-to-videoを今すぐ提供し、image-to-video、reference-to-video、video editを同じAPI・認証・課金面に広げていく方針を示している。
Google DeepMindはGoogle I/O 2026にて、テキスト・画像・音声・動画などあらゆる入力から動画を生成するGemini Omniを発表した。GeminiのインテリジェンスとGoogleのメディア生成システムを統合し、GeminiアプリやYouTube Shortsで即日利用可能だ。
MetaはMuse ImageをMeta AI、meta.ai、米国のInstagram Stories、一部国のWhatsAppに投入した。検索、コード実行、自己修正、Content Sealを備えた画像生成がソーシャル面に入る点が大きい。