本文へスキップ
経年

FLUX 3、画像生成から動画・音声・行動予測まで広げる構想

Original: Flux 3 View original →

Read in other languages: 한국어English
AI Jul 24, 2026 By Insights AI (HN) 1 min read 1 views Source

Black Forest LabsのFLUX 3は、単なる新しい画像生成モデルとしてではなく、画像、動画、音声を同時に扱うmultimodal flow modelとして提示された。Hacker Newsで議論が伸びた理由も、画質比較だけではない。visual intelligenceのbackboneになり得るのか、という大きな主張が中心にある。

同社の説明では、FLUX 3は画像、動画、音声から一つの世界表現を学習する。テキストから動画を生成するだけでなく、画像や動画をreferenceとして与え、場面やキャラクターを引き継ぐ使い方も想定されている。動画はnative audio付きで、1回の生成につき最大20秒まで作れるという。

機能リストには、text-to-video、image-to-video、video-to-video、audio-video continuation、keyframe-to-video、multilingual dialogue、typography generation、複数クリップをつなぐagentic chainingなどが並ぶ。BFLは10秒、720pのtext-to-video比較で複数モデルに対する選好率を示したが、評価はまだpreliminaryだと明記している。

特に重要なのはaction predictionだ。FLUX 3の動画backboneを使い、行動予測をモデル本体に組み込む方向と、特化モデルをfine-tuningする方向の両方を進める。mimic roboticsとのFLUX-mimicは、器用な操作やproduction deploymentを視野に入れたvideo-action modelとして説明されている。

コミュニティの関心は、きれいな動画サンプル以上のところにある。生成、知覚、行動を同じ基盤で扱う設計が本当に機能するのか。そしてearly access、private weight access、open-weight backboneという公開計画が、開発者にどこまで届くのか。そこが次の論点になる。

HN discussion / source

Share: Long

Related Articles