2026年8月4日(現地時間) – Black Forest Labsは、新しいマルチモーダル基盤モデル「FLUX 3」の第一弾としてテキストや画像から動画を生成できる「FLUX 3 Video」の一般提供をBFL APIおよび一部のパートナーを通じて開始しました。
FLUX について
FLUX 3は、単一のアーキテクチャ内で画像、動画、音声から共同で学習を行うマルチモーダル基盤モデルです。
Black Forest Labsによると、モデルが学習すべきなのは個別の要素を単独で取り出したものではなく、物体がどのように結びつき、どのように動き、出来事がどのように響くかといった「世界の表現」であるとされています。
画像や文字といった単一のデータ形式だけで現実のすべてを説明することは難しく、それぞれの情報は世界の一部分を捉えた「断片」に過ぎません。例えば、画像はある一瞬の見た目を切り取り、動画は時間の流れとともに物の動きや物理ルールを伝えます。また、音声は目に見えない現象や音が鳴る原因を教え、言語はそれらの感覚を指示や概念として整理する役割を果たします。
これら複数の感覚を同時に学習させることで、AIは「音が鳴るには衝撃がある」「物は重さに従って動く」「未来は過去の続きである」といった世界の基本的なルールを深く理解できるようになります。AIモデル「FLUX 3」はこの考え方をベースに作られた初のモデルであり、現実世界とデジタル空間の両方を理解して予測・行動できる「リアルワールド視覚知能」の実現に向けた大きな一歩となっています。
1つのモデルで多彩な機能を実現する「Self-Flow」
技術的な基盤として、FLUX 3は単一の共通アーキテクチャ内でマルチモーダルの生成と理解を効率的に統合するアプローチ「Self-Flow」を採用しています。この手法に基づき、計算およびデータリソースを大幅に拡充することで、動画・画像・音声の同時学習が行われました。

その結果、FLUX 3はモダリティを融合させ、純粋なテキストプロンプトや、画像・動画などの参照データから、画像および「動画+音声」を同時に生成することができるようになりました。
FLUX 3 Video が公開
このFLUX 3の第一弾として、テキストや画像から動画を生成できる初期バージョンの「FLUX 3 Video」が一般向けに提供開始されました。最大20秒の動画クリップをHD解像度(アップスケーリングによりフルHDにも対応)で生成可能であり、映像と同期したネイティブな音声も同時に生成されます。
特定のスタイルに偏ることなく、映画的な表現から、自然な風景、遊び心のあるもの、ノスタルジックなものまで、多様な映像表現を可能にしています。これにより、1回の生成プロセスの中でシーンやカメラアングルを切り替えたり、タイポグラフィを映像内に描画したり、自然なアクセントとリップシンクを伴う多言語の対話を生成するなど、プロンプトを通じた柔軟な制御が可能です。
主な機能
提供が開始されたFLUX 3 Videoは、以下の主要な機能を備えています。いずれの出力においてもネイティブな音声生成が伴います。
テキストからの動画生成: 簡単な指示や詳細なプロンプトに基づき、自然な動きとシーンのロジック、音声を伴う映像を生成します。
Image-to-Video および キーフレーム: 画像を開始フレームに指定したり、複数のキーフレームを設定して、視覚的な一貫性を保ちながら動画を生成・補間します。
動画の続きを生成: 最大4秒間の既存の映像と音声をモデルに入力し、その後の展開を指示することで、動きやカメラワーク、音声をシームレスに継続して生成します。
マルチショット・シーケンスの作成: 1つの動画内でシーケンス全体の整合性を保ちつつ、複数のシーンやカメラアングルを作成します。
音声とダイアログ(対話): 映像のフレームに合わせて、対話、効果音、環境音を生成します。
多言語対応: 英語、中国語、スペイン語、フランス語、ドイツ語、日本語などを含む13以上の言語に対応し、リップシンクを伴う対話の生成が可能です。
世界知識とグラウンディング: 事前学習された知識と事実に基づく情報の関連付けにより、短いプロンプトからドキュメンタリーや教育向けコンテンツの素材を生成する機能を有しています。
ドラフトモード(高速プレビュー)
FLUX 3 Videoには、最終的なレンダリングの前に低コストでプロンプトのプレビューを生成できる「ドラフトモード」が搭載されています。
これにより、アイデアの方向性を素早く確認し、修正を繰り返すことが容易になります。ドラフトの結果を承認すると、モデルは同じ被写体、構図、動きを維持したまま、動画をフル品質でレンダリングします。
※参考:BFL公式サイトの価格情報によると、API利用時、HD解像度でのテキスト/画像からのドラフト生成は1秒あたり0.06ドル、本番の高品質レンダリングは1秒あたり0.17ドルに設定されています。
既存モデルとの比較評価
Black Forest Labsは、FLUX 3 Videoの性能について、既存の動画生成モデルとの広範な比較評価を実施しました。
720p・10秒の音声付きクリップを用いた社内評価において、Text-to-Video(テキストからの動画生成)およびImage-to-Video(画像からの動画生成)の双方で、人間の評価者から高い支持を得たとのことです。

また、同社の発表による早期評価における各モデルとの比較(勝率)は以下の通りです。モデルは現在も開発段階にあり、さらなる改善が見込まれるとしています。

特に、人間の表情の描写、物理的な出来事と音声の関連付け、および多言語対応において強みを示しているとのことです。また、視覚的な参照を利用することで、数分間にわたるシーケンス全体でキャラクターの一貫性を保つ機能も備えています。
安全性への取り組み
AIモデルの責任ある開発と展開の一環として、Black Forest Labsはリリース前後において複数のリスク緩和策を適用しています。第三者パートナーであるCinder社と協力し、リリース前にNCII(非合意の親密な画像)やCSAM(児童性的虐待素材)を含む様々なリスクに対する評価を行い、サポートされるすべてのモダリティで緩和策の有効性を検証していると述べています。
今後の展開とローンチ計画
Black Forest Labsは、画像、動画、音声の参照を組み合わせた動画生成など、制御性を高める機能を今後追加していく予定です。数週間から数か月の間に、以下の機能とモデルを早期アクセスフェーズを経て順次展開する計画を発表しています。
- 「FLUX 3 Video」: APIおよびプライベートウェイトアクセスを通じた動画・音声生成(現在提供中)。
- 「FLUX-mimic / FLUX 3 Action」: mimic robotics社をはじめとするパートナーを通じたアクション予測機能。
- 「FLUX 3 Image」: APIおよびプライベートウェイトアクセスを通じた画像合成・編集機能。
- 「FLUX 3 Dev」: コンテンツ制作(動画、音声、画像)およびアクション予測のためのマルチモーダル・バックボーンへのオープンウェイトアクセス。
画像合成と編集「FLUX 3 Image」
今後の展開に含まれる「FLUX 3 Image」は、多様なスタイル、アスペクト比、解像度での画像生成と編集に対応します。
学習途中の予備評価において、以前のバージョンのFLUXからテキストのレンダリング精度や複雑なプロンプトの処理能力が向上していることが確認されています。数週間以内に早期アクセスが開始される予定です。

アクション予測と物理AI「FLUX-mimic」
FLUX 3の現実世界に対する理解は、アクション(動作)予測の領域にも拡張されています。
同社はこれに対し、FLUX 3にネイティブなアクション予測を直接統合するアプローチと、事前学習済みの動画バックボーンを動態を理解した基盤として活用し、限られたタスク固有のデータから特化型のアクションモデルをファインチューニングするアプローチの2つを採用していると説明しています。
後者のアプローチについては、mimic robotics社が早期アクセスパートナーとして参画しています。両社は共同で、FLUX 3のバックボーンと、mimic社が持つ生産環境への展開に向けたロボット学習の専門知識を組み合わせた動画・アクションモデル「FLUX-mimic」を開発しました。物理AIとコンテンツ制作が同じ基盤上で機能する仕組みや、自動車メーカーであるAudi(アウディ)の実際の生産ラインでテストが行われている詳細については、関連論文にて公開されています。
また、これらの基盤となるアプローチに関するより詳細な技術情報も、今後公開される予定です。
利用について
FLUX 3 Videoは、現在BFL APIおよび選定されたパートナーを通じて利用可能です。すでにComfyUIでもFLUX 3 が Partner Nodes 経由で利用可能になっています。
Black Forest Labsは、クリエイターや開発者が同モデルを活用してどのような作品を生み出すのか期待を寄せており、同社の取り組みを推進するため、ドイツおよび米国での採用活動も行っているとのことです。
FLUX 3のより詳しい情報はこちらから
APIドキュメントは こちらから































コメント