MiniMax H3のオープンウェイトが公開 ―最大12ファイルの画像・動画・音声を1つの文脈で参照できる汎用モデル

CGソフト

2026年7月31日(現地時間) – MiniMaxは、汎用マルチモーダル生成モデル「MiniMax H3」を発表しました。続いて8月2日にはモデルウェイトがHugging Face上で公開され、ComfyUIでもネイティブ対応が開始されています。

MiniMax H3 とは

MiniMax H3は、テキスト・画像・動画・音声を「ひとつの文脈」として読み込み、最大15秒・2K解像度・ネイティブステレオ音声付きの動画を生成することができる、Hailuo 01、Hailuo 02に続くMiniMaxの第3世代動画生成モデルです。同社が初めてウェイトを公開した動画モデルでもあります。

最大の特徴は「動画モデル」という枠に収まらない設計思想にあります。従来の生成モデルでは、画像生成(T2I、被写体参照、スタイル参照など)、音声生成(声、効果音、音楽)、動画生成(T2V、I2V、動画編集など)といったように、タスクごとに専用モデルが分かれているのが常識でした。

MiniMaxは、この「タスクの境界」がクリエイティビティの自由度を縛り、同時にモデルの汎化能力の上限にもなっていたと捉えており、H3ではこれらのタスクを統合し一般化しました。

そのためH3は、事前学習の段階から次のような多様なデータとタスクを混ぜ込んで学習されています。

  • テキストから画像生成
  • テキストから動画生成(音声を同時生成、出力はすべてネイティブステレオ。マルチショットをネイティブにモデル化)
  • テキストから音声生成(声・効果音・音楽を分離せず一体でモデル化)
  • 一般化された参照・編集(画像→画像、画像→動画、音声→音声、音声動画→音声動画)
    ※ここでいう「一般化された参照・編集」には、次の2つの意味があります。
    • 実データのみで構成する ― 人工的に作ったタスク用データではなく、自然な実データだけで学習することで、データ量のスケーラビリティを確保する。
    • 関係性を自然言語で表現する ― 「被写体参照」「スタイル参照」といった固定のタスク名に閉じ込めず、素材と生成物の関係を言葉で記述させる。

MiniMaxは「言語(広義には知能の構造)こそが汎化への橋渡しである」と位置づけており、これは後述するアーキテクチャ全体を貫く思想となっています。

主な機能・特徴

マルチモーダルコンテキスト理解

MiniMaxの最大の特長で5つの異なるタスクを1つのモデルに統合する機能です。

複数モダリティの素材を同時に入力し、「素材同士の関係」と「素材と生成したい映像の関係」を自然言語で説明するだけで、モデル側がクロスモーダルな解決を行います。

例えば、公式では以下のような例が挙げられています。

動画1
画像2
音声3

「動画1のヒッチコック的なカメラワークを参照し、画像2の人物に歌わせ、歌声は音声3に合わせる」

この一文のプロンプトだけで、モーション参照・被写体参照・音声(声質)参照・リップシンクという、従来であれば4つの専用パイプラインが必要だった処理が、1モデル・1リクエストとなります。

ネイティブステレオ音声

音声は後処理ではなく、モデルの性質として組み込まれています。動画と同じフォワードパス内でセリフ・効果音・環境音・BGMが一体として生成され、出力は常に32kHzのステレオ音声となります。参照音声から声質を転写(クローン)して登場人物に当てることや、既存映像のセリフを差し替えて演技もそれに合わせて調整することも可能です。

対話音声は、日本語を含む11言語(アラビア語、中国語、英語、フランス語、ドイツ語、イタリア語、日本語、韓国語、ポルトガル語、ロシア語、スペイン語)でサポートされています。

入出力仕様

出力尺4〜15秒(整数指定)
フレームレート24 FPS
解像度デフォルトは短辺768px。2Kは「H3-Regenerate-2K」により実現。
アスペクト比21:9 / 16:9 / 4:3 / 1:1 / 3:4 / 9:16 など(アダプティブ指定も可能)
音声32kHz ステレオ
プロンプト長最大7,000文字

生成モードごとの入力条件

モデルバリアント対応タスク入力条件
H3-Base-FL2VA
(最初/最後フレーム)
t2va
fl2va
画像0枚=T2V、1枚=先頭または末尾指定、2枚=始点と終点を指定
H3-Base-Ref2VA
(オムニリファレンス)
ref2va画像: 最大9枚
動画: 最大3本(各2〜15秒・合計15秒以内)
音声: 最大3本(同左。単独入力不可、画像か動画との併用必須)
※合計ファイル数は最大12まで

編集とモーション転写

参照動画から「カメラワーク」「演者の動き」「カット割りのテンポ」といった動的な要素だけを取り出し、被写体や全体のスタイルは別の素材から適用する、といった柔軟な使い分けが可能です。インプレース編集(元動画の特定部分のみを置き換える機能)と組み合わせれば、カット単位で細かく修正を重ねていく作業も現実的なワークフローになります。

AI性能の比較プラットフォーム「Artificial Analysis」のリーダーボードにおいて、H3は「Video Editing(動画編集)」部門で1位を獲得しています(2026年8月3日時点)。

コストパフォーマンス

MiniMaxはデフォルトで2K解像度を提供したうえで、2Kの秒単価が主要な競合モデルの1/3未満、768pにおいては主要モデルの720pの半額未満であるとしています。具体的な公開価格については後述の「利用について」をご参照ください。

想定ユースケース

広告、ブランディング、EC、プロダクトデザイン、UI/UX、ゲームなど、商用コンテンツ制作全般での利用が想定されています。

公式のデモ映像では、映画のオープニングタイトル、プロダクトサイト用の背景映像、アニメーションポスター、広告やEC向けの縦型動画などが示されています。

特に指示追従の正確さ、文字やブランドロゴの破綻のないレンダリング、V2V(Video-to-Video)でのモーション転写が強みとされています。

技術詳細

システムは3モジュール構成

Hugging Faceのモデルカードによれば、完全なH3のシステムは次の3つのモジュールで構成されています。このうちオープンウェイトとして公開されたのは「H3-Base」のみです。

モジュール役割公開状況
H3-Context-IR自由形式のマルチモーダル入力を解釈し、H3が扱える中間表現(Context Intermediate Representation)に変換する前処理層。非公開(API提供)
H3-Base中間表現をもとに768pの映像と音声を生成する基盤モデル。公開
H3-Regenerate-2K768pの出力結果と元のコンテキストを再入力し、2K解像度で再生成するモジュール。非公開(API提供)

H3-Context-IR = 言語を「汎化のブリッジ」にする層

H3-Context-IRは、テキスト・画像・音声・参照動画の相互関係と、それらが最終的な生成目標とどう結びつくかを解釈する前処理およびオーケストレーションのシステムです。内部では、指示の解析(パース)、クロスモーダルな関連付け、時間軸の理解、そして複雑な論理推論が行われ、その結果をH3-Baseが処理しやすい構造化表現へと変換します。必要に応じて、ユーザーの意図から逸脱しない範囲で不足している意味情報を補完することもあります。

MiniMaxはこれを「Contextual Omni Representation(文脈的オムニ表現)」と呼んでいます。従来のキャプション付けは単に映像を説明するものでしたが、マルチモーダルなコンテキストでは以下の記述が必要になります。

  • 文脈(入力素材)と生成対象の関係性
  • 文脈内にある要素同士の関係性
  • 映像と音声を同時に記述すること(マルチショットではさらに複雑化します)

この処理のために専用モデルと全モダリティ理解パイプラインが構築されており、多くの素材入力において約10万トークン規模の推論を行い、それを平均4Kトークン程度に蒸留していると説明されています。H3の広範な指示追従能力の源泉はここにあります。

なお、H3-Context-IRは複数のホスト型モデルやサービスに依存する多段ワークフローであるため、今回のオープンソースリリースには含まれていません。代替として、公式の挙動を再現するAPIの提供や、自前で前処理系を構築するための「Prompting Guidance」が公開されています。モデルカードでも「最終的な出力品質を左右する重要要素であるため、パイプラインへの組み込みを強く推奨する」と明記されています。

H3-Base のアーキテクチャ

各モダリティを対応するエンコーダやVAEで符号化し、ひとつのパック化(packed)されたマルチモーダル系列にまとめ、RoPE(Rotary Position Embeddings)で空間・時間の関係性を付与してからTransformerへ流し込む構成です。

  • テキスト処理: H3-Encoder(Qwen3-VL-32Bの学習済みウェイトをそのまま使用し、第50層の隠れ状態をH3-Omni-Transformerに渡します。<d>などの特殊トークンが追加されているため、利用時はリポジトリ同梱のtokenizerと設定ファイルが必須です)。
  • 視覚入力処理: H3-Encoder + H3-VisualVAE
  • 音声入力処理: H3-AudioVAE のみ

H3-VisualVAE

時間方向に因果的なビデオオートエンコーダです。空間方向に16倍、時間方向に4倍の圧縮を行い、24の潜在チャネルを持ちます(f16t4d24)。Transformerに入る前に1×2×2(時間×高さ×幅)でパッチ化されるため、実効的な空間ダウンサンプリングは32倍、時間方向は4倍となります。エンコーダの学習後にViTベースのデコーダを追加学習することで、デコードコストの削減と再構成品質の向上を両立させています。

公式ブログでは、この新しいトークナイザによって実効系列長で4倍の効率改善が得られ、学習や推論のコストを大幅に削減できたこと、そしてこれがネイティブ2K対応を可能にした鍵であることが強調されています。

H3-AudioVAE

左右のチャンネルで同一のエンコーダ/デコーダを使用しつつ、各チャンネルを独立に処理して最後に結合することでステレオ入出力を実現しています。32kHzの音声を40Hzのレートで潜在トークン列に圧縮します。

H3-Omni-Transformer

33B(330億)パラメータを持つ、密(dense)なシングルストリームTransformerです。なお、この33BはOmni-Transformer単体の規模であり、テキスト/視覚エンコーダ(Qwen3-VL-32B)や各VAEは別途必要になります。システム全体のフットプリントはこれより大きくなる点に注意してください。うち約13BがAdaLN関連ブランチに存在します。AdaLNの変調出力は事前計算してキャッシュが可能なため、推論専用のデプロイにおいてはこの部分のロードを省略してメモリを節約できます(ファインチューニング等に対応するため、ウェイト自体は完全な形で公開されています)。

設計上の特徴として、Attention層とFFN層にはモダリティ固有の構造を持たせず、モダリティ依存のパラメータを入出力層とAdaLNブランチに限定しています。位置表現には、時間軸と空間2軸からなる3次元のMM-RoPE(Multimodal Rotary Position Embeddings)を採用しています。

MiniMaxは「アーキテクチャはタスクに奉仕すべき」という立場を明確にしており、前世代(Hailuo-02)で優位性をもたらしていたアーキテクチャをあえて捨て、タスクの汎化に特化したシンプルな設計を採用しました。また、マルチモーダル化により系列長の分散が3倍に拡大し、理解側と生成側で計算負荷の性質が大きく異なるようになったため、両者のワークロードを分離する学習アーキテクチャを採用。エンドツーエンドで学習スループットを約30%向上させています。

注意: H3は学習の最終段階でネイティブなスパースアテンションを導入していますが、初回のオープンソースリリースにはスパースアテンションの実装は含まれておらず、full attentionでの推論のみとなります。実装は将来のアップデートで公開予定とされており、長尺・高解像度時の推論コストに影響する点に留意が必要です。

H3-Regenerate-2K = 超解像を使わない2K化

2K出力にあたり、H3は一般的な専用の超解像(アップスケール)モジュールを使用しません。代わりに、H3のベースモデル自身が生成した低解像度(768p)の出力を、インコンテキストでもう一度自身に再入力(Regenerate)して高解像度化します。

これにより、ベースモデルが持つ生成能力を最大限に再利用できるだけでなく、元のマルチモーダル文脈(参照画像など)を直接参照できるため、従来の超解像が「推測」するしかなかった小さな文字や微細なディテールを正確に復元できるという利点があります。MiniMaxはこの手法自体を「タスク汎化の一例」と位置づけています。このモジュールも現時点では非公開ですが、準備が整い次第リリースされる予定です。

利用について

アプリ / Web

APIキーなしで手軽に試したい場合は、以下の公式アプリケーションが利用できます。

無料トライアル: MiniMax Hubでは、2026年8月8日まで2Kでの生成を3回無料で試せるキャンペーンが実施されています(動画リファレンスを使った生成は対象外)。まず出力の質を確認してから課金を判断したい場合に使えます。

APIサービス

H3のAPIは、MiniMax公式のOpen Platformと、サードパーティのホスティングプロバイダの2ルートで利用できます。

  • MiniMax Open Platform(公式): グローバル版 platform.minimax.io、中国版 platform.minimaxi.com。アカウントを作成してAPIキーを発行し、残高をチャージすれば従量課金で使い始められます。API側のエンドポイントはそれぞれ api.minimax.io と api.minimaxi.com です。最安で、後述の2K再生成やH3-Context-IRといった個別機能にもアクセスできます。
  • fal.ai: Day 0のエコシステムパートナー。JavaScript / Python / REST のラッパーが整備されており、GPUを用意する必要はなく、ホスト版APIを利用可能です。
  • その他のプロバイダ: OpenRouterなどの再販ルートからも利用できます。プロバイダごとに単価・既定値・データ保持ポリシーが異なるため、価格表は必ず利用先のものを確認してください。

API利用での価格は以下の通りです。いずれもMiniMax公式Open Platformの掲載価格です。

生成料金

解像度課金ルール価格
2K出力秒数で課金$0.13 / 秒
768P出力秒数で課金$0.08 / 秒

2Kで15秒の動画を1本生成すると $1.95 という計算になります。

入力素材の料金

素材課金ルール
音声無料
画像最初の5枚は無料、6枚目以降は1枚 $0.04
動画入力動画の尺と出力解像度に応じて課金(2K: $0.13 / 秒、768P: $0.08 / 秒)

見落としやすいのが参照動画の扱いです。参照素材のうち画像と音声はほぼ無料である一方、参照動画は入力した尺の分だけ、出力と同じ秒単価で課金されます。5秒の動画を3秒の参照動画つきで2K生成すると、実質8秒分の課金になる計算です。

2K再生成(H3-Regenerate-2K)の料金

既存の768P動画を2Kへ再生成する処理は、別建ての料金体系になっています。ローカルでH3-Baseを動かし、仕上げだけAPIに任せる構成を検討している場合はここが実質的なコストになります。

項目課金ルール
出力(768P → 2K)再生成した出力の秒数で課金:$0.05 / 秒
入力:音声無料
入力:画像最初の5枚は無料、6枚目以降は1枚 $0.025
入力:動画元の768Pタスクの入力動画の尺で課金:$0.05 / 秒

H3-Context-IR の料金

入力解釈を担うH3-Context-IRは、動画の秒数ではなくトークン課金です。

項目価格
入力$0.90 / 100万トークン
出力$3.60 / 100万トークン

モデルカードのサンプルを見ると、テキストのみの入力で約8.5Kトークン、画像1枚を含むケースで約23Kトークン、参照動画と音声を含むケースで約39Kトークンが消費されています。1回あたり数円程度に収まる規模ですが、参照素材が増えるほどトークン数も増えます。

ComfyUIでのネイティブ対応

ComfyUIでのH3利用には、性格の異なる2つのルートがあります。

  • Partner APIノード(発表当日から利用可): MiniMaxのクラウドAPIを呼び出すノード群です。ローカルGPUは不要で2K出力もそのまま得られますが、生成のたびにAPI料金が発生します。
  • ネイティブノード(ウェイト公開後): 公開されたH3-Baseを完全にローカルで実行します。MiniMaxH3ImageToVideo(先頭/末尾フレーム)やMiniMaxH3ReferenceToVideo(画像・動画・音声参照)といった専用ノードが提供され、テンプレートライブラリにはT2V / I2V / R2Vの3種類のワークフローが公式で利用可能です。

以下はネイティブノード(ローカル実行)についての説明です。ComfyUI本体はバージョン0.30.0以降が必要になります。

必要なモデルファイル

配布元は Comfy-Org/MiniMax-H3 で、拡散モデル・テキストエンコーダ・VAEの3種類を配置します。それぞれ複数の量子化バリアントが用意されています。

ComfyUI/
└── models/
    ├── diffusion_models/
    │   ├── minimax_h3_fl2va_bf16.safetensors                 # T2V / I2V 用
    │   ├── minimax_h3_fl2va_int8_convrot.safetensors
    │   ├── minimax_h3_fl2va_pruned_int8_convrot.safetensors
    │   ├── minimax_h3_ref2va_bf16.safetensors                # R2V 用
    │   ├── minimax_h3_ref2va_int8_convrot.safetensors
    │   └── minimax_h3_ref2va_pruned_int8_convrot.safetensors
    ├── text_encoders/
    │   ├── qwen3vl_32b_minimax_h3_bf16.safetensors
    │   ├── qwen3vl_32b_minimax_h3_int8_convrot.safetensors
    │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
    └── vae/
        ├── minimax_h3_video_vae_fp16.safetensors
        └── minimax_h3_audio_vae_fp32.safetensors

コンシューマGPU向けの最適化

ComfyUI環境では、モデルのパラメータの約40%を占める「modulation weights」を刈り込み、機能的に等価なルックアップテーブルに置き換えることで、出力品質を落とさずにメモリフットプリントを大幅に削減しています

さらにint8 convrot量子化とカスタムカーネルの適用により、フル精度で123.6GB必要だったメモリフットプリントを、最小構成で42.5GB(約66%削減)まで圧縮。動的VRAMオフローディングと組み合わせることで、RTX 3060クラスのコンシューマ向けGPUでもローカル実行が可能であるとされています。

プロンプトのコツ

ローカル実行ではH3-Context-IR(入力解釈のモジュール)を経由しないため、プロンプトは自分で構造化して書く必要があります。公式ドキュメントが挙げているポイントは次の通りです。

  • 全体から書く: まず場所・登場人物・何が起きているかといったシーン全体を述べ、そのうえでショットごとに分解する。
  • 映像と音を1ブロックで: ショット、カメラワーク、それに伴う音(セリフ・効果音・音楽)を一つのプロンプトにまとめて記述する。
  • 参照素材はタグで指定: 接続した順番どおりに <Picture 1><Video 1><Audio 1> のように参照する。
  • 各参照に役割を割り当てる: どの参照が何を担うのか(identity / style / motion / camera / voice)を明示すると、精度が大きく変わる。
  • R2V固有の設定: ref_image_size は match で生成解像度に合わせて高速化、max で短辺2048pxまで保持して同一性の再現を優先。サンプラーは参照が多いプロンプトでは res_multistep + beta / normal スケジューラが simple より良好とされています。

そのほかのローカル推論

ComfyUI以外の環境でも、公開ウェイトを使ったセルフホストが可能です。Hugging Faceでは、タスク別に2つのチェックポイント(Base FL2VA / Base Ref2VA、いずれもBF16・CFG蒸留済み)が配布されており、SGLang、vLLM、diffusersでの推論がサポートされています。

導入手順は、いずれも公式モデルカードに一通り揃っています。自前のサーバーで動かす場合はそちらを参照してください。

ライセンスについて

H3のオープンウェイトは「MiniMax H3 Community License Agreement」(発効日:2026年8月2日)の下で提供されています。OSI準拠の純粋なオープンソースライセンスではなく、条件付きのソース・アベイラブル(Source-available)型ライセンスである点に注意してください。

地域制限(Applicable Territory)

本ライセンスの最も重要なポイントは、適用地域が「除外地域を除く全世界」と定義されており、「除外地域(Excluded Territories)」が設定されていることです。

除外地域: EU(欧州連合)、英国、韓国、アメリカ合衆国

これらの地域においては、ウェイトの利用、複製、改変、配布などが本ライセンスでは許諾されません(生成物の域外利用も許諾対象外です)。日本は除外地域に含まれていないため、日本国内での利用は本ライセンスの適用範囲内となります。

MiniMax側は、この制限は特定の国を排除する意図ではなく、各国のAI規制環境(EU AI Actの施行、米国で進行中の生成動画AIをめぐる著作権訴訟など)の不確実性に対応するための措置であると説明しており、「not yet であって not ever ではない(将来的に拡大する可能性はある)」と明言しています。なお、除外地域の組織であっても、デプロイ内容とコンプライアンス統制の審査を経て個別ライセンスを申請することは可能です。

またAPIは全世界で利用とされています(MiniMax側がインフラを運用し安全対策を強制できるため、ウェイト配布とは扱いが異なるという説明です)。

商用利用の条件と表示義務

年間売上 2,000万米ドル以下無償で商用利用が可能(本ライセンスの範囲内)。
年間売上 2,000万米ドル超事前の書面による個別許諾が必要です(api@minimax.io 宛に申請)。
表示義務(アトリビューション)H3を利用する商用製品やサービスのUI上に、「MiniMax H3」を目立つ形で表示する必要があります。

再配布時の義務

ウェイトや派生モデルを第三者に配布する場合、以下の条件を満たす必要があります。

  • 本ライセンス契約のコピーを受領者全員に提供すること
  • 改変したファイルには、改変した旨の目立つ表示を入れること
  • 配布物(ホスト型サービス経由を除く)に、次の文言を含む NOTICE ファイルを添付すること
    “MiniMax H3 is licensed under the MiniMax H3 Community License Agreement, Copyright © 2026 MiniMax. All Rights Reserved.”
  • (推奨・義務ではない)「Powered by MiniMax H3」の表示、生成物へのAI生成識別子の付与、利用体験に関する技術ブログや公開声明の発表

その他の主な条項

  • 出力物の権利: MiniMaxは生成物に対する権利を主張しませんが、出力とその利用に関する責任はユーザー側にあります。
  • モデル派生物: 蒸留や中間表現の利用、合成データによる学習を含め、H3の挙動を移植したモデルは「Model Derivatives」として扱われます(生成物そのものは派生物とはみなされません)。
  • 他モデルの改善禁止: H3やその生成物を、H3系以外のAIモデルの改善や学習のために使用することは禁止されています。
  • セーフガード義務: 第三者に生成機能を提供する場合、権利侵害やポリシー違反を防ぐ技術的・組織的対策の実装、通報窓口の設置、違反時の対応が求められます。
  • AUP(利用制限): 違法行為、未成年者の搾取、選挙妨害目的の偽情報、なりすまし、マルウェア生成、軍事利用などを禁止。また、AIによって生成されたコンテンツであることを明示せずに公開環境へ発信することも禁止されています。
  • 準拠法・管轄: 香港特別行政区法および香港の裁判所の専属管轄となります。
  • エンコーダの扱い: H3のエンコーダに使用されている Qwen3-VL-32B は Apache 2.0 ライセンスです。

その他詳しい情報は、以下をご覧ください。

今後の展望

MiniMaxは、言語を「応用範囲が広く拡張可能な計算体系」と位置づけ、マルチモーダル知能は言語に深く根ざすべきだとしています。H3-Context-IRの設計も、参照・編集の関係性を自然言語で記述させる方針も、この考え方から導かれたものです。

そして、H3にはまだ成長の余地があるとして、次期バージョンに向けた優先事項が3点挙げられています。

  • マルチモーダル理解の強化: 高品質な生成の土台となるのは強力な理解能力であり、ここにはまだ大きな改善余地があるとしています。次世代のHシリーズでは、同社の言語モデルであるMシリーズの能力を統合する計画です。
  • モデルのスケーリング: 現在のモデルサイズは、複数の能力においてまだ伸びしろを残しているという認識です。スケールアップは明確な前進の道筋であり、タスク汎化性能が高まることでそのポテンシャルを十分に引き出せると考えています。
  • 視覚的ディテールの向上: シーンによっては視覚的な細部にまだ改善の余地があるとして、より高い解像度と忠実度を引き続き追求していくとしています。

各種リソース


MiniMax H3 Day-0 Support in ComfyUI: Open Weights, Native Audio, and 2K Video

MiniMax H3: An Open Model Breaking the Boundaries Between Tasks and Modalities

コメント

Translate »
タイトルとURLをコピーしました