LTX、オープンウェイト動画生成モデル「LTX-2.5」を公開!カットをまたいでも崩れないマルチショット生成に対応

CGソフト

2026年8月11日(現地時間)- LTXは、オープンウェイトの動画生成モデル「LTX-2.5」を発表しました。また、 ComfyUI は公式ワークフローを含む初日対応を発表しています。

LTX-2.5 とは

LTX-2.5 は、テキスト・画像・動画を入力として、同期した映像と音声を生成するオープンウェイトのモデルです。開発元の LTX はこれを「ワールドモデル」と呼んでおり、映像そのものだけでなく、空間や動きの振る舞いを学習した基盤モデルとして位置づけています。前バージョンの LTX-2.3 から、生成パイプラインのほぼ全段が作り直されたとのことです。

最大の特徴は、モデルの重みが配布されている点にあります。自社のハードウェア上で動かすことができるため、素材や生成物が外部のクラウドを経由しません。さらに、ファインチューニングや LoRA による調整も自前で行うことができます。LTX はこの「制御を手元に残せること」を、クローズドな API 専用モデルとの違いとして強調しています。

他にも、カットをまたいでも破綻しないネイティブマルチショット生成、新しいレンダリング方式「Diffusion Fidelity Rendering」、プロンプトからの自動での尺決定といった機能が追加されています。なお、LTX は同シリーズのダウンロード数が3,300万を超えており、最も使われているオープンなワールドモデルであるとしています。

LTX-2.5: The World Model the World Builds On

生成速度について、LTX は公式ページで「2基の GB200 GPU による自己ホスト環境、720p の条件で、10秒のクリップを6.8秒で生成できる」としています。リアルタイム再生よりも速い計算になりますが、これはデータセンター向けの高性能 GPU を2基使用した場合の数値である点には留意が必要です。

また、LTX-2.5 の用途は映像制作にとどまらず、リアルタイム生成やロボティクス領域まで想定されています。

今回のリリースにあわせて、映像制作スタジオの Asteria、ノードベース環境の ComfyUI、ロボティクス企業の Markov Robotics、リアルタイム動画基盤の Reactor がパートナーとして名を連ねました。

主な特徴

LTX-2.5 での変更点は、レンダリング、デコード、テキスト理解、尺の決定など、パイプラインの各段階に及んでいます。

Diffusion Fidelity Rendering

Diffusion Fidelity Renderingは、今回の中心となる新しいレンダリング方式です。

まず時間方向に8倍圧縮した潜在空間で動きと構図を作り、あわせて高精細なキーフレームを生成します。キーフレームの枚数はシーンの複雑さと使用可能な計算資源に応じて増減し、その後に専用の拡散レンダリング段が、構造とキーフレームをもとに最終的な映像を起こします。

シーン全体に計算を均等に配分するのではなく、情報量の多いカットにリソースを多く割り当てる設計となっています。

Diffusion Video Decoder

従来の VAE によるデコード段を置き換える、拡散ベースのビデオデコーダーです。圧縮の過程で潰れやすかった顔やテクスチャ、画面内の文字が保たれやすくなり、速い動きによる残像(尾引き)やアーティファクトが減少するとされています。LTX によれば、高い圧縮率を保ったまま後工程での修正作業を減らすことを狙ったものとのことです。

ネイティブマルチショット生成

1回の生成で、カットがつながった複数のショットを出力できます。カットをまたいでもキャラクター、環境、ライティング、音声、画のスタイルが保たれます。

従来のバージョンでは1回の生成で連続した1ショットのみを出力していたため、シーケンスを作るには別々の生成結果を後からつなぎ合わせる必要がありました

Gemma 4 12B ベースのテキストエンコーダー

LTX-2.5 向けにカスタムされた Gemma 4 12B がテキストエンコーダーとして採用されています。

複数の被写体、動作、ライティング、カメラの指示が並ぶ長いプロンプトでも、途中の要素を落とさずに反映できるとしています。あわせて、短いプロンプトを詳細な映像指示へと展開する軽量なプロンプトエンハンサーも用意されています。

自動での尺決定(Duration Head)

プロンプトに記述された動作からクリップの長さを推定し、拡散処理が始まる前にフレーム数を決定します。プロンプトエンハンサーとあわせることで、手動で調整するパラメータが減る形になります。

ただし、ComfyUI 側の記事では「小規模な実験的モデル」、Hugging Face のモデルカードでは「オプトインのノード」と説明されており、必須の機能というわけではありません。

4K HDR と ACES ワークフロー

ネイティブ 4K、映像と同期した音声、最大 50fps のサポートは LTX-2.3 から引き継がれています。LTX-2.5 ではこれらに加えて、16bit リニアの HDR データを EXR 経由で ACES 規格のまま読み込み、ダイナミックレンジを保ったまま出力できるようになりました。仕上げのカラーグレーディング工程へそのまま渡せる形式での出力を狙ったもので、公式ページでは RAW 対応についても言及されています。

蒸留モデルの刷新とファインチューニング用チェックポイント

蒸留(distilled)モデルが作り直され、フルモデルの画質・プロンプト追従性・モーションの一貫性がより多く保持されるようになりました。固定8ステップ、CFG=1 で動作します。あわせて、ファインチューニング用のベースチェックポイント(dev)も配布されており、自社のデータを用いた学習に活用できます。

利用について

LTX-2.5 は、Hugging Face からの重みのダウンロード、ComfyUI、LTX API の主に3つの経路で利用できます。まずはインストール不要の API Playground で手軽に試すことも可能です。

モデルファイルの構成

LTX-2.5 は単一のファイルではなく、コンポーネントごとに分割された safetensors 形式の組み合わせで配布されています。ファイル名は ltx-2.5-22b-... となっており、22B(220億パラメータ)規模であることがうかがえます(※本文中で明示されているわけではありません)。

Transformer(DiT)distilled / dev の bf16 版、ComfyUI専用の int8 版、Blackwell向けの NVFP4 版
テキストエンコーダーgemma4-12b-with-proj(bf16 / ComfyUI専用 int8)
VAEDiffVAE(高品質・重い)、Conv VAE(高速・軽い)、音声VAE+ボコーダー
その他Duration Head、空間×2/時間×2 の潜在アップスケーラー、蒸留LoRA

【注意】int8 版は ComfyUI 専用

ファイル名に comfy-int8-convrot が付いているものは ComfyUI 専用となっており、ltx-pipelines などの PyTorch 経路では読み込むことができません。Python から使用する場合は bf16 版を選択してください。

動作環境と制約

Python の ltx-pipelines を使う場合、Python 3.12 以上、CUDA 12.7 以上、PyTorch 2.7 前後の環境が推奨されています。

VRAM が不足する環境向けに、--quantization fp8-cast によるオンザフライのダウンキャストや、--offload cpu による CPU オフロード機能が用意されています。NVIDIA との協業により、GeForce RTX GPU と DGX Spark 向けにローカル推論が最適化され、メモリ要件が引き下げられているとのことです。

LTX が公開している動作要件の表。

生成時のパラメータには以下の制約があります。

  • フレーム数は num_frames % 8 == 1 を満たす必要があります(例: 1、9、17…121…)。
  • 幅と高さは 32 で割り切れる必要があります。
  • --num-frames を省略すると、Duration Head がプロンプトから自動的に尺を決定します。

Diffusers 版は Lightricks/LTX-2.5-Diffusers として別途用意されています。ただし、LTX-2.5 への対応は本記事執筆時点では diffusers の正式リリースには含まれておらず、GitHub の main ブランチからのインストールが必要です。

学習関連では、dev 用の Transformer が学習可能であり、公開済みの LoRA や IC-LoRA は LTX-2 Trainer を使って再現できます。LTX-2.3 で学習させた LoRA や IC-LoRA については、「大半が変更なしで LTX-2.5 上でも動作する」との自社テスト結果が示されていますが、例外もあるため、本番環境へ投入する前の検証が推奨されています。

ComfyUI での利用

ComfyUI は LTX-2.5 に初日から対応しており、ローカル環境では ComfyUI を 0.32.0 以降に更新するかComfy Cloud を使うことで、テキストから動画(T2V)、画像から動画(I2V)、開始フレームと終了フレームの補間(FLF2V)の3つの公式ワークフローがテンプレートとして利用可能です。

LTX-2.5 is native in ComfyUI, day zero with the weights

【注意】Hugging Face のリポジトリはゲート付き

LTX-2.5 のモデルファイルはアクセス制限付きのリポジトリに置かれています。リポジトリページでライセンスに同意し、アクセス申請が承認されるまでダウンロードは失敗します。ワークフローを走らせる前に済ませておく必要があります。

3つのワークフローで使うモデルはほぼ共通です。I2V は T2V とまったく同じ構成、FLF2V は空間アップスケーラーを除いた構成になります。以下のファイルを、それぞれのフォルダに配置します。

配置後のフォルダ構成は次のようになります。

ComfyUI/
└── models/
    ├── diffusion_models/
    │   └── ltx-2.5-22b-distilled-transformer-comfy-int8-convrot.safetensors
    ├── text_encoders/
    │   ├── gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors
    │   └── gemma4_e2b_it_bf16.safetensors
    ├── vae/
    │   ├── ltx-2.5-video-vae-bf16.safetensors
    │   └── ltx-2.5-audio-vae-bf16.safetensors
    └── latent_upscale_models/
        └── ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors

ファイル名はいずれも Hugging Face のダウンロードページへのリンクになっています。FLF2V を使う場合は、最後の latent_upscale_models/ は不要です。

ワークフローごとの出力例と、ComfyUI 公式ドキュメントが挙げているプロンプトのコツは以下のとおりです。

T2V のプロンプトのコツ

  • シーン全体を書く: ショットの種類、場面、動作、登場人物、カメラワークを、途切れのない1段落にまとめます。
  • 音を書く: 必要な効果音やセリフを書きます。映像と同期した音声が一緒に生成されます。
  • プロンプトエンハンサーに任せる: 短いプロンプトは自動で詳細な指示に展開されるため、場面の骨子だけ書けば足ります。

I2V のプロンプトのコツ

  • 次に起きることを書く: 入力画像から続く動き、カメラワーク、音を書きます。すでに画像に写っているものを説明し直す必要はありません。
  • 1フレーム目を固定する: 「Use the provided start image as the first frame」のような表現を添えます。
  • 音を書く: セリフや効果音を書けば、同期した音声が生成されます。

FLF2V のプロンプトのコツ

  • 移り変わりを書く: 2枚のフレームの間で何が起きるかを、カメラワークと音を含めて書きます。
  • 2枚のアスペクト比を揃える: 同じ比率の画像を使うと補間が滑らかになります。
  • 音を書く: セリフや効果音を書けば、同期した音声が生成されます。

ローカルでの利用に加えて、ComfyUI の Partner Nodes 経由でホスト版も使えます。こちらは仕様の範囲が異なります。

LTX-2.5 (Fast)2〜20秒、720p〜4K(横/縦)、24・25・48・50fps。10秒を超えるクリップは 720p または 1080p、24または25fps
LTX-2.5 (Pro)2〜10秒、720p または 1080p、24・25・50fps

API での利用

自前で動かさずに使いたい場合は LTX API があります。課金は生成した動画の秒数単位です。

720p$0.09 / 秒
1080p$0.15 / 秒
2K$0.19 / 秒
4K$0.37 / 秒

ライセンス

LTX-2.x Community License のもとで配布されており、年間経常収益(ARR)1,000万ドル未満の組織は、商用・本番利用を含めて無償です。ブランド表記の義務もありません。

1,000万ドル以上の組織は、フルウェイト、エンジニアリングサポート、LoRA、柔軟なデプロイ形態を含む有償の商用利用契約が必要になります。

個人や小規模スタジオにとっては実質無償に近い条件ですが、条文には見落としやすい点が2つあります。

  • 売上は組織全体で数えます。 子会社や、共通の支配下にある関連会社も含めた合計で判定されます。
  • ファインチューン済みモデルの譲渡には有償ライセンスが必要になる場合があります。 自社で使う分と、学習した成果物を外に渡す場合とで扱いが変わります。

拘束力を持つのは LICENSE の原文なので、業務で使う前には一読しておくことをおすすめします。

なお、モデルカードには制約も明記されています。事実に基づく情報を提供する用途には向かないこと、統計モデルとして既存の社会的バイアスを増幅しうること、プロンプトの書き方によって追従性が大きく変わること、不適切な内容が生成される可能性があることが挙げられています。

Hugging Face でモデル詳細を見る


LTX-2.5 Day-0 Support in ComfyUI(ComfyUI Blog)

Introducing LTX-2.5: The Open World Model for Video, Real-Time, & Physical AI(LTX Newsroom)

LTX-2.5: The Foundation Film Is Made On(LTX Blog)

コメント

Translate »
タイトルとURLをコピーしました