2026年8月7日(現地時間) – Alibaba GroupのTongyi Labは、キャラクターアニメーション生成モデル「Wan-Animate-2」を公開しました。推論スクリプト、Baseモデル、蒸留モデルの重みが公開され、ComfyUIでもネイティブ対応が行われています。
Wan-Animate-2 とは
Wan-Animateは、WANチームが開発したキャラクターアニメーションとキャラクター置き換えを1つにまとめたフレームワークです。演者の動画をもとに任意のキャラクターを動かし、演者の表情と動きを正確に再現した動画を生成することができます。
既存の動画に映る人物をアニメーションキャラクターに置き換えることも可能で、このとき表情と動きは保たれ、さらに元の動画のライティングと色調を再現することで、周囲の環境になじませることができます。
Wan-Animate-2では、このアニメーション生成の部分がエンドツーエンドの構成に作り替えられました。入力は、動かしたいキャラクターの参照画像と、動きの元になる駆動動画の2つ。出力は、参照画像のキャラクターが駆動動画の動きと表情をなぞって演じる動画です。ここまでは前身と同じですが、骨格やキーポイントの抽出がなくなり、駆動動画のフレームをDiffusion Transformer(DiT)が直接読み込む設計になりました。
この変更によって、駆動動画から骨格やポーズを抜き出す中間工程がなくなりました。抽出の段階で情報が落ちることも、その誤差が生成結果に持ち込まれることもなくなるため、モーションの忠実度が上がり、キャラクターの見た目も途中でぶれにくくなりました。加えて、動きが骨格のような空間的な基準に縛られなくなったことで、出力側のカメラ視点を駆動動画から切り離す制御も可能になっています。
主な特徴は以下の通りです。
高い忠実度
複雑な動き、細かい表情、キャラクターとシーンの物理的に妥当なインタラクションを再現するとしています。アスペクト比やキャラクターの体型が異なる入力の組み合わせでも、安定して動作するとのことです。
マルチキャラクター
複数人の動画生成に対応します。1人の動きを複数のキャラクターに割り当てる、複数人の動きを複数のキャラクターに対応させる、といった使い方が挙げられています。
マルチカメラ
動きは駆動動画から取りつつ、出力側のカメラ視点だけを別の角度に振れます。同じキャラクターアニメーションを複数のアングルから見た形で生成できます。
リアルタイムストリーミング
効率化版のWan-Animate-2-Liteが、ライブカメラの映像からその場でキャラクターを動かす用途に対応します。
技術詳細

中間のモーション抽出器をなくす
キャラクター画像を動画で動かす手法は、これまで大きく3つの方式に分かれていたと開発チームは整理しています。
- 明示的なモーション表現を使う方式: 骨格やランドマークをいったん抽出してから生成する。抽出時の誤差がそのまま残り、キャラクターの見た目が途中でぶれる(identity drift)。
- 暗黙的なモーション特徴を使う方式: 動きを特徴量に圧縮するため、細かいダイナミクスが失われる。
- In-context learning方式: 中間表現を挟まずに済むが、計算コストが高くつく。
Wan-Animate-2は、駆動用の動画をDiffusion Transformer(DiT)が直接読み込む構成に作り替え、中間のモーション抽出器を完全になくしたとしています。抽出の段階で落ちていた指の位置や細かな表情の変化が、そのまま生成側に渡る形になります。これによってモーションの忠実度とキャラクターの同一性の保持が向上しています。
アーキテクチャは、参照画像と参照動画をそれぞれ受け取るデュアルブランチのDiTです。静的な見た目と動きの手がかりを噛み合わせるために、2つの仕組みが加えられています。
- Time-Align RoPE: ノイズ除去中の動画トークンと参照トークンを、時間方向で揃える。
- Sparse-Ref Attention: 参照側の特徴のうち、情報量のあるものを選んで参照する。
カメラ視点をテキストで動かす Viewpoint LoRA
従来のキャラクターアニメーションでは、出力のカメラ視点が駆動動画の視点に固定されていました。Wan-Animate-2はこれを、視点調整をテキスト条件付きのタスクとして定式化することで切り離しています。演技は駆動動画から取り、カメラの位置はプロンプトで指定します。
実装は、DiTのクロスアテンション層に組み込んだ軽量なLoRAです。学習時には方位角12方向と仰角4段階からなる離散的な視点空間を定義し、それぞれの状態を表す文言(「right 60-degree view」「top angle」など)をプロンプトに追加しています。LoRAが適用されるのはクロスアテンションの射影行列だけで、ベースモデルの重みは変わりません。この作りにより、カメラパラメータを数値で指定することなく、自然言語からカメラを動かせるようになっています。
リアルタイム動作を狙う Wan-Animate-2-Lite
通常の拡散モデルによる動画生成は、latent列の全体を1回のforward passでまとめてノイズ除去します。この一括方式では、そもそもストリーミング生成が原理的に成り立たず、長い系列ではメモリ要求も過大になります。Baseモデルが高品質な一方で遅延に弱いのは、ここに理由があります。
効率化版のWan-Animate-2-Liteは、この部分を因果的な定式化にもとづくCausal DiTへ作り替え、チャンク単位で自己回帰的に生成する形にしたものです。推論時は、入力される駆動ストリームを8フレームずつのセグメントに分割。前のチャンクで生成したlatentに、参照画像とノイズを加えてCausal DiTに入力し、次のチャンクを順に合成していきます。学習は3段階で構成されています。
- Teacher Forcing Pretraining: すでに生成したlatentを条件として与え、拡散モデルを因果的な生成の枠組みに作り替える。
- Error Buffer Training: 現実的な予測残差を学習時のコンテキストに注入し、学習と自己回帰的な推論の間に生じるずれ(exposure bias)を緩和する。
- Self-Forcing Distillation: 大規模モデル向けに設計したチャンク単位の誤差逆伝播で、多段階のノイズ除去を少ないステップ数に蒸留する。
この誤差バッファ機構により、チャンク単位の自己回帰生成を長く続けても誤差の蓄積や品質の劣化がなくなりライブ配信のアバターやインタラクティブな仮想環境のような、映像を出し続ける用途に利用可能となっています。
実測値も示されています。評価に使われたのはGPU 4基のクラスタで、パイプライン並列の構成です。1基が参照画像と条件信号のVAEエンコード、2基がSequence Parallelismで3ステップのDiTノイズ除去、残る1基がVAEデコードを担当します。この構成で解像度400×720のとき、スループットは24fpsに達したとのことです。
ComfyUIでのネイティブ対応
ComfyUIは同モデルへのネイティブ対応を発表しました。
ComfyUIを最新版に更新することで、Wan Animate 2: Motion Transferというテンプレートが利用できるようになります。
これに伴い、専用ノードが2つ追加されています。
- WanAnimate2ToVideo: 参照キャラクターと駆動動画を受け取るコンディショニングノード。
- WanAnimate2Cache: ポーズブランチの計算結果をサンプリングステップ間で使い回すオプションノード。システムメモリと引き換えに、生成時間がおよそ半分になるとしています。
1回の生成で作られるのは81フレーム、24fpsで約3.4秒です。これを超える長さにするには、テンプレート内のサブグラフを複製し、前の出力を次の入力へつないでいく必要があります。セグメント同士は仕様上1フレーム重なるため、継ぎ目が気になる場合は後続セグメントの先頭フレームを削ります。
複製せずに延長できるネイティブなループ対応もPRとして提出されていますが、現時点ではレビュー中となっているようです。

Tips
公式テンプレートには、結果を左右する注意点が3つ挙げられています。
- 構図を揃える:参照画像が全身なら駆動動画も全身にする。クローズアップと全身のような構図の食い違いが、結果が崩れる最大の原因だとしています。
- 駆動動画のfpsを調整する:フレームは動画から1対1で取り込まれ、リサンプリングは行われません。動きが遅く見える場合は、事前に16〜24fps程度へ変換しておきます。
- キャッシュはCPUに逃がす:
WanAnimate2Cacheのdeviceをcpuに設定すると、VRAMの急激な消費を避けられます。
必要なファイルと配置先は次のとおりです(ファイル名がダウンロードページへのリンクになっています)。
ComfyUI/models/ ├─ diffusion_models/ ── 下記のいずれか1つ │ ├─ wan_animate_2_int8_convrot.safetensors ← テンプレート標準・INT8 │ ├─ wan_animate_2_bf16.safetensors ← フル精度・BF16 │ ├─ wan_animate_2_distill_int8_convrot.safetensors ← 蒸留版・INT8 │ └─ wan_animate_2_distill_bf16.safetensors ← 蒸留版・BF16 ├─ loras/ │ └─ lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors ← LightX2V高速化LoRA ├─ text_encoders/ │ └─ umt5_xxl_fp8_e4m3fn_scaled.safetensors ├─ clip_vision/ │ └─ clip_vision_h.safetensors └─ vae/ └─ Wan2_1_VAE_bf16.safetensors
入手方法とライセンス
本体のモデルはHuggingFaceとModelScopeで公開されています。リポジトリ名は Wan2.2-Animate-2-14B、ライセンスは Apache License 2.0 です。
Wan Animate 2 is now available in ComfyUI(ComfyUI Blog)
Wan-Animate-2: Pushing the Application Boundaries of Character Animation プロジェクトページへ































コメント