自己ホスト型AI動画生成の現実と必要なVRAM
2026年7月時点で実用的な Wan 2.2、HunyuanVideo、LTX-Videoを比較します。720p・5秒の生成に必要なVRAM、レンタルGPUの費用、APIを選ぶ基準を確認できます。
自己ホスト型 AI video generator で実際にできること
自己ホスト型 AI video generator は現在でも動作します。ただし、デモ動画が示すよりも低速で、生成できる内容も小規模です。2026年7月時点で実行する価値があるオープンモデルは、Alibaba の Wan 2.2 と Tencent の HunyuanVideo です。速度をリアリズムより優先する場合は、Lightricks の LTX-Video も選択肢になります。これらはすべて、NVIDIA GPU を搭載した Linux マシン上で ComfyUI を使って実行できます。生成されるのは、720p でおよそ5秒のクリップです。1つのシーンではありません。完成した映像が1分間生成されるわけでもありません。
詳細に入る前に、結論を簡潔に示します。24 GB のカードでは、720p で5秒のクリップを数分以内に生成できます。12 GB のカードでは、同じ処理に20分以上かかります。モデルの重みが video memory に収まらず、ソフトウェアがレイヤーを system RAM との間で何度も移動させるためです。GPU を搭載していないサーバーでは、実用的な速度で生成できません。CPU による画像生成を遅くした計算量は、CPU による動画生成では実用性を失わせます。
自己ホスト型 image generator のハードウェア段階をすでに読んでいる場合、video も同じ考え方です。ただし、すべての数値が1段階上がります。VRAM(video memory、グラフィックスチップの隣に実装された RAM)は、これが快適に使えるか、苦痛を伴うかを決める唯一の仕様である点に変わりはありません。
画像1枚より動画1本のコストが大幅に高い理由
拡散モデルは、画像を段階的にノイズ除去して生成します。各ステップで、モデル内のすべての重みを読み取ります。動画モデルも同じ処理をフレーム全体のブロックに対して一度に実行します。さらに、フレーム間の時間方向のアテンションを追加するため、フレーム80がフレーム12の内容を参照できます。24フレーム/秒で5秒の場合、1つのバッチに120フレームが含まれます。
この時間方向のアテンションにより、コストはクリップの長さに比例して単純には増加しません。フレーム数を2倍にすると、サンプラーに必要なメモリは2倍を超えて増加します。そのため、発生する問題はレンダリングが遅くなることではありません。レンダリング自体が停止します。
予想しにくいメモリ使用量の急増が、もう1つあります。サンプラーの処理が終わると、VAE(variational autoencoder。圧縮された latent を実際のピクセルに変換する部分)が latent の動画全体を一度にデコードします。このデコードでは、サンプリング時より多くのメモリが必要になる場合があります。進捗バーが完了した後にジョブが停止し、次の内容が出力されるのが典型的な症状です。
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB対処方法は、タイル分割デコードを使用するか、クリップを短くすることです。どの段階でメモリ不足になったかを把握すれば、関係のない設定を1時間調整し続けずに済みます。
AI 動画生成にはどのくらいの VRAM が必要ですか
2 つの公開値が判断の全体像を示していますが、互いに矛盾しているように見えます。Alibaba は、Wan 2.2 TI2V-5B モデルが 4090 などの一般向け GPU 1 枚で、24 frames per second、5 秒間の 720p クリップを 9 分未満で生成できると説明し、少なくとも 24 GB の VRAM を推奨しています。ComfyUI のドキュメントでは、同じ 5B モデルが「ComfyUI native offloading を使えば 8GB vram に十分収まる」と説明されています。
どちらも正しいのは、測定している内容が異なるためです。8 GB は動作させられる容量です。24 GB は余裕を持って動作させられる容量です。Offloading では、モデルの大部分を system RAM に保持し、各ステップでレイヤーを GPU にストリーミングします。そのため GPU は計算よりも PCIe バスの待機に時間を使います。このコストは 1 回だけでなく、すべての sampler step で発生します。
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]最後の行だけがベンダーの公表値です。24 GB のカードでは、1 クリップあたり 9 分となります。これは、このモデルについて Alibaba が公表している数値です。他の行は offloading による影響を示したもので、ベンチマーク結果ではなく桁の目安です。重要なのは傾向です。8 GB のカードで 40 分かかる構成は、技術的には動作しますが、実際には夜間に実行したままにするバッチ処理です。
より大きな Wan 2.2 モデルは、別の領域に入ります。A14B の text-to-video および image-to-video バリアントでは、GPU 1 枚で推論するために少なくとも 80 GB の VRAM が必要です。これはデータセンター向けのハードウェアであり、デスク上のマシンに搭載するカードではありません。self-hosted が、1 時間単位で他者の accelerator を借りることを意味し始める境目です。同じ計算は text 側でさらに大きくなります。Kimi K3 のような 2.8 trillion parameter モデルを self-hosting することは、1 枚のカードで済むかという問題ではなく、接続して運用できる 80 GB カードを何枚確保できるかという問題になります。
レンタル GPU で 1 クリップにかかる費用
ほとんどの場合、まずはレンタルで試すべきです。最終的に使いたいモデルに 80 GB が必要なら、購入したカードは適切なハードウェアではないためです。GPU レンタル市場におけるオンデマンド料金の中央値は、2026 年 7 月時点で次のとおりです。
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]4090 の行では 5B モデルを実行し、1 時間あたり 0.36 ドルで、1 クリップあたり約 0.05 ドルかかります。80 GB の行では 14B モデルを実行します。そのため、ハードウェア自体ははるかに高速でも、1 クリップあたりの費用は 0.6 ドルまで上がります。モデルが大きいほど、動画 1 秒あたりに必要な計算量も増えます。
1 クリップ 5 セントなら、ほとんど費用がかからないように思えます。しかし、ここが誤解を招く点です。初めて使える 5 秒の映像を得るまでに、1 回のレンダリングで済むことはありません。動画モデルへのプロンプト入力は探索作業です。特定の動きを含むショットでは、採用できる結果に到達するまで 20〜40 回レンダリングするのが普通です。そのため、1 回の作業セッションにかかる費用はセントではなくドル単位になります。レンタルしたハードウェアで午後いっぱい反復作業をしても、昼食代と同程度です。
レンタルでは、見落とすと実際の費用につながる点が 2 つあります。インスタンスがモデルの重みをダウンロードしている間も課金されます。Wan 2.2 のファイルは text encoder と VAE を含めると数十 GB になるため、永続ボリュームを利用できるプロバイダーを選び、1 回だけダウンロードしてください。また、SSH セッションを開いたままインスタンスをアイドル状態にしている間も課金されます。ターミナルを閉じるだけではなく、インスタンスを停止してください。
GPU サーバーに ComfyUI をインストールする
NVIDIA ドライバーをインストール済みの Ubuntu 24.04 から始めます。まずドライバーを確認してください。この確認を省くと、後続のすべての障害が同じように見えます。
nvidia-smiカードと CUDA のバージョンを含む表が表示される必要があります。NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver と表示された場合、カーネルモジュールがロードされていません。通常は、カーネルをアップグレードした後に再起動していないことが原因です。ここで修正してください。そうしないと ComfyUI は CPU 経路にフォールバックし、モデルが原因だと考えて 1 時間を費やすことになります。
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt重みファイルを 1 つもダウンロードする前に、PyTorch がカードを認識することを確認します。
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"True とカード名が表示されれば、スタックは正常です。False は、インストールされている wheel が CPU 専用ビルドであることを示します。これは、pip が以前のインストールで使用した torch のキャッシュを検出した場合に発生します。上記の index URL を指定して再インストールしてください。
Wan 2.2 のモデルファイルをダウンロードする
ComfyUI には重みファイルが付属しておらず、動画モデルも単一のファイルではありません。拡散モデル、テキストエンコーダー、VAE で構成され、それぞれ専用のディレクトリに配置します。ファイルを誤ったフォルダーに置くと、ローダーノードには表示されません。理由を示すエラーも出ません。
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors5B モデルは text-to-video と image-to-video の両方に対応するため、開始点として適しています。常に .safetensors を .ckpt より優先してください。.ckpt ファイルは pickle 化された Python オブジェクトです。そのため、読み込むと、作成者が記述したコードが実行されます。ディスク容量には十分な余裕を持たせてください。1 つのモデルファミリーとその出力を含む実用的な構成では 100 GB が必要です。動画ファイルは、画像ワークフローで生成される PNG 画像よりはるかに大きくなります。重みファイルは再ダウンロードできますが、調整済みのワークフローは再現できないため、オブジェクトストレージへの暗号化された増分バックアップ などを使用してワークフローの JSON ファイルをバックアップしてください。
安全に起動してアクセスする
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188ComfyUI にはログイン画面もユーザーアカウントもありません。port 8188 に到達できるものは、ジョブのキュー投入、生成済みのすべてのクリップの読み取り、custom nodes のインストールを実行できます。custom nodes のインストールは、サーバー上で任意のコードを実行することにつながります。localhost にバインドし、自分のマシンから SSH トンネル経由でアクセスしてください。
ssh -N -L 8188:127.0.0.1:8188 you@your-server次に、ブラウザーで http://127.0.0.1:8188 を開きます。ノードを手動で接続するのではなく、ComfyUI の templates メニューから Wan 2.2 のテンプレートワークフローを読み込んでください。公式テンプレートには、モデル向けに調整された sampler 設定が含まれています。動画ワークフローは画像ワークフローよりも、値を気付かないまま誤設定しやすい箇所が多くあります。
API を使うべき場合
動画生成を self-hosting するのが適切なのは、処理量が多く安定している場合、フレームを自分のインフラの外部に出せない場合、またはホスト型サービスが提供していない特定のモデルやカスタムアダプターが必要な場合です。1 年後もパイプラインを同じ方法で動作させる必要がある場合にも適しています。ホスト型モデルは、固定するバージョンがないまま変更される可能性があるためです。
月に数本のクリップが必要なだけの場合、オープンモデルが生成するものより長い、または大きい出力が必要な場合、あるいは今週中に納期がある場合は、ホスト型 API を使用します。損益分岐点は正直に計算してください。2026 年 7 月の中央値で 24 GB のカードを 24 時間稼働で借りると、月額およそ 260 ドルです。同じカードを購入する場合は、1 フレームも生成する前にこれを上回る初期費用がかかります。アイドル状態の self-hosted サーバーは、クリップ単位の API 料金に常に負けます。これは、テキストモデルの提供方法を決める場合と同じトレードオフです。self-hosted LLM の提供における Ollama と vLLM の比較で説明しているとおり、さらに基本的な GPU 付き VPS に費用をかける価値がそもそもあるかという問題の上に成り立っています。
レンダーに失敗した場合の確認事項
サンプラーのバーが完了した直後、レンダーの最後で停止する場合は、VAE のデコード中にメモリ不足が発生しています。フレーム数を減らすか、タイル分割デコードノードに切り替えてください。ステップ数を変更しても改善しません。デコードはすべてのステップが完了した後に 1 回だけ実行されるためです。
出力が完全な黒画面になるか、大きく乱れている場合は、VAE がモデルと一致していない可能性が高いです。Wan 2.2 の diffusion model に Wan 2.1 VAE を読み込むと、まさにこの状態になり、ログにはエラーがどこにも表示されません。
レンダーは実行されるものの、GPU があることが分かっているマシンで数時間かかる場合、ComfyUI は CPU 経路で動作しています。起動ログでデバイスの行を確認し、先ほどの torch.cuda.is_available() チェックを再実行してください。
dmesg に Killed と表示され、Python の traceback がないままプロセスが消える場合は、kernel の out-of-memory killer が原因です。これは VRAM ではなく、システム RAM の不足です。オフロードではモデル全体をシステム RAM に常駐させる必要があるため、16 GB のマシンで 5B モデルをオフロードすると容量が不足します。RAM を増設するか、swap を追加してください。
FAQ
GPU のない VPS で AI 動画を生成できますか?
いいえ。2 回以上使う現実的な方法ではありません。24 GB GPU で 9 分かかる 5 秒の 720p クリップは、CPU では数時間かかります。モデルを実行する行列演算用ハードウェアがなく、システム RAM の帯域幅は GPU メモリの帯域幅より 1 桁小さいためです。CPU サーバーでは ComfyUI のインターフェースをホストし、モデルを保存してワークフローを保持できます。ただし、レンダリング自体には GPU が必要です。
Wan 2.2 にはどの程度の VRAM が必要ですか?
TI2V-5B モデルでは、ComfyUI のネイティブオフロードを使用する場合、8 GB が最低ラインです。公開されている速度を得るには、Alibaba が推奨する 24 GB が必要です。A14B の text-to-video モデルと image-to-video モデルでは、モデルカードに単一 GPU 推論で少なくとも 80 GB の VRAM が必要と記載されています。そのため、データセンター向けカードが必要です。
自己ホストしたクリップはどのくらいの長さにできますか?
2026 年 7 月時点では、720p で約 5 秒が実用上の単位です。より長い出力は、セグメントを生成して結合します。1 つのセグメントの最後のフレームを、次のセグメントの最初のフレームとして使用します。結合部分では品質が徐々に変化するため、長い動画は 1 回の生成ではなく、編集作業として扱ってください。
GPU カードを購入するより、時間単位でレンタルしたほうが安価ですか?
1 日あたりのレンダリング時間が数時間未満なら、レンタルのほうが有利です。2026 年 7 月時点で 24 GB カードの中央値は 1 時間あたり約 0.36 ドルです。この料金なら、そのカードの購入価格に達するまで長期間レンタルできます。また、実際に使いたいモデルに適さないクラスのハードウェアを購入するリスクも避けられます。購入が有利になるのは、そのマシンを毎日、ほぼ終日稼働させる場合だけです。