自行託管 AI 影片生成器:實際需要多少 VRAM?
截至 2026 年 7 月,Wan 2.2、HunyuanVideo 與 LTX-Video 實際能產生什麼?比較 12 GB 與 24 GB VRAM、720p 五秒片段的 GPU 租用成本,以及何時改用 API。
自行託管 AI 影片生成器實際能做什麼
自行託管的 AI 影片生成器目前已可運作,但速度較慢、產出內容也比示範影片所暗示的規模小。截至 2026 年 7 月,值得執行的開放模型包括 Alibaba 的 Wan 2.2、Tencent 的 HunyuanVideo,以及在速度比真實感更重要時可使用的 Lightricks LTX-Video。這些模型都能在配備 NVIDIA GPU 的 Linux 電腦上透過 ComfyUI 執行。產出的影片大約是 720p、五秒長的片段。不是完整場景,也不是一分鐘的成品影片。
以下先提供簡短答案,再說明細節。24 GB 顯示卡可在幾分鐘內完成 720p、五秒影片片段的算圖。12 GB 顯示卡則需要 20 分鐘以上,因為模型權重無法完整放入視訊記憶體,軟體必須持續在視訊記憶體與系統 RAM 之間搬移模型層。沒有 GPU 的伺服器無法以任何實用方式完成這項工作。讓 CPU 影像生成變慢的運算量,也會讓 CPU 影片生成變得毫無實用價值。
如果你已經讀過自行託管影像生成器的硬體級距,影片生成的情況就是同一套判斷,只是每個數字都提高一個級距。VRAM(視訊記憶體,也就是焊接在圖形晶片旁的 RAM)仍是唯一能決定這項工作是順暢還是痛苦的規格。
為何一部影片的成本遠高於一張圖片
diffusion model 會以多個步驟對圖片進行去雜訊處理,而每個步驟都會讀取模型中的所有權重。video model 會對整個影格區塊同時執行相同處理,並加入跨時間的 attention,讓第 80 個影格知道第 12 個影格的內容。每秒 24 個影格的 5 秒影片,會在單一批次中包含 120 個影格。
這種時間 attention 是成本不會隨片段長度平順增加的原因。影格數量加倍時,sampler 所需的記憶體會增加超過 2 倍,因此故障模式不是轉譯速度變慢,而是轉譯程序中止。
還有第二個使用者通常意料不到的記憶體尖峰。sampler 完成後,VAE(variational autoencoder,將壓縮的 latent 轉換為實際像素的元件)會一次解碼整部 latent video。這個解碼程序所需的記憶體可能高於取樣程序。其特徵是工作顯示進度列已完成,接著輸出以下內容:
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB解決方法是使用 tiled decoding,或縮短片段。確認記憶體耗盡的階段,可避免花費 1 小時調整錯誤的設定。
AI 影片生成需要多少 VRAM
兩個已發布的數據構成了整個決策的基礎,但看起來彼此矛盾。Alibaba 表示,Wan 2.2 TI2V-5B 模型可在單張消費級 GPU(例如 4090)上,以每秒 24 幀的速率產生 720p、長度 5 秒的影片,耗時不到 9 分鐘,並建議至少使用 24 GB 的 VRAM。ComfyUI 文件則指出,同一個 5B 模型「搭配 ComfyUI 原生 offloading,應可在 8GB vram 上順利執行」。
兩者都正確,因為測量的是不同事項。8 GB 是能夠執行的最低容量。24 GB 則是能夠順暢執行的容量。offloading 會將模型的大部分內容保留在系統 RAM 中,並在每個步驟將各層串流至 GPU。因此,GPU 會把時間耗在等待 PCIe 匯流排,而不是執行計算。這項成本會在每個 sampler 步驟產生,而不是只產生一次。
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]只有最後一列是供應商提供的數據。24 GB 顯示卡每段影片耗時 9 分鐘,這是 Alibaba 為此模型公布的數據。其他各列顯示 offloading 對效能的影響,其數值僅代表數量級,不是基準測試結果。重點在於整體趨勢:8 GB 顯示卡每段影片耗時 40 分鐘。這種設定在技術上可運作,但實際上像是必須放著執行一整晚的批次工作。
較大型的 Wan 2.2 模型則屬於另一個層級。A14B 文字轉影片和圖片轉影片變體,在單 GPU 推論時至少需要 80 GB 的 VRAM。這是資料中心硬體,不是放在桌上型電腦中的顯示卡。到了這個程度,自行託管通常代表按小時計租用他人的加速器。
租用 GPU 上一段影片的成本
對大多數人而言,租用 GPU 是測試這項技術的方式。因為如果最後想使用的模型需要 80 GB,購買的顯示卡可能就不是合適的硬體。截至 2026 年 7 月,GPU 租用市場的隨需價格中位數如下:
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]4090 列可執行 5B 模型。每小時費用約為 0.36 美元,每段影片的成本約為 0.05 美元。80 GB 列可執行 14B 模型,因此每段影片的成本會提高到 0.6 美元,即使硬體本身的速度快得多。模型越大,每秒影片所需的運算量越高。
每段影片 5 美分似乎微不足道,但這正是容易誤判之處。第一段可用的 5 秒影片,絕不會只需生成一次。提示影片模型是一種搜尋過程;對於包含特定動作的鏡頭,在找到可用結果前生成 20 到 40 次很正常。因此,一次工作階段的成本是以美元計,而不是以美分計。在租用硬體上花一個下午反覆調整,費用大約和一頓午餐相同。
如果忽略租用服務的 2 個細節,會產生實際費用。執行個體下載模型權重時也會計費,而 Wan 2.2 檔案及其文字編碼器與 VAE 的大小達數十 GB,因此應選擇提供持久性磁碟區的供應商,並只下載一次。執行個體在 SSH 工作階段開啟但閒置時也會計費。請停止執行個體,不要只關閉終端機。
在 GPU 主機上安裝 ComfyUI
從已安裝 NVIDIA 驅動程式的 Ubuntu 24.04 開始。先檢查驅動程式,否則後續所有錯誤看起來都會相同。
nvidia-smi此命令必須輸出包含顯示卡與 CUDA 版本的表格。如果輸出 NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver,表示核心模組未載入。這通常是核心升級後未重新開機所致。請在此處修正。否則 ComfyUI 會退回 CPU 路徑,您可能會花費 1 小時錯怪模型。
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt下載任何權重檔案前,先確認 PyTorch 能偵測到顯示卡。
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"True 加上您的顯示卡名稱表示整個軟體堆疊正常。False 表示已安裝的 wheel 是僅支援 CPU 的版本。這通常發生在 pip 找到先前安裝所留下的快取 torch 時。請使用上方的 index URL 重新安裝。
下載 Wan 2.2 模型檔案
ComfyUI 不會附帶權重,而影片模型也不是單一檔案。它由 diffusion model、text encoder 和 VAE 組成,且每個元件都必須放在各自的目錄中。若將檔案放入錯誤的資料夾,loader node 就不會列出該檔案,也不會顯示原因。
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors5B 模型同時支援 text-to-video 和 image-to-video,因此適合作為起點。請一律優先使用 .safetensors,而非 .ckpt。.ckpt 檔案是 pickled Python object,因此載入該檔案會執行建立者所撰寫的程式碼。請預留充足的磁碟空間:包含一個模型系列及其輸出檔案的可用安裝需要 100 GB,而影片檔案也遠大於影像工作流程產生的 PNG 圖片。請使用類似 加密的物件儲存增量備份 的方式備份 workflow JSON 檔案,因為權重可以重新下載,但調校完成的工作流程無法重新取得。
執行並安全存取
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188ComfyUI 沒有登入畫面,也沒有使用者帳戶。任何能連線到連接埠 8188 的人,都可以佇列工作、讀取您產生的所有片段,並安裝自訂節點;這等同於在伺服器上執行任意程式碼。請將其繫結至 localhost,並從您自己的電腦透過 SSH 通道存取。
ssh -N -L 8188:127.0.0.1:8188 you@your-server接著在瀏覽器中開啟 http://127.0.0.1:8188。請從 ComfyUI 的範本選單載入 Wan 2.2 範本工作流程,不要手動連接節點。官方範本包含模型調校所使用的採樣器設定;與影像工作流程相比,影片工作流程中更容易有許多值在不知不覺間設定錯誤。
應使用 API 的坦誠答案
當工作量高且穩定、影格不得離開自有基礎架構,或需要特定模型或任何代管服務都未提供的自訂 adapter 時,自行代管影片生成是正確選擇。如果 pipeline 必須在一年後仍以相同方式運作,自行代管也較適合,因為代管模型可能在未提供可固定的版本時變更。
當每月只需要少量片段、需要的輸出長度或尺寸超過開放模型的能力,或本週就有截止期限時,請使用代管 API。請如實計算損益平衡點。以 2026 年 7 月的中位數計算,全天候租用一張 24 GB 顯示卡每月約需 260 美元;購買相同顯示卡的前期成本也高於此金額,而且在生成任何影格前就必須支付。閒置的自行代管伺服器每次都會輸給按片段計費的 API。這與決定文字模型提供方式的取捨相同,詳見 自行代管 LLM 提供服務時的 Ollama 與 vLLM 比較;此外,還有 VPS 是否值得花錢搭配 GPU 中更基本的問題。
Render 失敗時的檢查項目
如果 sampler 進度列已完成,但 Render 在最後階段中止,表示 VAE 解碼時記憶體不足。請減少影格數,或改用 tiled decode node。調整步數沒有幫助,因為解碼只會執行一次,而且所有步驟都已經完成。
如果輸出完全是黑色,或嚴重錯亂,通常表示 VAE 與模型不相容。將 Wan 2.1 VAE 載入至 Wan 2.2 diffusion model 就會產生這種結果,而且 log 中不會顯示任何錯誤。
如果 Render 可以執行,但在已知配備 GPU 的機器上仍需數小時,表示 ComfyUI 正在使用 CPU 路徑。請檢查啟動 log 中的裝置行,然後重新執行上方的 torch.cuda.is_available() 檢查。
如果程序在 dmesg 中以 Killed 消失,且沒有 Python traceback,表示這是 kernel 的 out-of-memory killer 所造成。因此問題出在系統 RAM,而不是 VRAM。Offloading 需要將完整模型常駐於系統 RAM,因此在 16 GB 機器上對 5B 模型執行 offloading 會導致記憶體不足。請增加 RAM 或加入 swap。
FAQ
我可以在沒有 GPU 的 VPS 上產生 AI 影片嗎?
不行,至少不適合重複使用。使用 24 GB GPU 需要 9 分鐘產生的 5 秒 720p 片段,在 CPU 上可能需要數小時。這是因為模型沒有可執行矩陣運算的硬體,而系統 RAM 頻寬比 GPU 記憶體頻寬低一個數量級。CPU 伺服器可以代管 ComfyUI 介面、儲存模型並保留工作流程,但實際算圖需要 GPU。
Wan 2.2 需要多少 VRAM?
對於 TI2V-5B 模型,使用 ComfyUI 原生卸載功能時,8 GB 是最低需求;若要達到已公布的速度,Alibaba 建議使用 24 GB。對於 A14B 文字轉影片和圖片轉影片模型,模型卡要求單 GPU 推論至少具備 80 GB VRAM,因此需要資料中心 GPU。
自行代管的片段可以多長?
截至 July 2026,720p 下約 5 秒是實務上可行的單位。較長的輸出會透過產生多個片段再將其串接而成,並將前一個片段的最後一幀作為下一個片段的第一幀。串接處的品質會逐漸偏移,因此應將長影片視為剪輯工作,而不是一次生成。
按小時租用 GPU 比購買 GPU 便宜嗎?
如果每天算圖時間少於幾小時,租用較划算。以 July 2026 期間 24 GB GPU 每小時約 0.36 美元的中位數價格計算,在租金達到該 GPU 的購買價格前,可以租用很長時間;此外,也能避免購買後才發現硬體等級不適合實際使用的模型。只有在該伺服器每天大部分時間都持續運作時,購買才較划算。