SSD Nodes Learn Hosting plans →
指南 Matt Connor作者: Matt Connor · 已更新 2026-08-13

自架 AI 影片生成器實際能做什麼?

截至 2026 年 7 月,Wan 2.2、HunyuanVideo 與 LTX-Video 可產生約五秒 720p 短片;了解各模型所需 VRAM、租用 GPU 成本,以及何時改用 API。

自架 AI 影片生成器實際能做什麼

自架 AI 影片生成器目前確實可用,但速度與規模都比示範影片所呈現的更有限。截至 2026 年 7 月,值得執行的開放模型包括 Alibaba 的 Wan 2.2、Tencent 的 HunyuanVideo,以及在速度比寫實度更重要時可使用的 LTX-Video(由 Lightricks 開發)。這些模型都能在配備 NVIDIA GPU 的 Linux 主機上透過 ComfyUI 執行。輸出結果通常是約五秒、720p 的短片。不是完整場景,也不是一分鐘的成片。

先給出簡短結論,再說明細節。24 GB 顯示卡渲染一段五秒的 720p 短片,需時數分鐘,通常不超過 10 分鐘。12 GB 顯示卡執行相同工作則需 20 分鐘以上,因為模型權重無法完整放入顯示記憶體,軟體必須持續在顯示記憶體與系統 RAM 之間搬移模型層。沒有 GPU 的伺服器無法在實用範圍內完成這項工作。讓 CPU 影像生成變慢的運算量,也會讓 CPU 影片生成失去實用性。

如果你已經讀過 自架影像生成器的硬體分級,影片生成採用的是相同的判斷方式,只是每個數值都上調一個等級。VRAM(顯示記憶體,也就是焊接在圖形晶片旁的 RAM)仍是唯一能決定這項工作是順暢還是痛苦的規格。

為什麼一段影片的成本遠高於一張圖片

擴散模型會逐步去除雜訊來生成圖片,而每個步驟都會讀取模型中的所有權重。影片模型則會同時對整個影格區塊執行相同處理,並加入跨時間的 attention,讓第 80 個影格能掌握第 12 個影格的內容。每秒 24 個影格的 5 秒影片,單一批次就包含 120 個影格。

這種時間 attention 會讓成本無法隨影片長度平順成長。影格數量加倍時,sampler 所需的記憶體增加幅度會超過兩倍,因此常見的失敗情況不是渲染變慢,而是渲染程序直接終止。

還有第二個使用者通常意料不到的記憶體尖峰。sampler 完成後,VAE(variational autoencoder,負責將壓縮後的 latent 轉換為實際像素的元件)會一次解碼整段 latent 影片。這個解碼步驟所需的記憶體可能高於取樣步驟。其症狀是工作顯示進度列已完成,接著輸出以下內容:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

解決方法是使用 tiled decoding,或縮短影片長度。先確認是哪個階段耗盡記憶體,就能避免花一小時調整錯誤的設定。

AI 影片生成需要多少 VRAM

兩個已發布的數據可以界定整個決策範圍,但看起來彼此矛盾。Alibaba 表示,Wan 2.2 TI2V-5B 模型可在單張 4090 等消費級 GPU 上,以每秒 24 幀產生 720p、長度 5 秒的影片,耗時不到 9 分鐘,並建議至少使用 24 GB VRAM。ComfyUI 文件則表示,同一個 5B 模型「搭配 ComfyUI 原生 offloading,應可順利使用 8GB vram」。

兩者都正確,因為衡量的是不同事情。8 GB 是能夠執行的容量。24 GB 則是較為寬裕的容量。Offloading 會將模型的大部分內容保留在系統 RAM,並在每個步驟將各層串流至 GPU,因此顯示卡大部分時間都在等待 PCIe bus,而不是進行運算。這項成本會在每個 sampler step 都產生,而不是只產生一次。

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

只有最後一列是供應商提供的數據。24 GB 顯示卡每個影片耗時 9 分鐘,這是 Alibaba 為此模型公布的數字。其他各列反映的是 offloading 對效能的影響,屬於數量級估算,不是基準測試結果。重點在於這個趨勢:8 GB 顯示卡每個影片需要 40 分鐘,技術上可以執行,但實際上必須當成批次工作,放著執行一整晚。

較大型的 Wan 2.2 模型則是另一個層級。A14B 的文字轉影片與圖片轉影片變體,在單 GPU 推論時至少需要 80 GB VRAM。這是資料中心硬體,不是放進桌上型電腦的顯示卡;到了這個階段,自架服務開始代表按小時計費租用他人的 accelerator。文字模型方面,計算需求還會大幅增加;自行託管 2.8 trillion parameter 的 Kimi K3 不再只是單張顯示卡的問題,而是取決於你能負擔串接多少張 80 GB 顯示卡。

租用 GPU 產生一段影片的成本

大多數人都應該先採用租用方式測試,因為如果最後想用的模型需要 80 GB,你購買的顯示卡可能就不適用。以下是截至 2026 年 7 月,GPU 租用市場的隨選價格中位數:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

4090 列執行 5B 模型,每段影片的成本約為 0.05 美元,時租約為 0.36 美元。80 GB 列執行 14B 模型,因此每段影片的成本會跳升至 0.6 美元,儘管硬體本身快得多。模型越大,每秒影片所需的運算量越高。

每段影片 5 美分聽起來微不足道,但這正是容易誤判的地方。第一個可用的 5 秒片段,絕不會只需要產生一次。為影片模型撰寫提示詞其實是一種搜尋;對於包含特定動態的鏡頭,在找到可用結果前產生 20 到 40 次是正常的。因此,一次工作階段的成本是幾美元,而不是幾美分;在租用硬體上反覆調整一個下午,費用大約相當於一頓午餐。

有兩項租用細節若忽略,會產生實際費用。系統下載模型權重時仍會計費,而 Wan 2.2 檔案加上文字編碼器與 VAE,總大小可達數十 GB,因此請選擇支援持久性磁碟區的供應商,並只下載一次。透過 SSH 工作階段連線但讓主機閒置時,也會持續計費。請停止執行個體,不要只關閉終端機。

在 GPU 伺服器上安裝 ComfyUI

從已安裝 NVIDIA driver 的 Ubuntu 24.04 開始。先檢查 driver,因為未執行這項檢查時,後續所有錯誤看起來都一樣。

nvidia-smi

此命令必須輸出包含顯示卡與 CUDA 版本的表格。若輸出 NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver,表示 kernel module 尚未載入,通常是 kernel upgrade 後未重新開機所致。請先在此處修正。否則 ComfyUI 會改用 CPU 路徑,之後你可能會花一個小時誤以為是模型造成問題。

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

在下載任何 weight file 前,先確認 PyTorch 能辨識這張顯示卡。

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True 加上你的顯示卡名稱,表示整個 stack 運作正常。False 表示已安裝的 wheel 是僅支援 CPU 的版本。這通常發生在 pip 找到先前安裝留下的 cached torch 時。請使用上方的 index URL 重新安裝。

下載 Wan 2.2 模型檔案

ComfyUI 不會附帶權重,而影片模型也不是單一檔案。它由 diffusion model、text encoder 和 VAE 組成,且每個元件都必須放在自己的目錄中。若將檔案放入錯誤的資料夾,loader node 就不會列出該檔案,也不會顯示任何錯誤說明原因。

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

5B 模型同時支援 text-to-video 和 image-to-video,因此適合作為起點。請一律優先使用 .safetensors,而不要使用 .ckpt.ckpt 檔案是 pickled Python object,載入時會執行建立該檔案的人員寫入的程式碼。請預留充足的磁碟空間:包含一個模型系列及其輸出檔案的可用安裝至少需要 100 GB,而影片檔案也遠大於影像工作流程產生的 PNG 圖片。請使用 加密的物件儲存增量備份 等方式備份 workflow JSON 檔案,因為權重可以重新下載,但調整完成的工作流程無法重新取得。

執行並安全存取

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI 沒有登入畫面,也沒有使用者帳號。任何能連到 8188 埠的對象都可以排入工作、讀取你產生的所有影片片段,並安裝 custom nodes;這等同於在伺服器上執行任意程式碼。請將它繫結至 localhost,再從自己的電腦透過 SSH tunnel 存取。

ssh -N -L 8188:127.0.0.1:8188 you@your-server

接著在瀏覽器中開啟 http://127.0.0.1:8188。請從 ComfyUI 的 templates 選單載入 Wan 2.2 範本工作流程,不要手動連接節點。官方範本包含模型調校所使用的 sampler 設定;與影像工作流程相比,影片工作流程中更容易有許多參數在不知不覺間設定錯誤。

何時應使用 API

當使用量高且穩定、影格不得離開自有基礎架構,或需要託管服務未提供的特定模型或自訂 adapter 時,自行架設影片生成服務才是正確選擇。如果要求 pipeline 在一年後仍以相同方式運作,自行架設也較合適,因為託管模型可能在未提供可固定的版本時自行變更。

如果每月只需要少量片段、需要的輸出長度或尺寸超過開放模型的能力,或本週就有交付期限,請使用託管 API。請如實計算損益平衡點。以 July 2026 的中位數計算,全天候租用一張 24 GB 顯示卡,每月約需 260 dollars;直接購買同一張顯示卡,尚未生成任何影格前,前期成本就已超過這個金額。閒置的自行架設主機每次都會輸給按片段計費的 API。這與決定如何提供文字模型服務的取捨相同,詳見 Ollama 與 vLLM 的自行架設 LLM 服務;而這建立在 具備 GPU 的 VPS 是否值得投入成本 所討論的更基本問題之上。

render 失敗時的檢查項目

如果 render 在最後階段中止,且 sampler 進度列已完成,通常是 VAE 解碼時記憶體不足。請減少影格數,或改用 tiled decode node。調整 step count 沒有幫助,因為解碼只會執行一次,而且是在所有步驟完成後才執行。

如果輸出是全黑或嚴重錯亂,通常表示 VAE 與模型不相容。使用 Wan 2.1 VAE 載入 Wan 2.2 diffusion model 就會產生這種結果,而且 log 中不會顯示任何錯誤。

如果 render 能執行,但在確定配有 GPU 的機器上仍需要數小時,表示 ComfyUI 使用的是 CPU 路徑。請檢查啟動 log 中的裝置資訊,然後重新執行上方的 torch.cuda.is_available() check。

如果程序消失,dmesg 中出現 Killed,且沒有 Python traceback,表示這是 kernel 的 out-of-memory killer 所致。因此不足的是系統 RAM,不是 VRAM。Offloading 需要將完整模型載入系統 RAM,因此讓 16 GB 主機 offload 5B 模型時,記憶體會不足。請增加 RAM,或加入 swap。

FAQ

我可以在沒有 GPU 的 VPS 上生成 AI 影片嗎?

不行,至少無法以實際會重複使用的方式進行。使用 24 GB GPU 生成 5 秒、720p 影片需要 9 分鐘時,在 CPU 上可能需要數小時,因為模型沒有可供執行矩陣運算的硬體,而系統 RAM 的頻寬比 GPU 記憶體頻寬低一個數量級。CPU 伺服器可以託管 ComfyUI 介面、儲存模型並保存工作流程,但實際算圖仍需要 GPU。

Wan 2.2 需要多少 VRAM?

對 TI2V-5B 模型而言,使用 ComfyUI 原生 offloading 時,8 GB 是最低需求;若要達到已公布的速度,Alibaba 建議使用 24 GB。至於 A14B text-to-video 和 image-to-video 模型,模型卡要求單 GPU inference 至少具備 80 GB VRAM,因此需要 data-center 顯示卡。

自行託管的影片片段可以多長?

截至 July 2026,實務上以 720p、約 5 秒為一個單位。較長的輸出必須先生成多個片段,再將它們接合;做法是把其中一個片段的最後一幀作為下一個片段的第一幀。接合處的畫質會逐漸偏移,因此應將長影片視為剪輯工作,而不是一次生成完成。

按小時租用 GPU 是否比購買顯示卡便宜?

每天算圖時間少於數小時時,租用較划算。以 July 2026 的中位價格計算,24 GB 顯示卡約為每小時 0.36 dollars;在租金累積到該顯示卡的購買價格之前,通常可以租用很長時間,也能避免買下實際模型不適用的硬體等級。只有在該伺服器每天幾乎整天都滿載時,購買才較划算。