SSD Nodes Learn Hosting plans →
指南 Matt Connor作者: Matt Connor · 更新于 2026-08-13

自托管AI视频生成器:2026年实测能力与成本

了解2026年7月开源视频模型的真实输出:5秒720p片段需要多少显存、24GB与12GB显卡耗时差异、租用GPU的实际成本,以及何时应改用API。

自托管 AI 视频生成器目前实际能做什么

自托管 AI 视频生成器目前已经可以运行,但速度和规模都低于演示视频所展示的水平。截至 2026 年 7 月,值得运行的开源模型包括 Alibaba 的 Wan 2.2、Tencent 的 HunyuanVideo,以及在速度比真实感更重要时可选的 Lightricks 的 LTX-Video。它们都可以在配备 NVIDIA GPU 的 Linux 机器上通过 ComfyUI 运行。生成结果是大约 5 秒、720p 的视频片段。它不是完整场景,也不是 1 分钟的成片。

先给出简短结论,再说明细节。24 GB 显存的显卡可以在几分钟内渲染出 5 秒的 720p 视频片段。12 GB 显存的显卡完成同样的任务需要 20 分钟或更久,因为模型权重无法全部装入显存,软件需要不断在显存和系统 RAM 之间来回传输模型层。没有 GPU 的服务器无法以任何实用方式完成这项任务。CPU 图像生成缓慢的原因,同样会让 CPU 视频生成失去实际意义。

如果您已经读过自托管图像生成器的硬件梯度,那么视频生成的结论相同,只是每个数值都要提高一个等级。VRAM(显存,即焊接在图形芯片旁边的 RAM)仍然是唯一决定使用体验是顺畅还是痛苦的规格。

为什么生成一段视频的成本远高于生成一张图像

扩散模型通过分步去噪来生成图像,每一步都会读取模型中的所有权重。视频模型对整段帧块执行相同操作,并在时间维度上加入注意力机制,因此第 80 帧可以利用第 12 帧的信息。5 秒、每秒 24 帧的视频,一次批处理就包含 120 帧。

时间注意力机制导致成本不会随片段长度平稳增长。帧数翻倍后,采样器所需的内存会增加一倍以上,因此常见故障不是渲染变慢,而是渲染进程直接退出。

还有一个容易被忽略的内存峰值。采样器完成后,VAE(variational autoencoder,即将压缩潜变量转换为实际像素的组件)会一次性解码整个潜变量视频。这个解码过程所需的内存可能高于采样过程。典型表现是进度条显示已完成,随后输出:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

解决方法是使用分块解码,或缩短视频片段。确定内存耗尽的具体阶段,可以避免花一小时调整错误的参数。

AI 视频生成需要多少 VRAM

两组已发布的数据决定了整个判断,但看起来彼此矛盾。Alibaba 表示,Wan 2.2 TI2V-5B 模型可在单张消费级 GPU(例如 4090)上,以每秒 24 帧生成 720p、时长五秒的视频片段,耗时不到九分钟,并建议至少使用 24 GB VRAM。ComfyUI 文档则表示,同一个 5B 模型“使用 ComfyUI 原生卸载后,应能很好地运行在 8GB vram 上”。

两者都正确,因为它们衡量的是不同的情况。8 GB 是能够运行的下限。24 GB 是运行更顺畅的配置。卸载机制会将模型的大部分内容保留在系统 RAM 中,并在每个步骤中将各层传输到 GPU。因此,GPU 会把大量时间花在等待 PCIe 总线传输上,而不是执行计算。这个开销会在每个采样器步骤中重复产生,而不是只产生一次。

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

只有最后一行是厂商数据。24 GB 显卡每个视频片段耗时 9 分钟,这正是 Alibaba 为该模型公布的数据。其他行反映的是卸载机制带来的影响,数量级仅供参考,并非基准测试结果。重点在于整体趋势:8 GB 显卡每个片段耗时 40 分钟,虽然技术上可以运行,但实际上更像是一个需要放着运行一整晚的批处理任务。

更大的 Wan 2.2 模型属于另一种情况。A14B 文生视频和图生视频变体在单 GPU 推理时至少需要 80 GB VRAM。这是数据中心硬件,不是放在桌面机器中的显卡;到了这个规模,自托管通常意味着按小时租用他人的加速器。同样的计算还会在文本模型领域进一步扩大。此时,自行托管像 Kimi K3 这样的 2.8 万亿参数模型不再是单张显卡能否运行的问题,而是你能负担连接多少张 80 GB 显卡的问题。

租用 GPU 生成一段视频片段的成本

对于大多数人来说,租用 GPU 是测试这项技术的正确方式。因为如果最终需要的模型要求 80 GB 显存,那么购买的显卡可能并不适用。以下是截至 2026 年 7 月 GPU 租赁市场的按需价格中位数:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

4090 这一行运行 5B 模型,按每小时 0.36 美元计算,每个片段的成本约为 0.05 美元。80 GB 显存的几行运行 14B 模型,因此每个片段的成本上升到 0.6 美元,尽管硬件本身快得多。模型越大,每秒视频所需的计算量越多。

每个片段 5 美分听起来几乎不算什么,但这正是容易误判的地方。你第一次得到可用的 5 秒视频时,通常不会只渲染一次。使用视频模型生成内容本质上是在搜索;对于包含特定运动的镜头,通常需要渲染 20 到 40 次才能得到可用结果。因此,一次有效的工作会话成本是几美元,而不是几美分;在租用的硬件上迭代一个下午,费用大约相当于一顿午餐。

如果忽略两个租赁细节,费用可能会明显增加。实例下载模型权重期间也会计费。Wan 2.2 文件以及其文本编码器和 VAE 加起来有数十 GB,因此应选择支持持久卷的服务商,只下载一次。实例空闲但 SSH 会话仍保持打开时也会计费。不要只关闭终端,而应停止实例。

在 GPU 服务器上安装 ComfyUI

从已安装 NVIDIA 驱动的 Ubuntu 24.04 开始。先检查驱动。否则后续所有故障看起来都一样。

nvidia-smi

该命令必须输出包含显卡和 CUDA 版本的表格。如果输出 NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver,说明内核模块未加载。这通常是内核升级后未重启导致的。先在这里修复。否则 ComfyUI 会回退到 CPU 路径,您可能会花费一小时错误地排查模型。

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

在下载任何权重文件前,确认 PyTorch 能识别显卡。

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True 加上显卡名称表示软件栈正常。False 表示已安装的 wheel 是仅支持 CPU 的构建版本。通常原因是 pip 找到了早期安装时缓存的 torch。使用上面的 index URL 重新安装。

下载 Wan 2.2 模型文件

ComfyUI 不附带模型权重,视频模型也不是单个文件。它由扩散模型、文本编码器和 VAE 组成,每个组件都放在各自的目录中。如果将文件放入错误的文件夹,加载器节点不会列出该文件,也不会提供任何错误信息说明原因。

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

5B 模型同时支持文本生成视频和图像生成视频,因此适合作为起点。始终优先使用 .safetensors,而不是 .ckpt.ckpt 文件是经过 pickle 序列化的 Python 对象,加载它会执行构建该文件的人员写入的代码。请预留充足的磁盘空间:包含一个模型系列及其输出的可用安装需要 100 GB;视频文件也远大于图像工作流生成的 PNG 文件。使用类似将增量备份加密后保存到对象存储的方法备份工作流 JSON 文件,因为模型权重可以重新下载,而调试完成的工作流无法重新下载。

运行并安全访问

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI 没有登录界面,也没有用户账户。任何能够访问 8188 端口的对象都可以提交任务、读取您生成的所有视频片段,以及安装自定义节点。这相当于在服务器上执行任意代码。请将其绑定到 localhost,然后从您自己的计算机通过 SSH 隧道访问。

ssh -N -L 8188:127.0.0.1:8188 you@your-server

然后在浏览器中打开 http://127.0.0.1:8188。请从 ComfyUI 的模板菜单加载 Wan 2.2 模板工作流,不要手动连接节点。官方模板包含针对该模型调优的采样器设置。视频工作流中容易无意间填错参数的位置也比图像工作流多得多。

何时应使用 API

当视频生成量大且稳定、帧数据不得离开自有基础设施,或需要托管服务不提供的特定模型或自定义适配器时,自托管视频生成是正确的选择。如果要求生成管线在一年后仍以相同方式运行,自托管同样更合适,因为托管模型可能在没有可固定版本的情况下发生变化。

当每月只需生成少量片段、需要的输出时长或分辨率超过开源模型的能力,或本周就有交付期限时,应使用托管 API。应如实计算盈亏平衡点。按 2026 年 7 月的中位价格计算,一块全天候租用的 24 GB 显卡每月约需 260 美元;购买同一块显卡则要先支付高于这一金额的成本,而且此时还没有生成一帧。闲置的自托管服务器在任何情况下都无法胜过按片段计费的 API 定价。这与决定如何提供文本模型服务的是同一个取舍,详见 Ollama 与 vLLM 的自托管 LLM 服务对比;而它建立在 VPS 配备 GPU 是否值得投入 所讨论的更基本问题之上。

渲染失败时要检查什么

如果采样器进度条已经完成,但渲染在最后阶段退出,通常是 VAE 解码时内存不足。请减少帧数,或切换到分块解码节点。修改步数没有帮助,因为解码只执行一次,而且发生在所有步数完成之后。

如果输出是纯黑画面或严重乱码,通常表示 VAE 与模型不匹配。将 Wan 2.1 VAE 加载到 Wan 2.2 diffusion model 上就会产生这种结果,并且日志中不会显示任何错误。

如果渲染可以运行,但在一台已确认配备 GPU 的机器上需要数小时,说明 ComfyUI 正在使用 CPU 路径。检查启动日志中的设备信息,然后重新运行上面的 torch.cuda.is_available() 检查。

如果进程消失,并且 dmesg 中出现 Killed,但没有 Python traceback,这表示触发了内核的 out-of-memory killer。因此不足的是系统 RAM,而不是 VRAM。卸载模型需要将完整模型驻留在系统 RAM 中,因此使用 16 GB 内存的计算机卸载 5B 模型时内存不足。请增加 RAM 或添加 swap。

FAQ

我可以在没有 GPU 的 VPS 上生成 AI 视频吗?

不行,至少不适合反复使用。使用 24 GB GPU 生成一个 5 秒的 720p 视频片段需要 9 分钟,而使用 CPU 可能需要数小时。这是因为模型无法使用矩阵硬件运行,而系统 RAM 的带宽比 GPU 内存带宽低一个数量级。CPU 服务器可以托管 ComfyUI 界面、存储模型并保存工作流,但实际渲染需要 GPU。

Wan 2.2 需要多少 VRAM?

对于 TI2V-5B 模型,使用 ComfyUI 原生卸载时,8 GB 是最低要求;如果要达到公布的速度,Alibaba 建议使用 24 GB。对于 A14B 文生视频和图生视频模型,模型卡要求单 GPU 推理至少使用 80 GB VRAM,因此需要数据中心级显卡。

自托管视频片段可以持续多长时间?

截至 2026 年 7 月,720p 下约 5 秒是实际可行的时长单位。更长的视频需要先生成多个片段,再将它们拼接起来,并使用前一个片段的最后一帧作为下一个片段的第一帧。拼接处的画质会逐渐偏移,因此应将长视频视为剪辑任务,而不是一次生成完成。

按小时租用 GPU 是否比购买显卡更便宜?

如果每天渲染时间少于几小时,租用更划算。按 2026 年 7 月 24 GB 显卡约 0.36 美元/小时的中位价计算,您可以租用很长时间后才达到购买该显卡的成本,同时也避免购买后才发现硬件级别不适合实际使用的模型。只有当这台服务器每天大部分时间都在运行,并且持续如此时,购买才更划算。