自托管 AI 视频生成器需要多少显存?
了解 2026 年 7 月 Wan 2.2、HunyuanVideo 和 LTX-Video 的实际效果:720p 五秒片段需要多少 VRAM、租用 GPU 成本,以及何时应改用 API。
自托管 AI 视频生成器实际能做什么
自托管 AI 视频生成器目前已经可以使用,但速度更慢、规模更小,不如演示视频所暗示的效果。截至 2026 年 7 月,值得运行的开放模型包括 Alibaba 的 Wan 2.2 和 Tencent 的 HunyuanVideo;如果速度比真实感更重要,还可以使用 Lightricks 的 LTX-Video。它们都可以在 Linux 机器上的 NVIDIA GPU 中通过 ComfyUI 运行。生成结果是一个约五秒、720p 的视频片段。不是一个场景,也不是一分钟的成片。
先给出简短结论,再说明细节。24 GB 显卡可以在几分钟内生成一个五秒的 720p 视频片段。12 GB 显卡完成相同任务需要20分钟或更长时间,因为模型权重无法全部放入显存,软件会持续在显存和系统 RAM 之间来回移动层。没有 GPU 的服务器无法以任何实用方式完成这项工作。让 CPU 图像生成变慢的计算量,也会让 CPU 视频生成失去实际意义。
如果您已经读过自托管图像生成器的硬件梯度,那么视频生成的情况相同,只是所有规格都提升了一个级别。VRAM(显存,即焊接在图形芯片旁边的 RAM)仍然是决定使用体验顺畅还是困难的唯一规格。
为什么一个视频的成本远高于一张图像
扩散模型通过逐步去噪来生成图像,每一步都会读取模型中的全部权重。视频模型也执行相同的过程,但会一次处理整批帧,并增加跨时间的注意力机制,使第 80 帧能够了解第 12 帧的内容。每秒 24 帧、时长 5 秒的视频,一次批处理就包含 120 帧。
正是这种时间注意力机制,使成本不会随片段长度平稳增长。帧数翻倍时,采样器所需的内存会增加得更多,因此故障表现不是渲染变慢,而是渲染进程终止。
还有一次许多人没有预料到的内存峰值。采样器完成后,VAE(variational autoencoder,即将压缩的 latent 转换为实际像素的组件)会一次性解码整个 latent 视频。这一步所需的内存可能比采样过程更多。典型表现是进度条显示已完成,随后输出以下内容:
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB解决方法是使用分块解码,或缩短片段时长。确定是哪一个阶段耗尽了内存,可以避免花费一小时调整错误的参数。
AI 视频生成需要多少 VRAM
两个已发布的数据决定了整个选择,但看起来相互矛盾。Alibaba 表示,Wan 2.2 TI2V-5B 模型可以在单张消费级 GPU(例如 4090)上,以每秒 24 帧生成 720p、时长 5 秒的视频片段,耗时少于 9 分钟,并建议至少使用 24 GB VRAM。ComfyUI 文档则表示,同一个 5B 模型“使用 ComfyUI 原生卸载后,应能很好地适配 8GB vram”。
两者都正确,因为衡量的对象不同。8 GB 是能够运行的最低容量。24 GB 才是运行起来比较从容的容量。卸载的工作方式是将模型的大部分内容保留在系统 RAM 中,并在每个步骤中将各层传输到 GPU。因此,显卡大部分时间都在等待 PCIe 总线,而不是执行计算。每个采样器步骤都会产生这项开销,而不是只产生一次。
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]只有最后一行是厂商数据。24 GB 显卡每个片段耗时 9 分钟,这是 Alibaba 发布的该模型数据。其他行表示卸载带来的影响,属于数量级估算,而不是基准测试结果。重点在于这种趋势:8 GB 显卡需要 40 分钟生成一个片段。技术上可以运行,实际使用时却相当于提交一个需要连夜运行的批处理任务。
更大的 Wan 2.2 模型属于另一种情况。A14B 文生视频和图生视频变体要求至少 80 GB VRAM 才能进行单 GPU 推理。这需要数据中心硬件,不是可以安装在桌面计算机中的显卡。到了这个级别,自托管通常意味着按小时租用他人的加速器。
租用 GPU 上生成一个片段的成本
对于大多数人来说,租用 GPU 是测试这项技术的正确方式。因为如果最终想使用的模型需要 80 GB 显存,那么购买的显卡可能并不适用。截至 2026 年 7 月,GPU 租赁市场的按需价格中位数如下:
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]4090 行运行 5B 模型,每个片段的成本约为 0.05 美元,价格为每小时 0.36 美元。80 GB 显存的机型运行 14B 模型,因此每个片段的成本上升到 0.6 美元,尽管其硬件本身快得多。模型越大,生成每秒视频所需的计算量越多。
每个片段 5 美分似乎微不足道,但这正是容易误判的地方。第一个可用的 5 秒片段绝不会一次生成成功。使用视频模型生成内容本质上是搜索过程。对于包含特定运动的镜头,通常需要生成 20 到 40 次,才能得到一个可用结果。因此,一次工作会话的成本是几美元,而不是几美分。在租用的硬件上迭代一个下午,费用大约相当于一顿午餐。
如果忽略以下两个租赁细节,费用会明显增加。实例下载模型权重时也会计费。Wan 2.2 文件及其文本编码器和 VAE 的总大小达到几十 GB,因此应选择支持持久化卷的提供商,只下载一次。实例空闲但 SSH 会话仍处于打开状态时也会计费。不要只关闭终端,而应停止实例。
在 GPU 服务器上安装 ComfyUI
从已安装 NVIDIA 驱动的 Ubuntu 24.04 开始。先检查驱动,因为不进行此检查,后续所有故障看起来都一样。
nvidia-smi该命令必须输出包含显卡和 CUDA 版本的表格。如果输出 NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver,说明内核模块未加载。这通常是内核升级后未重启导致的。请先在此处修复。否则 ComfyUI 会回退到 CPU 路径,您可能会浪费一个小时错误地怀疑模型。
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt在下载任何权重文件之前,确认 PyTorch 能识别显卡。
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"True 和显卡名称同时出现,表示软件栈正常。False 表示安装的 wheel 是仅 CPU 版本。这通常发生在 pip 从之前的安装中找到缓存的 torch 时。请使用上面的 index URL 重新安装。
下载 Wan 2.2 模型文件
ComfyUI 不包含模型权重,视频模型也不是单个文件。它由扩散模型、文本编码器和 VAE 组成,每个组件都要放在各自的目录中。文件放错目录后,加载器节点不会列出该文件,也不会提供任何错误信息说明原因。
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors5B 模型同时支持文本生成视频和图像生成视频,因此适合作为起点。始终优先使用 .safetensors,而不是 .ckpt。.ckpt 文件是经过 pickle 序列化的 Python 对象,加载该文件会执行构建者写入的代码。请预留充足的磁盘空间:包含一个模型系列及其输出的可用安装需要 100 GB,而且视频文件远大于图像工作流生成的 PNG 图像。请使用类似将加密增量备份到对象存储的方式备份工作流 JSON 文件,因为模型权重可以重新下载,而调优后的工作流无法重新获取。
运行并安全访问
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188ComfyUI 没有登录界面,也没有用户账户。任何能够访问端口 8188 的人都可以提交任务、读取您生成的所有视频片段,以及安装自定义节点;这相当于在您的服务器上执行任意代码。将其绑定到 localhost,然后通过 SSH 隧道从您自己的计算机访问。
ssh -N -L 8188:127.0.0.1:8188 you@your-server然后在浏览器中打开 http://127.0.0.1:8188。请从 ComfyUI 的模板菜单加载 Wan 2.2 模板工作流,不要手动连接节点。官方模板包含针对该模型调优的采样器设置。与图像工作流相比,视频工作流中更容易悄悄填错参数的位置要多得多。
适合使用 API 的情况
当视频生成量大且稳定、帧不能离开自有基础设施,或者需要托管服务不提供的特定模型或自定义适配器时,自托管视频生成是合理选择。如果要求管线在一年后仍以相同方式运行,自托管同样合适,因为托管模型可能在没有可固定版本的情况下发生变化。
每月只需要生成少量视频片段、需要生成开放模型无法提供的更长或更大输出,或者本周就有截止期限时,应使用托管 API。应如实计算盈亏平衡点。按 2026 年 7 月的中位价全天候租用一张 24 GB 显卡,每月费用约为 260 美元;而购买同一张显卡的前期成本就高于该金额,此时还没有生成任何帧。闲置的自托管服务器每次都会输给按片段计费的 API 定价。这与决定如何提供文本模型服务时的权衡相同,详见 Ollama 与 vLLM:自托管 LLM 服务对比;同时,它建立在 带 GPU 的 VPS 是否物有所值 所讨论的更基本问题之上。
渲染失败时的检查项
如果渲染在最后阶段退出,且采样器进度条已经完成,说明 VAE 解码时内存不足。请减少帧数,或切换到分块解码节点。调整步数没有帮助,因为解码只执行一次,并且发生在所有步数完成之后。
如果输出是纯黑画面或严重错乱,通常表示 VAE 与模型不匹配。将 Wan 2.1 VAE 加载到 Wan 2.2 diffusion 模型上就会产生这种结果,而且日志中不会出现任何错误。
如果渲染可以运行,但在已知配备 GPU 的计算机上仍需数小时,说明 ComfyUI 正在使用 CPU 路径。检查启动日志中的设备行,然后重新运行上面的 torch.cuda.is_available() 检查。
如果进程消失,并且在 dmesg 中显示 Killed,但没有 Python traceback,这说明是内核的内存不足终止机制。因此不足的是系统 RAM,而不是 VRAM。卸载需要将整个模型驻留在系统 RAM 中,这意味着 16 GB 计算机在卸载 5B 模型时内存不足。请增加 RAM 或添加 swap。
FAQ
没有 GPU 的 VPS 能生成 AI 视频吗?
不能,至少不适合反复使用。生成一个 720p、五秒的视频片段,在 24 GB GPU 上需要九分钟;在 CPU 上则需要数小时。这是因为模型没有可用的矩阵运算硬件,而且系统 RAM 的带宽比 GPU 内存带宽低一个数量级。CPU 服务器可以托管 ComfyUI 界面、存储模型并保存工作流,但实际渲染需要 GPU。
Wan 2.2 需要多少 VRAM?
对于 TI2V-5B 模型,使用 ComfyUI 原生卸载时,8 GB 是最低要求;如果要达到已发布的速度,Alibaba 建议使用 24 GB。对于 A14B 文生视频和图生视频模型,模型卡要求单 GPU 推理至少具备 80 GB VRAM,因此需要数据中心级显卡。
自托管视频片段最长可以多长?
截至 2026 年 7 月,720p 下约五秒是实际可行的单个时长单位。更长的视频需要先生成多个片段,再将它们拼接起来,并将一个片段的最后一帧作为下一个片段的第一帧。拼接处的质量会逐渐偏移,因此应将长视频视为剪辑任务,而不是一次生成完成。
按小时租用 GPU 比购买显卡便宜吗?
如果每天的渲染时间少于数小时,租用更划算。按 2026 年 7 月 24 GB 显卡约 0.36 美元/小时的中位价计算,在租用成本达到该显卡的购买价格之前,可以租用很长时间;同时还可以避免买到与实际所需模型不匹配的硬件。只有当服务器每天几乎全天都在运行时,购买才更划算。