SSD Nodes Learn 8GB RAM — $66/năm
Hướng dẫn Matt ConnorBởi Matt Connor · Cập nhật ngày 2026-08-01

Trình tạo video AI tự host cần bao nhiêu VRAM?

Tìm hiểu Wan 2.2, HunyuanVideo và LTX-Video thực sự tạo được gì tháng 7/2026, cần GPU bao nhiêu VRAM, tốn bao nhiêu tiền cho clip 5 giây và khi nào nên dùng API.

Trình tạo video AI tự host thực sự làm được gì

Một trình tạo video AI tự host hiện đã dùng được, nhưng chậm và hạn chế hơn các video demo. Tính đến tháng 7 năm 2026, các model mã nguồn mở đáng chạy gồm Wan 2.2 của Alibaba và HunyuanVideo của Tencent, cùng LTX-Video của Lightricks khi tốc độ quan trọng hơn độ chân thực. Tất cả đều chạy dưới ComfyUI trên máy Linux có GPU NVIDIA. Kết quả là một clip dài khoảng năm giây ở độ phân giải 720p. Không phải một cảnh hoàn chỉnh. Cũng không phải một phút video đã hoàn thiện.

Đây là câu trả lời ngắn trước khi đi vào chi tiết. Một card 24 GB render clip 720p dài năm giây trong vài phút. Một card 12 GB cần 20 phút hoặc hơn cho cùng công việc, vì weights không vừa trong video memory và phần mềm phải liên tục chuyển các layer qua lại với system RAM. Server không có GPU không thể thực hiện việc này theo cách hữu ích. Các phép tính khiến việc tạo ảnh bằng CPU chậm cũng khiến việc tạo video bằng CPU trở nên vô nghĩa.

Nếu bạn đã đọc bậc phần cứng cho trình tạo ảnh tự host, video cũng theo lập luận đó, nhưng mọi con số đều tăng lên một cấp. VRAM (video memory, RAM được hàn ngay cạnh chip đồ họa) vẫn là thông số duy nhất quyết định việc này dễ chịu hay khó khăn.

Vì sao một video tốn nhiều tài nguyên hơn một ảnh

Mô hình diffusion tạo ảnh bằng cách khử nhiễu theo từng bước. Mỗi bước đọc mọi weight trong mô hình. Mô hình video cũng làm như vậy với cả một khối frame cùng lúc. Ngoài ra, nó thêm attention theo thời gian để frame 80 biết frame 12 trông như thế nào. Năm giây ở 24 frame mỗi giây tương đương 120 frame trong một batch.

Attention theo thời gian là lý do chi phí không tăng đều theo độ dài clip. Khi tăng gấp đôi số frame, lượng memory sampler cần dùng tăng hơn gấp đôi. Vì vậy, lỗi thường không phải là render chậm hơn. Render sẽ bị dừng.

Có một đợt tăng memory thứ hai mà nhiều người không dự đoán được. Sau khi sampler hoàn tất, VAE (variational autoencoder, thành phần chuyển latent đã nén thành pixel thực) sẽ giải mã toàn bộ video latent cùng lúc. Quá trình decode này có thể cần nhiều memory hơn cả sampling. Dấu hiệu là job hiển thị progress bar hoàn tất rồi in ra:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

Cách khắc phục là dùng tiled decoding hoặc rút ngắn clip. Biết chính xác stage nào hết memory giúp bạn không mất cả giờ chỉnh sai thông số.

Bạn cần bao nhiêu VRAM để tạo video AI

Hai số liệu đã được công bố định hình toàn bộ quyết định này, nhưng có vẻ mâu thuẫn với nhau. Alibaba cho biết model Wan 2.2 TI2V-5B tạo được các đoạn clip 720p ở 24 frame/giây, dài 5 giây, trong chưa đầy 9 phút trên một GPU dành cho người dùng phổ thông như 4090, và khuyến nghị ít nhất 24 GB VRAM. Tài liệu ComfyUI cho biết cùng model 5B này “sẽ chạy tốt trên 8GB VRAM với native offloading của ComfyUI”.

Cả hai đều đúng vì chúng đo những thứ khác nhau. 8 GB là mức model có thể chạy được. 24 GB là mức chạy thoải mái. Offloading giữ phần lớn model trong system RAM và truyền từng layer vào GPU ở mỗi step, nên card phải chờ PCIe bus thay vì thực hiện phép tính. Bạn phải chịu chi phí này ở mọi sampler step, không chỉ một lần.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

Chỉ hàng cuối là số liệu từ nhà cung cấp. Card 24 GB tạo một clip trong 9 phút, đúng với số liệu Alibaba đã công bố cho model này. Các hàng còn lại thể hiện tác động của offloading và chỉ là ước lượng theo bậc độ lớn, không phải kết quả benchmark. Điểm chính nằm ở xu hướng: 40 phút trên card 8 GB là một cấu hình về mặt kỹ thuật có thể chạy, nhưng trên thực tế là một batch job bạn phải để chạy qua đêm.

Các model Wan 2.2 lớn hơn thuộc một nhóm hoàn toàn khác. Các biến thể text-to-video và image-to-video A14B yêu cầu ít nhất 80 GB VRAM khi inference trên một GPU. Đây là phần cứng data center, không phải loại card bạn lắp vào máy để bàn, và đây là lúc self-hosted bắt đầu có nghĩa là thuê accelerator của người khác theo giờ.

Chi phí cho một clip trên GPU thuê

Thuê GPU là cách phù hợp để hầu hết mọi người thử nghiệm, vì card bạn mua có thể không phù hợp nếu model bạn chọn cuối cùng cần 80 GB. Giá on-demand trung vị trên thị trường cho thuê GPU, tính đến tháng 7 năm 2026:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

Dòng 4090 chạy model 5B và có chi phí khoảng 0.05 dollar cho mỗi clip, với giá 0.36 dollar mỗi giờ. Các dòng 80 GB chạy model 14B. Vì vậy, chi phí mỗi clip tăng lên 0.6 dollar, dù phần cứng nhanh hơn nhiều. Model lớn hơn cần nhiều compute hơn cho mỗi giây video.

Năm cent cho một clip nghe có vẻ không đáng kể. Đây chính là điểm dễ gây hiểu nhầm. Năm giây đầu tiên có thể sử dụng được hiếm khi chỉ cần một lần render. Prompting cho video model là một quá trình tìm kiếm. Với một shot có chuyển động cụ thể, cần render từ 20 đến 40 lần trước khi có một bản đạt yêu cầu là bình thường. Vì vậy, một phiên làm việc thường tốn vài dollar thay vì vài cent. Một buổi chiều lặp lại trên phần cứng thuê có chi phí tương đương một bữa trưa.

Nếu bỏ qua, 2 chi tiết khi thuê có thể làm phát sinh chi phí đáng kể. Bạn vẫn bị tính phí trong lúc máy tải weights. Các file Wan 2.2 cùng text encoder và VAE có dung lượng lên đến hàng chục gigabyte. Vì vậy, hãy chọn provider có persistent volume và chỉ tải xuống 1 lần. Bạn cũng bị tính phí khi máy không hoạt động nhưng phiên SSH vẫn mở. Hãy stop instance thay vì chỉ đóng terminal.

Cài đặt ComfyUI trên máy GPU

Bắt đầu với Ubuntu 24.04 và NVIDIA driver đã được cài đặt. Kiểm tra driver trước, vì nếu bỏ qua bước này thì mọi lỗi về sau đều trông giống nhau.

nvidia-smi

Lệnh này phải in ra một bảng có card của bạn và phiên bản CUDA. Nếu lệnh in ra NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, kernel module chưa được nạp. Nguyên nhân thường là kernel đã được nâng cấp nhưng máy chưa được reboot. Khắc phục ngay tại đây. Nếu không, ComfyUI sẽ chuyển sang dùng CPU và bạn sẽ mất cả giờ để tìm lỗi ở model.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

Xác nhận PyTorch nhận diện được card trước khi tải xuống dù chỉ một file weight.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True cùng với tên card của bạn nghĩa là stack đã hoạt động bình thường. False nghĩa là wheel đã cài là bản chỉ dành cho CPU. Trường hợp này xảy ra khi pip tìm thấy torch trong cache từ một lần cài đặt trước. Cài đặt lại bằng index URL ở trên.

Tải các tệp model Wan 2.2

ComfyUI không kèm weights, và một video model không chỉ có một tệp. Nó gồm một diffusion model, một text encoder và một VAE. Mỗi thành phần được đặt trong một thư mục riêng. Nếu đặt tệp sai thư mục, loader node sẽ không liệt kê tệp đó và cũng không báo lỗi để giải thích nguyên nhân.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

Model 5B hỗ trợ cả text-to-video và image-to-video, nên đây là lựa chọn khởi đầu hợp lý. Luôn ưu tiên .safetensors thay vì .ckpt. Tệp .ckpt là một Python object được pickle, nên khi load, nó sẽ chạy code do người tạo tệp viết. Hãy dự trù nhiều dung lượng đĩa: một cài đặt hoạt động với một model family và các tệp đầu ra cần 100 GB. Các tệp video cũng lớn hơn nhiều so với các ảnh PNG mà image workflow tạo ra. Hãy sao lưu các tệp workflow JSON bằng cách như sao lưu tăng dần được mã hóa vào object storage, vì weights có thể tải lại, còn các workflow đã tinh chỉnh thì không.

Chạy và truy cập an toàn

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI không có màn hình đăng nhập và không có tài khoản người dùng. Bất kỳ ai truy cập được port 8188 đều có thể xếp hàng job, đọc mọi clip bạn đã tạo và cài custom node. Điều này cho phép thực thi mã tùy ý trên server của bạn. Hãy bind vào localhost và truy cập thông qua SSH tunnel từ máy của bạn.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

Sau đó, mở http://127.0.0.1:8188 trong trình duyệt. Tải workflow mẫu Wan 2.2 từ menu template của ComfyUI thay vì tự nối node. Template chính thức chứa các thiết lập sampler mà model đã được tinh chỉnh để sử dụng. Workflow video có nhiều chỗ hơn workflow image khiến bạn vô tình đặt sai một giá trị mà không nhận ra.

Khi câu trả lời phù hợp là dùng API

Tự host việc tạo video là lựa chọn phù hợp khi khối lượng công việc cao và ổn định, khi các frame không được rời khỏi hạ tầng của bạn, hoặc khi bạn cần một model cụ thể hay một adapter tùy chỉnh mà không dịch vụ hosted nào cung cấp. Đây cũng là lựa chọn phù hợp khi pipeline phải hoạt động theo cùng một cách trong một năm nữa, vì model hosted có thể thay đổi mà không có version để pin.

Dùng API hosted khi bạn chỉ cần vài clip mỗi tháng, khi cần output dài hơn hoặc lớn hơn khả năng của các model open, hoặc khi bạn có deadline trong tuần này. Hãy tính điểm hòa vốn một cách thực tế. Một card 24 GB được thuê suốt ngày đêm theo mức giá trung vị vào July 2026 có giá khoảng 260 đô la mỗi tháng, còn mua cùng card đó sẽ tốn nhiều hơn ngay từ đầu, trước khi bạn tạo được một frame nào. Một máy self-hosted không hoạt động luôn thua mức giá API tính theo từng clip. Đây là cùng một đánh đổi quyết định cách bạn serve các model text, được trình bày trong Ollama so với vLLM để serve LLM self-hosted, và nó dựa trên câu hỏi cơ bản hơn trong liệu VPS có GPU có đáng tiền hay không.

Cần kiểm tra gì khi render thất bại

Nếu render dừng ở cuối, sau khi thanh sampler đã chạy xong, thì VAE decode đã hết bộ nhớ. Hãy giảm số frame hoặc chuyển sang node tiled decode. Thay đổi số step sẽ không giúp ích, vì decode chỉ chạy một lần sau khi tất cả step đã hoàn tất.

Output toàn màu đen hoặc bị xáo trộn nghiêm trọng thường có nghĩa là VAE không khớp với model. Load VAE Wan 2.1 cho model diffusion Wan 2.2 sẽ tạo ra đúng hiện tượng này và log không hiển thị lỗi nào.

Nếu render vẫn chạy nhưng mất hàng giờ trên máy mà bạn biết có GPU, thì ComfyUI đang chạy theo CPU path. Kiểm tra dòng device trong startup log, sau đó chạy lại kiểm tra torch.cuda.is_available() ở trên.

Nếu process biến mất với Killed trong dmesg và không có Python traceback, thì đó là kernel out-of-memory killer. Trường hợp này liên quan đến system RAM, không phải VRAM. Offloading cần toàn bộ model nằm trong system RAM, nên máy 16 GB chạy offload cho model 5B sẽ bị thiếu RAM. Hãy nâng cấp RAM hoặc thêm swap.

FAQ

Tôi có thể tạo video AI trên VPS không có GPU không?

Không, nếu bạn định sử dụng nhiều hơn một lần. Một clip 720p dài năm giây mất chín phút trên GPU 24 GB sẽ mất nhiều giờ trên CPU. Nguyên nhân là model không có phần cứng ma trận để xử lý, còn băng thông RAM hệ thống thấp hơn băng thông bộ nhớ GPU một bậc độ lớn. Server CPU có thể chạy giao diện ComfyUI, lưu model và giữ workflow. Tuy nhiên, quá trình render cần GPU.

Tôi cần bao nhiêu VRAM cho Wan 2.2?

Với model TI2V-5B, 8 GB là mức tối thiểu khi dùng native offloading của ComfyUI. 24 GB là mức Alibaba khuyến nghị để đạt tốc độ đã công bố. Với các model text-to-video và image-to-video A14B, model card yêu cầu ít nhất 80 GB VRAM cho inference trên một GPU. Vì vậy, các model này cần GPU dành cho data center.

Clip tự host có thể dài bao lâu?

Khoảng năm giây ở 720p là đơn vị thực tế tính đến July 2026. Để tạo output dài hơn, hãy tạo từng đoạn rồi nối chúng lại. Dùng frame cuối của đoạn này làm frame đầu của đoạn tiếp theo. Chất lượng sẽ thay đổi tại các điểm nối. Vì vậy, hãy xử lý video dài như một công việc biên tập thay vì một lần generation.

Thuê GPU theo giờ có rẻ hơn mua GPU không?

Thuê GPU có lợi hơn nếu bạn render dưới vài giờ mỗi ngày. Với mức giá trung vị khoảng 0.36 dollar mỗi giờ cho GPU 24 GB vào July 2026, bạn có thể thuê trong thời gian dài trước khi chi phí bằng giá mua GPU đó. Bạn cũng tránh mua phải phần cứng không phù hợp với loại model thực tế cần dùng. Mua GPU chỉ có lợi khi server hoạt động gần như cả ngày, mỗi ngày.

#ai-video#comfyui#gpu#tự lưu trữ#wan#vram