AI video generator tự host: thực tế tháng 7/2026
Xem Wan 2.2, HunyuanVideo và LTX-Video thực sự tạo được gì, cần GPU 12 hay 24 GB VRAM, chi phí clip 5 giây trên GPU thuê và khi nên dùng API.
Một AI video generator tự host thực sự làm được gì
Một AI video generator tự host hiện đã hoạt động được, nhưng chậm và hạn chế hơn những gì các video demo thường thể hiện. Tính đến tháng 7 năm 2026, các model mở đáng chạy là Wan 2.2 của Alibaba và HunyuanVideo của Tencent, cùng với LTX-Video của Lightricks khi tốc độ quan trọng hơn độ chân thực. Tất cả đều chạy được trên ComfyUI trên một máy Linux có GPU NVIDIA. Kết quả là một clip dài khoảng năm giây ở độ phân giải 720p. Không phải một cảnh hoàn chỉnh. Càng không phải một phút video đã hoàn thiện.
Đây là câu trả lời ngắn trước khi đi vào chi tiết. Một card 24 GB render clip 720p dài năm giây trong vài phút. Một card 12 GB cần 20 phút hoặc hơn cho cùng công việc, vì weights không vừa trong video memory và phần mềm phải liên tục chuyển các layer qua lại với system RAM. Server không có GPU không thể thực hiện việc này theo nghĩa hữu ích. Các phép tính khiến việc tạo ảnh trên CPU đã chậm thì cũng khiến việc tạo video trên CPU trở nên vô nghĩa.
Nếu bạn đã đọc bậc phần cứng cho một image generator tự host, video cũng dựa trên lập luận đó, nhưng mọi con số đều được đẩy lên thêm một cấp. VRAM (video memory, loại RAM được hàn ngay cạnh chip đồ họa) vẫn là thông số duy nhất quyết định việc này dễ chịu hay rất khó chịu.
Vì sao một video tốn nhiều tài nguyên hơn hẳn một ảnh
Mô hình diffusion tạo ảnh bằng cách khử nhiễu theo từng bước, và mỗi bước đều đọc toàn bộ weight trong model. Mô hình video cũng làm như vậy với cả một khối frame cùng lúc, đồng thời thêm attention theo thời gian để frame 80 biết frame 12 trông như thế nào. Năm giây ở 24 frame mỗi giây là 120 frame trong một batch.
Temporal attention là lý do chi phí không tăng một cách tuyến tính theo độ dài clip. Khi số frame tăng gấp đôi, bộ nhớ sampler cần thường tăng hơn gấp đôi. Vì vậy, lỗi không phải là render chậm hơn. Render sẽ bị dừng.
Có một đợt tăng bộ nhớ thứ hai mà nhiều người không dự đoán được. Sau khi sampler hoàn tất, VAE (variational autoencoder, thành phần chuyển latent đã nén thành pixel thực) sẽ decode toàn bộ video latent cùng lúc. Quá trình decode này có thể cần nhiều bộ nhớ hơn cả sampling. Dấu hiệu là job hiển thị progress bar đã hoàn tất rồi in ra:
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiBCách khắc phục là dùng tiled decoding hoặc rút ngắn clip. Biết chính xác stage nào hết bộ nhớ sẽ giúp bạn không mất cả giờ để chỉnh sai thông số.
Bạn cần bao nhiêu VRAM để tạo video AI
Hai số liệu đã công bố này định hình toàn bộ quyết định, nhưng có vẻ mâu thuẫn với nhau. Alibaba cho biết model Wan 2.2 TI2V-5B tạo clip 720p ở 24 khung hình/giây, dài năm giây, trong chưa đến chín phút trên một GPU phổ thông như 4090, và khuyến nghị ít nhất 24 GB VRAM. Tài liệu ComfyUI cho biết cùng model 5B này “sẽ chạy tốt trên 8GB vram với cơ chế offloading native của ComfyUI”.
Cả hai đều đúng vì chúng đo những thứ khác nhau. 8 GB là mức model có thể chạy được. 24 GB là mức chạy thoải mái. Offloading hoạt động bằng cách giữ phần lớn model trong RAM hệ thống rồi nạp từng layer vào GPU ở mỗi step, nên card phải chờ PCIe bus thay vì thực hiện phép tính. Bạn phải trả chi phí này ở mỗi sampler step, không phải chỉ một lần.
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]Chỉ hàng cuối là số liệu từ vendor. Card 24 GB tạo một clip trong 9 phút, đúng với số liệu Alibaba đã công bố cho model này. Các hàng còn lại cho thấy offloading làm thời gian tăng như thế nào; đây là ước lượng theo bậc độ lớn, không phải kết quả benchmark. Điểm quan trọng là xu hướng: 40 phút trên card 8 GB là một cấu hình về mặt kỹ thuật có thể chạy được, nhưng trên thực tế giống một batch job mà bạn để chạy qua đêm.
Các model Wan 2.2 lớn hơn thuộc một nhóm hoàn toàn khác. Các biến thể text-to-video và image-to-video A14B yêu cầu ít nhất 80 GB VRAM khi inference trên một GPU. Đây là phần cứng data center, không phải loại card bạn lắp vào máy bàn, và là lúc self-hosted bắt đầu có nghĩa là thuê accelerator của người khác theo giờ. Phép tính tương tự còn tăng mạnh hơn ở phía text, nơi self-hosting model 2,8 nghìn tỷ tham số như Kimi K3 không còn là câu hỏi về một card mà trở thành câu hỏi bạn có thể kết nối với nhau bao nhiêu card 80 GB.
Chi phí cho một clip trên GPU thuê
Thuê GPU là cách mà hầu hết mọi người nên dùng để thử nghiệm, vì card bạn mua có thể không phù hợp nếu model cuối cùng bạn muốn dùng cần 80 GB. Giá on-demand trung vị trên thị trường cho thuê GPU tính đến tháng 7 năm 2026:
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]Dòng 4090 chạy model 5B và có chi phí khoảng 0.05 dollar cho mỗi clip, với giá 0.36 dollar mỗi giờ. Các dòng 80 GB chạy model 14B. Vì vậy, chi phí cho mỗi clip tăng lên 0.6 dollar, dù bản thân phần cứng nhanh hơn nhiều. Model lớn hơn cần nhiều compute hơn cho mỗi giây video.
Năm cent cho một clip nghe có vẻ không đáng kể. Nhưng đây chính là điểm dễ gây hiểu nhầm. Năm giây đầu tiên có thể dùng được không bao giờ chỉ cần một lần render. Prompt cho video model là một quá trình tìm kiếm, và việc render từ 20 đến 40 lần trước khi có một bản giữ lại được là bình thường khi shot có chuyển động cụ thể. Vì vậy, một phiên làm việc thường tốn dollar thay vì cent. Một buổi chiều lặp lại trên phần cứng thuê có chi phí tương đương một bữa trưa.
Có 2 chi tiết khi thuê GPU có thể làm phát sinh chi phí đáng kể nếu bạn bỏ qua. Bạn vẫn bị tính tiền trong lúc máy tải weights. Các file Wan 2.2 cùng text encoder và VAE có tổng dung lượng lên đến hàng chục gigabyte, vì vậy hãy chọn provider có persistent volume và chỉ tải xuống một lần. Bạn cũng vẫn bị tính tiền khi máy ở trạng thái idle trong lúc phiên SSH còn mở. Hãy stop instance thay vì chỉ đóng terminal.
Cài ComfyUI trên máy GPU
Bắt đầu với Ubuntu 24.04 và NVIDIA driver đã được cài đặt. Kiểm tra driver trước, vì nếu bỏ qua bước này thì mọi lỗi về sau đều trông giống nhau.
nvidia-smiLệnh này phải in ra một bảng có card của bạn và phiên bản CUDA. Nếu lệnh in ra NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, kernel module chưa được nạp. Nguyên nhân thường là bạn vừa upgrade kernel nhưng chưa reboot. Hãy xử lý lỗi này ngay tại đây. Nếu không, ComfyUI sẽ chuyển sang chạy bằng CPU và bạn sẽ mất cả giờ để đổ lỗi cho model.
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txtXác nhận PyTorch nhận được card trước khi download dù chỉ một file weight.
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"True cùng với tên card của bạn cho biết stack đang hoạt động bình thường. False có nghĩa là wheel đã cài là bản chỉ dành cho CPU. Trường hợp này xảy ra khi pip lấy torch đã có trong cache từ lần cài trước. Hãy cài lại bằng index URL ở trên.
Tải các file model Wan 2.2
ComfyUI không kèm weights, và một model video không chỉ có một file. Nó gồm diffusion model, text encoder và VAE; mỗi thành phần nằm trong một thư mục riêng. Nếu đặt file sai thư mục, loader node sẽ không liệt kê file đó và cũng không báo lỗi để giải thích nguyên nhân.
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensorsModel 5B hỗ trợ cả text-to-video và image-to-video, nên đây là lựa chọn khởi đầu hợp lý. Luôn ưu tiên .safetensors hơn .ckpt. File .ckpt là một Python object được pickle, nên việc load file này sẽ chạy code do người tạo file viết. Hãy dự trù nhiều dung lượng disk: một cài đặt hoạt động với một họ model và các file output cần 100 GB, còn file video lớn hơn nhiều so với các ảnh PNG mà workflow xử lý ảnh tạo ra. Hãy backup các file workflow JSON bằng cách như backup incremental được mã hóa lên object storage, vì weights có thể tải lại, còn các workflow đã tinh chỉnh thì không.
Chạy ComfyUI và truy cập an toàn
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188ComfyUI không có màn hình đăng nhập và không có user account. Bất kỳ ai có thể truy cập cổng 8188 đều có thể xếp hàng job, đọc mọi clip bạn đã tạo và cài custom node. Điều này cho phép thực thi mã tùy ý trên server của bạn. Hãy bind ComfyUI vào localhost và truy cập thông qua SSH tunnel từ máy của bạn.
ssh -N -L 8188:127.0.0.1:8188 you@your-serverSau đó mở http://127.0.0.1:8188 trong browser. Tải workflow mẫu Wan 2.2 từ menu template của ComfyUI thay vì tự nối các node. Template chính thức chứa các thiết lập sampler phù hợp với cách model được tinh chỉnh. Workflow video có nhiều vị trí hơn workflow hình ảnh, nơi bạn có thể âm thầm đặt sai một giá trị.
Khi dùng API mới là lựa chọn đúng
Tự host việc tạo video là lựa chọn phù hợp khi khối lượng công việc cao và ổn định, khi các frame không được rời khỏi hạ tầng của bạn, hoặc khi bạn cần một model cụ thể hay custom adapter mà không dịch vụ hosted nào cung cấp. Đây cũng là lựa chọn phù hợp khi pipeline phải hoạt động theo cùng một cách trong một năm nữa, vì hosted model có thể thay đổi mà bạn không có version để pin.
Hãy dùng hosted API khi bạn chỉ cần vài clip mỗi tháng, khi cần output dài hơn hoặc lớn hơn khả năng của các open model, hoặc khi bạn có deadline trong tuần này. Hãy tính điểm hòa vốn một cách thực tế. Một card 24 GB được thuê liên tục ở mức giá trung vị vào tháng 7 năm 2026 có chi phí khoảng 260 đô la mỗi tháng, còn mua cùng card đó sẽ tốn nhiều hơn ngay từ đầu, trước khi bạn tạo được một frame nào. Một máy self-hosted không hoạt động luôn kém hiệu quả hơn mức giá API tính theo từng clip. Đây cũng là bài toán đánh đổi quyết định cách bạn phục vụ text model, được trình bày trong Ollama so với vLLM để phục vụ LLM self-hosted, và nó dựa trên câu hỏi cơ bản hơn trong VPS có GPU có thực sự đáng tiền hay không.
Cần kiểm tra gì khi render bị lỗi
Render dừng ngay cuối quá trình, sau khi thanh sampler đã chạy xong, là do hết bộ nhớ trong bước giải mã VAE. Giảm số lượng frame hoặc chuyển sang node giải mã dạng tiled. Thay đổi số step sẽ không giúp, vì bước giải mã chỉ chạy một lần sau khi mọi step đã hoàn tất.
Output toàn màu đen hoặc bị xáo trộn nghiêm trọng thường có nghĩa là VAE không tương thích với model. Load VAE của Wan 2.1 cho model diffusion Wan 2.2 sẽ gây đúng lỗi này, và log không hiển thị lỗi nào.
Render vẫn chạy nhưng mất hàng giờ trên máy chắc chắn có GPU nghĩa là ComfyUI đang chạy theo CPU path. Kiểm tra dòng device trong startup log, sau đó chạy lại phần kiểm tra torch.cuda.is_available() ở trên.
Process biến mất với Killed trong dmesg mà không có Python traceback là do kernel out-of-memory killer kích hoạt. Đây là lỗi thiếu system RAM, không phải VRAM. Offloading yêu cầu toàn bộ model phải nằm trong system RAM, nên máy 16 GB chạy offloading cho model 5B sẽ không đủ bộ nhớ. Lắp thêm RAM hoặc thêm swap.
FAQ
Tôi có thể tạo video AI trên VPS không có GPU không?
Không, ít nhất là không theo cách bạn sẽ dùng lần thứ hai. Một đoạn clip 720p dài năm giây cần chín phút trên GPU 24 GB sẽ mất nhiều giờ trên CPU, vì model không có phần cứng xử lý ma trận để chạy, còn băng thông RAM hệ thống thấp hơn băng thông bộ nhớ GPU một bậc độ lớn. Server CPU có thể host giao diện ComfyUI, lưu model và giữ workflow, nhưng quá trình render vẫn cần GPU.
Tôi cần bao nhiêu VRAM cho Wan 2.2?
Với model TI2V-5B, 8 GB là mức tối thiểu khi dùng native offloading của ComfyUI, còn 24 GB là mức Alibaba khuyến nghị để đạt tốc độ đã công bố. Với các model text-to-video và image-to-video A14B, model card yêu cầu ít nhất 80 GB VRAM cho inference trên một GPU, nên các model này cần GPU dành cho data center.
Clip tự host có thể dài bao lâu?
Tính đến tháng 7 năm 2026, khoảng năm giây ở độ phân giải 720p là đơn vị thực tế. Video dài hơn được tạo bằng cách render từng đoạn rồi nối lại, dùng frame cuối của đoạn trước làm frame đầu của đoạn sau. Chất lượng sẽ thay đổi tại các điểm nối, nên hãy coi video dài là một công việc biên tập thay vì một lần generation duy nhất.
Thuê GPU theo giờ có rẻ hơn mua GPU không?
Thuê GPU có lợi hơn nếu bạn render dưới vài giờ mỗi ngày. Với mức trung vị khoảng 0.36 đô la mỗi giờ vào tháng 7 năm 2026 cho GPU 24 GB, bạn có thể thuê trong thời gian dài trước khi chi phí bằng giá mua GPU đó, đồng thời tránh mua nhầm loại phần cứng không phù hợp với model bạn thực sự muốn dùng. Mua GPU chỉ có lợi khi server hoạt động gần như cả ngày, mỗi ngày.