SSD Nodes Learn Hosting plans →
Panduan Matt ConnorOleh Matt Connor · Dikemas kini 2026-08-13

Realiti Penjana Video AI Self-Hosted Julai 2026

Ketahui keupayaan sebenar model terbuka seperti Wan 2.2 dan HunyuanVideo. Kami bandingkan keperluan VRAM, kos sewaan GPU, serta bila anda patut menggunakan API.

Apa yang boleh dilakukan oleh penjana video AI yang dihoskan sendiri

Penjana video AI yang dihoskan sendiri sudah boleh berfungsi hari ini, namun ia lebih perlahan dan terhad berbanding apa yang ditunjukkan dalam video demonstrasi. Setakat Julai 2026, model terbuka yang berbaloi untuk dijalankan ialah Wan 2.2 daripada Alibaba dan HunyuanVideo daripada Tencent, serta LTX-Video daripada Lightricks apabila kelajuan lebih penting daripada realisme. Kesemuanya berjalan di bawah ComfyUI pada mesin Linux dengan GPU NVIDIA. Hasil yang anda peroleh ialah klip berdurasi kira-kira lima saat pada resolusi 720p. Bukan satu babak. Bukan satu minit rakaman siap.

Berikut adalah jawapan ringkas sebelum perinciannya. Kad 24 GB merender klip 720p lima saat dalam masa beberapa minit sahaja. Kad 12 GB melakukan tugas yang sama dalam masa dua puluh minit atau lebih, kerana pemberat (weights) tidak muat dalam memori video dan perisian terpaksa memindahkan lapisan berulang-alik ke RAM sistem. Pelayan tanpa GPU tidak boleh melakukan ini dengan cara yang praktikal. Pengiraan yang menjadikan penjanaan imej melalui CPU perlahan, menjadikan penjanaan video melalui CPU tidak bermakna.

Jika anda telah membaca tangga perkakasan untuk penjana imej yang dihoskan sendiri, video adalah hujah yang sama dengan setiap nombor dinaikkan satu kelas. VRAM (memori video, RAM yang dipateri bersebelahan cip grafik) masih merupakan satu-satunya spesifikasi yang menentukan sama ada perkara ini menyeronokkan atau menyakitkan.

Mengapa satu video menelan kos jauh lebih tinggi daripada satu imej

Model resapan (diffusion model) menjana imej dengan melakukan penyahhingaran (denoising) secara berperingkat, dan setiap peringkat membaca setiap pemberat (weight) dalam model tersebut. Model video melakukan perkara yang sama terhadap satu blok bingkai (frame) secara serentak, dan ia menambah perhatian merentas masa (temporal attention) supaya bingkai 80 mengetahui rupa bingkai 12. Lima saat pada kadar 24 bingkai sesaat bermakna 120 bingkai dalam satu kelompok (batch).

Perhatian merentas masa itulah sebabnya kos tidak meningkat secara linear mengikut panjang klip. Menggandakan jumlah bingkai akan meningkatkan memori yang diperlukan oleh pensampel (sampler) lebih daripada dua kali ganda, jadi mod kegagalannya bukanlah pemaparan (rendering) yang perlahan. Sebaliknya, pemaparan tersebut akan terhenti terus.

Terdapat lonjakan memori kedua yang tidak dijangka oleh pengguna. Selepas pensampel selesai, VAE (variational autoencoder, bahagian yang menukarkan latent termampat kepada piksel sebenar) menyahkod keseluruhan video latent tersebut secara serentak. Penyahkodan itu boleh memerlukan lebih banyak memori berbanding proses pensampelan. Simptomnya ialah tugasan yang menunjukkan bar kemajuan selesai dan kemudian mencetak ralat ini:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

Penyelesaiannya ialah penyahkodan berjubin (tiled decoding) atau klip yang lebih pendek. Mengetahui peringkat mana yang kehabisan memori dapat menjimatkan masa anda daripada melaraskan tetapan yang salah selama berjam-jam.

Berapakah VRAM yang anda perlukan untuk penjanaan video AI

Dua angka yang diterbitkan membentuk keseluruhan keputusan ini, dan ia kelihatan bercanggah antara satu sama lain. Alibaba menyatakan bahawa model Wan 2.2 TI2V-5B menghasilkan klip 720p pada 24 bingkai sesaat, sepanjang lima saat, dalam masa kurang sembilan minit pada satu GPU pengguna seperti 4090, dan ia mengesyorkan sekurang-kurangnya 24 GB VRAM. Dokumentasi ComfyUI menyatakan bahawa model 5B yang sama "sepatutnya muat dengan baik pada 8 GB VRAM dengan offloading asli ComfyUI".

Kedua-duanya benar kerana ia mengukur perkara yang berbeza. 8 GB adalah tahap di mana ia boleh dimuatkan. 24 GB adalah tahap di mana ia selesa. Offloading berfungsi dengan menyimpan sebahagian besar model dalam RAM sistem dan menstrim lapisan ke dalam GPU bagi setiap langkah, jadi kad tersebut menghabiskan masa menunggu pada bas PCIe dan bukannya melakukan pengiraan. Anda membayar kos tersebut pada setiap langkah pensampel, bukan sekali sahaja.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

Hanya baris terakhir merupakan angka vendor. Kad 24 GB mencapai 9 minit bagi setiap klip, iaitu angka yang diterbitkan oleh Alibaba untuk model ini. Baris lain adalah kesan offloading terhadapnya, dan ia merupakan magnitud pesanan dan bukannya hasil penanda aras. Bentuknya adalah intipatinya: 40 minit pada kad 8 GB secara teknikalnya adalah persediaan yang berfungsi dan secara praktikalnya merupakan kerja kelompok yang anda biarkan berjalan sepanjang malam.

Model Wan 2.2 yang lebih besar berada dalam dunia yang berbeza. Varian teks-ke-video dan imej-ke-video A14B memerlukan sekurang-kurangnya 80 GB VRAM untuk inferens GPU tunggal. Itu adalah perkakasan pusat data, bukan kad yang anda letakkan dalam mesin meja, dan ia adalah tahap di mana self-hosting mula bermaksud menyewa pemecut milik orang lain mengikut jam. Aritmetik yang sama berjalan lebih jauh pada bahagian teks, di mana self-hosting model 2.8 trilion parameter seperti Kimi K3 berhenti menjadi persoalan tentang satu kad dan menjadi persoalan tentang berapa banyak kad 80 GB yang anda mampu untuk sambungkan bersama.

Kos setiap klip pada GPU sewaan

Penyewaan adalah cara yang sepatutnya digunakan oleh kebanyakan orang untuk menguji perkara ini, kerana kad yang anda beli mungkin merupakan perkakasan yang salah jika model yang akhirnya anda mahukan memerlukan 80 GB. Harga median atas permintaan merentas pasaran sewaan GPU, setakat Julai 2026:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

Baris 4090 menjalankan model 5B dan menelan kos kira-kira 0.05 dolar bagi setiap klip pada harga 0.36 dolar sejam. Baris 80 GB menjalankan model 14B, itulah sebabnya kos setiap klip meningkat kepada 0.6 dolar walaupun perkakasan itu sendiri jauh lebih pantas. Model yang lebih besar bermakna lebih banyak pengiraan bagi setiap saat video.

Lima sen bagi setiap klip kedengaran seperti tidak berharga, dan itulah bahagian yang mengelirukan. Lima saat pertama anda yang boleh digunakan bukanlah hasil daripada satu render sahaja. Memberi arahan (prompting) kepada model video adalah satu proses pencarian, dan dua puluh hingga empat puluh render sebelum mendapat hasil yang memuaskan adalah perkara biasa bagi syot dengan pergerakan tertentu. Oleh itu, satu sesi kerja menelan kos dalam nilai dolar dan bukannya sen, dan satu petang iterasi pada perkakasan sewaan menelan kos yang hampir sama dengan harga makan tengah hari.

Dua butiran sewaan akan menelan kos sebenar jika anda terlepas pandang. Anda dibilkan semasa kotak (pelayan) memuat turun pemberat (weights), dan fail Wan 2.2 bersama pengekod teks dan VAE-nya mencecah puluhan gigabait, jadi pilih pembekal dengan storan kekal (persistent volume) dan muat turun sekali sahaja. Anda juga dibilkan semasa kotak tersebut melahu dengan sesi SSH anda terbuka. Hentikan (stop) instans tersebut dan bukannya sekadar menutup terminal.

Memasang ComfyUI pada pelayan GPU

Mulakan dengan Ubuntu 24.04 yang telah dipasang pemacu NVIDIA. Periksa pemacu tersebut terlebih dahulu, kerana setiap kegagalan selepas ini akan kelihatan sama jika langkah ini tidak dilakukan.

nvidia-smi

Perintah tersebut mesti memaparkan jadual yang mengandungi kad grafik anda dan versi CUDA. Jika ia memaparkan NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, modul kernel tidak dimuatkan, yang biasanya berlaku selepas naik taraf kernel tanpa but semula. Selesaikan masalah ini di sini. Jika tidak, ComfyUI akan menggunakan laluan CPU dan anda akan membuang masa selama sejam menyalahkan model tersebut.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

Pastikan PyTorch dapat mengesan kad grafik anda sebelum anda memuat turun sebarang fail weight.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True berserta nama kad anda bermaksud tindanan (stack) tersebut berfungsi dengan baik. False bermaksud wheel yang dipasang adalah binaan khusus CPU, yang berlaku apabila pip menemui torch dalam cache daripada pemasangan terdahulu. Pasang semula menggunakan URL indeks di atas.

Muat turun fail model Wan 2.2

ComfyUI diedarkan tanpa sebarang pemberat (weights), dan model video bukanlah satu fail tunggal. Ia terdiri daripada model resapan (diffusion model), pengekod teks, dan VAE, yang setiap satunya perlu diletakkan dalam direktori tersendiri. Jika fail diletakkan dalam folder yang salah, nod pemuat (loader node) tidak akan menyenaraikannya, tanpa sebarang ralat untuk menjelaskan puncanya.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

Model 5B mengendalikan kedua-dua fungsi teks-ke-video dan imej-ke-video, menjadikannya titik permulaan yang paling wajar. Sentiasa utamakan .safetensors berbanding .ckpt. Fail .ckpt merupakan objek Python yang dipickle, jadi memuatkannya akan menjalankan kod yang ditulis oleh pembina fail tersebut. Peruntukkan ruang cakera dengan murah hati: pemasangan berfungsi dengan satu keluarga model beserta outputnya memerlukan 100 GB, dan fail video jauh lebih besar daripada imej PNG yang dihasilkan oleh aliran kerja imej. Sandarkan fail JSON aliran kerja anda menggunakan kaedah seperti sandaran inkremental disulitkan ke storan objek, kerana pemberat boleh dimuat turun semula manakala aliran kerja yang telah ditala tidak boleh.

Jalankan dan akses dengan selamat

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI tidak mempunyai skrin log masuk atau akaun pengguna. Sesiapa sahaja yang boleh mencapai port 8188 boleh menyenaraikan tugasan, membaca setiap klip yang telah anda jana, dan memasang custom nodes, yang bermaksud pelaksanaan kod sewenang-wenangnya pada pelayan anda. Ikat ia pada localhost dan capai melalui SSH tunnel dari mesin anda sendiri.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

Kemudian buka http://127.0.0.1:8188 dalam pelayar anda. Muatkan workflow templat Wan 2.2 daripada menu templat ComfyUI dan bukannya menyambungkan nod secara manual. Templat rasmi membawa tetapan sampler yang telah ditala untuk model tersebut, dan workflow video mempunyai lebih banyak bahagian yang boleh menyebabkan ralat nilai secara senyap berbanding workflow imej.

Apabila jawapan yang jujur adalah menggunakan API

Self-hosting penjanaan video adalah pilihan yang tepat apabila volumnya tinggi dan stabil, apabila bingkai anda tidak boleh keluar daripada infrastruktur sendiri, atau apabila anda memerlukan model khusus atau adapter tersuai yang tidak ditawarkan oleh mana-mana perkhidmatan hos. Ia juga tepat apabila pipeline perlu berfungsi dengan cara yang sama dalam tempoh setahun, kerana model yang dihoskan boleh berubah tanpa notis dan tiada versi untuk dikunci.

Gunakan API yang dihoskan apabila anda hanya memerlukan beberapa klip sebulan, apabila anda memerlukan output yang lebih panjang atau lebih besar daripada yang dihasilkan oleh model terbuka, atau apabila anda mempunyai tarikh akhir pada minggu ini. Lakukan pengiraan titik pulang modal dengan jujur. Kad 24 GB yang disewa sepanjang masa pada median Julai 2026 adalah kira-kira 260 dolar sebulan, dan membeli kad yang sama menelan kos lebih daripada itu di peringkat awal sebelum anda menjana satu bingkai pun. Kotak self-hosted yang melahu sentiasa kalah berbanding harga API per-klip. Ini adalah pertukaran yang sama yang menentukan cara anda menyediakan model teks, yang dibincangkan dalam Ollama berbanding vLLM untuk penyediaan LLM self-hosted, dan ia terletak di atas soalan yang lebih asas dalam sama ada VPS dengan GPU berbaloi dengan wang anda atau tidak.

Perkara yang perlu disemak apabila render gagal

Render yang terhenti pada peringkat akhir, selepas bar sampler selesai, bermakna memori kehabisan semasa proses VAE decode. Kurangkan bilangan frame atau tukar kepada node tiled decode. Menukar bilangan step tidak akan membantu, kerana proses decode hanya berlaku sekali, selepas semua step selesai dijalankan.

Output yang berwarna hitam pekat atau bercelaru biasanya bermakna VAE tidak sepadan dengan model. VAE Wan 2.1 yang dimuatkan pada model difusi Wan 2.2 akan menghasilkan output sedemikian, dan tiada ralat akan dipaparkan dalam log.

Render yang berjalan tetapi mengambil masa berjam-jam pada mesin yang mempunyai GPU bermakna ComfyUI berada pada laluan CPU. Semak log permulaan untuk baris peranti, kemudian jalankan semula semakan torch.cuda.is_available() di atas.

Proses yang hilang dengan Killed dalam dmesg tanpa sebarang Python traceback adalah disebabkan oleh kernel out-of-memory killer, yang bermaksud ia melibatkan RAM sistem, bukan VRAM. Proses offloading memerlukan keseluruhan model berada dalam RAM sistem, jadi mesin dengan 16 GB RAM tidak mencukupi untuk melakukan offloading model 5B. Tambah RAM atau tambah swap.

FAQ

Bolehkah saya menjana video AI pada VPS tanpa GPU?

Tidak, bukan dengan cara yang anda akan gunakan dua kali. Klip 720p selama lima saat yang mengambil masa sembilan minit pada GPU 24 GB akan mengambil masa berjam-jam pada CPU, kerana model tersebut tidak mempunyai perkakasan matriks untuk dijalankan dan lebar jalur RAM sistem adalah jauh lebih rendah daripada lebar jalur memori GPU. Pelayan CPU boleh mengehoskan antara muka ComfyUI, menyimpan model anda dan memegang aliran kerja anda, tetapi proses rendering itu sendiri memerlukan GPU.

Berapa banyak VRAM yang saya perlukan untuk Wan 2.2?

Untuk model TI2V-5B, 8 GB adalah tahap minimum dengan offloading asli ComfyUI, dan 24 GB adalah apa yang disyorkan oleh Alibaba untuk mendapatkan kelajuan yang diterbitkan. Bagi model teks-ke-video dan imej-ke-video A14B, kad model meminta sekurang-kurangnya 80 GB VRAM untuk inferens GPU tunggal, jadi model tersebut memerlukan kad pusat data.

Berapa lama klip yang dihoskan sendiri boleh dihasilkan?

Kira-kira lima saat pada 720p adalah unit praktikal setakat Julai 2026. Output yang lebih panjang dihasilkan dengan menjana segmen dan mencantumkannya, menggunakan bingkai terakhir satu segmen sebagai bingkai pertama segmen seterusnya. Kualiti akan terjejas di sepanjang sambungan tersebut, jadi anggap video yang panjang sebagai kerja penyuntingan dan bukannya satu penjanaan.

Adakah menyewa GPU mengikut jam lebih murah daripada membeli kad?

Menyewa lebih berbaloi untuk apa-apa yang kurang daripada beberapa jam rendering sehari. Pada median Julai 2026 iaitu kira-kira 0.36 dolar sejam untuk kad 24 GB, anda boleh menyewa untuk tempoh yang lama sebelum anda menyamai harga pembelian kad tersebut, dan anda mengelakkan daripada membeli perkakasan yang ternyata tidak sesuai untuk model yang anda inginkan. Membeli hanya berbaloi apabila mesin tersebut sibuk hampir sepanjang hari, setiap hari.