SSD Nodes Learn RAM 8GB — $66/tahun
Panduan Matt ConnorOleh Matt Connor · Dikemas kini 2026-08-01

Penjana Video AI Hos Sendiri: Realiti Sebenar

Ketahui hasil model video terbuka pada Julai 2026, kelas VRAM yang diperlukan, kos klip lima saat pada GPU sewaan dan masa sesuai menggunakan API.

Perkara yang boleh dilakukan oleh penjana video AI yang dihoskan sendiri

Penjana video AI yang dihoskan sendiri boleh digunakan pada masa ini, tetapi lebih perlahan dan menghasilkan video yang lebih pendek berbanding gambaran dalam video demo. Setakat Julai 2026, model terbuka yang sesuai dijalankan ialah Wan 2.2 daripada Alibaba dan HunyuanVideo daripada Tencent, serta LTX-Video daripada Lightricks apabila kelajuan lebih penting daripada realisme. Kesemuanya boleh dijalankan di bawah ComfyUI pada mesin Linux dengan GPU NVIDIA. Hasilnya ialah klip kira-kira lima saat pada 720p. Bukan satu babak. Bukan rakaman siap selama satu minit.

Berikut ialah jawapan ringkas sebelum perincian. Kad 24 GB menghasilkan klip 720p selama lima saat dalam beberapa minit sahaja. Kad 12 GB melakukan tugas yang sama dalam masa dua puluh minit atau lebih kerana weights tidak muat dalam video memory, lalu perisian berulang kali memindahkan layer antara video memory dan system RAM. Server tanpa GPU tidak dapat menjalankan tugas ini dalam erti kata yang berguna. Pengiraan yang menyebabkan penjanaan imej menggunakan CPU menjadi perlahan menjadikan penjanaan video menggunakan CPU tidak praktikal.

Jika anda telah membaca tahap perkakasan untuk penjana imej yang dihoskan sendiri, video menggunakan hujah yang sama, tetapi setiap nombor dinaikkan satu kelas. VRAM (video memory, iaitu RAM yang dipateri bersebelahan cip grafik) masih merupakan satu-satunya spesifikasi yang menentukan sama ada tugas ini mudah atau menyusahkan.

Mengapa satu video memerlukan kos jauh lebih tinggi daripada satu imej

Model difusi menjana imej dengan menyahbisingnya secara berperingkat, dan setiap langkah membaca semua pemberat dalam model. Model video melakukan perkara yang sama pada keseluruhan blok bingkai serentak. Model ini juga menambahkan perhatian merentas masa supaya bingkai 80 mengetahui rupa bingkai 12. Lima saat pada kadar 24 bingkai sesaat menghasilkan 120 bingkai dalam satu kelompok.

Perhatian temporal itu menyebabkan kos tidak meningkat secara berkadar dengan panjang klip. Penggandaan bilangan bingkai meningkatkan memori yang diperlukan oleh pensampel lebih daripada dua kali ganda. Oleh itu, kegagalan yang berlaku bukanlah pemaparan yang menjadi lebih perlahan. Sebaliknya, proses pemaparan terhenti.

Terdapat lonjakan memori kedua yang tidak dijangka oleh sesetengah pengguna. Selepas pensampel selesai, VAE (pengekod-pengurai auto berperubahan, iaitu bahagian yang menukar pendam termampat kepada piksel sebenar) menyahkod keseluruhan video pendam serentak. Proses penyahkodan itu mungkin memerlukan lebih banyak memori berbanding proses pensampelan. Gejalanya ialah tugas yang memaparkan bar kemajuan yang lengkap, kemudian mencetak mesej ini:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

Penyelesaiannya ialah penyahkodan berjubin atau klip yang lebih pendek. Dengan mengetahui peringkat yang kehabisan memori, anda tidak perlu melaraskan tetapan yang salah selama sejam.

Berapa banyak VRAM yang diperlukan untuk penjanaan video AI

Dua angka yang diterbitkan menjadi asas kepada keseluruhan keputusan ini, tetapi kelihatan seperti bercanggah. Alibaba menyatakan bahawa model Wan 2.2 TI2V-5B menghasilkan klip 720p pada 24 bingkai sesaat selama lima saat dalam masa kurang daripada sembilan minit pada satu GPU pengguna seperti 4090, dan mengesyorkan sekurang-kurangnya 24 GB VRAM. Dokumentasi ComfyUI menyatakan bahawa model 5B yang sama “sepatutnya dapat dimuatkan dengan baik pada vram 8GB menggunakan pemunggahan native ComfyUI”.

Kedua-duanya benar kerana mengukur perkara yang berbeza. 8 GB ialah kapasiti minimum untuk memuatkan model. 24 GB ialah kapasiti yang membolehkan model beroperasi dengan selesa. Pemunggahan berfungsi dengan menyimpan sebahagian besar model dalam RAM sistem dan menstrim lapisan ke GPU bagi setiap langkah. Oleh itu, kad grafik banyak menghabiskan masa menunggu bas PCIe, bukannya melakukan pengiraan. Kos ini berlaku pada setiap langkah sampler, bukan sekali sahaja.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

Hanya baris terakhir ialah angka daripada vendor. Kad 24 GB menghasilkan klip dalam 9 minit, iaitu angka yang diterbitkan Alibaba untuk model ini. Baris lain menunjukkan kesan pemunggahan terhadapnya, dan angkanya ialah anggaran berdasarkan perbezaan tertib magnitud, bukan hasil penanda aras. Coraknya ialah perkara utama: 40 minit pada kad 8 GB ialah persediaan yang secara teknikalnya berfungsi, tetapi secara praktikalnya merupakan tugas kelompok yang perlu dibiarkan berjalan sepanjang malam.

Model Wan 2.2 yang lebih besar berada dalam keadaan yang berbeza. Varian teks-ke-video dan imej-ke-video A14B memerlukan sekurang-kurangnya 80 GB VRAM untuk inferens GPU tunggal. Itu ialah perkakasan pusat data, bukan kad yang dipasang dalam mesin meja, dan pada tahap ini, pengehosan sendiri mula bermaksud menyewa pemecut milik pihak lain mengikut jam.

Kos untuk satu klip pada GPU sewaan

Penyewaan ialah cara yang patut digunakan oleh kebanyakan orang untuk menguji perkara ini, kerana kad yang dibeli bukan perkakasan yang sesuai jika model yang akhirnya anda perlukan memerlukan 80 GB. Harga atas permintaan median merentas pasaran penyewaan GPU, setakat Julai 2026:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

Baris 4090 menjalankan model 5B dan berharga kira-kira 0.05 dolar bagi setiap klip pada kadar 0.36 dolar sejam. Baris 80 GB menjalankan model 14B, sebab itu kos bagi setiap klip meningkat kepada 0.6 dolar walaupun perkakasan itu sendiri jauh lebih pantas. Model yang lebih besar memerlukan lebih banyak pengiraan bagi setiap saat video.

Lima sen bagi satu klip kelihatan seperti jumlah yang kecil, dan di situlah perkara ini boleh mengelirukan. Lima saat pertama yang boleh digunakan tidak pernah dihasilkan dalam satu proses pemaparan. Memberikan gesaan kepada model video ialah proses mencari, dan dua puluh hingga empat puluh pemaparan sebelum mendapat hasil yang boleh digunakan adalah perkara biasa bagi syot dengan gerakan khusus. Oleh itu, satu sesi kerja menelan kos dalam dolar, bukan sen, dan satu petang melakukan iterasi pada perkakasan sewaan berharga kira-kira sama seperti makan tengah hari.

Dua perkara berkaitan penyewaan boleh menyebabkan kos sebenar jika anda terlepas pandang. Anda dicaj semasa mesin memuat turun weights, dan fail Wan 2.2 bersama text encoder serta VAE berjumlah puluhan gigabait. Oleh itu, pilih penyedia yang menawarkan persistent volume dan lakukan muat turun sekali sahaja. Anda juga dicaj semasa mesin berada dalam keadaan melahu dengan sesi SSH anda masih terbuka. Hentikan instance, bukan sekadar menutup terminal.

Pasang ComfyUI pada kotak GPU

Mulakan dengan Ubuntu 24.04 dan pemacu NVIDIA yang telah dipasang. Periksa pemacu terlebih dahulu kerana tanpa pemeriksaan ini, semua kegagalan seterusnya kelihatan sama.

nvidia-smi

Perintah itu mesti memaparkan jadual yang mengandungi kad anda dan versi CUDA. Jika perintah itu memaparkan NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, modul kernel belum dimuatkan. Keadaan ini biasanya berlaku selepas naik taraf kernel tanpa but semula. Baikinya sekarang. Jika tidak, ComfyUI akan menggunakan laluan CPU dan anda akan menghabiskan masa menyalahkan model.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

Sahkan bahawa PyTorch mengesan kad tersebut sebelum anda memuat turun walaupun satu fail weight.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True bersama nama kad anda bermaksud susunan perisian berfungsi dengan baik. False bermaksud wheel yang dipasang ialah binaan CPU sahaja. Keadaan ini berlaku apabila pip menemui torch yang dicache daripada pemasangan terdahulu. Pasang semula menggunakan URL indeks di atas.

Muat turun fail model Wan 2.2

ComfyUI tidak disertakan dengan weights, dan model video bukan satu fail sahaja. Model ini terdiri daripada model diffusion, text encoder dan VAE. Setiap komponen perlu diletakkan dalam direktori masing-masing. Jika fail diletakkan dalam folder yang salah, nod loader tidak akan menyenaraikannya. Tiada ralat dipaparkan untuk menjelaskan sebabnya.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

Model 5B menyokong text-to-video dan image-to-video. Oleh itu, model ini ialah pilihan permulaan yang munasabah. Sentiasa pilih .safetensors berbanding .ckpt. Fail .ckpt ialah objek Python yang diserialkan menggunakan pickle. Memuatkannya akan menjalankan kod yang ditulis oleh pembinanya. Sediakan ruang cakera yang mencukupi: pemasangan yang berfungsi dengan satu keluarga model dan outputnya memerlukan 100 GB. Fail video jauh lebih besar daripada imej PNG yang dihasilkan oleh workflow imej. Sandarkan fail JSON workflow anda menggunakan sesuatu seperti sandaran tambahan terenkripsi ke storan objek, kerana weights boleh dimuat turun semula, tetapi workflow yang telah ditala tidak boleh.

Jalankan dan akses dengan selamat

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI tidak mempunyai skrin log masuk atau akaun pengguna. Apa-apa sahaja yang boleh mencapai port 8188 boleh membuat kerja dalam baris gilir, membaca setiap klip yang anda hasilkan dan memasang nod tersuai, yang membolehkan pelaksanaan kod sewenang-wenangnya pada pelayan anda. Ikatnya pada localhost dan aksesnya melalui terowong SSH dari mesin anda sendiri.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

Kemudian buka http://127.0.0.1:8188 dalam pelayar anda. Muatkan aliran kerja templat Wan 2.2 daripada menu templat ComfyUI dan bukannya menyambungkan nod secara manual. Templat rasmi mengandungi tetapan pensampel yang telah ditala untuk model tersebut. Aliran kerja video mempunyai lebih banyak tempat untuk tersilap menetapkan nilai tanpa disedari berbanding aliran kerja imej.

Apabila jawapan yang tepat ialah menggunakan API

Pengehosan sendiri untuk penjanaan video ialah pilihan yang tepat apabila volum penggunaan tinggi dan konsisten, apabila bingkai anda tidak boleh meninggalkan infrastruktur sendiri, atau apabila anda memerlukan model tertentu atau penyesuai tersuai yang tidak ditawarkan oleh mana-mana perkhidmatan terhos. Pilihan ini juga tepat apabila saluran paip mesti terus berfungsi dengan cara yang sama setahun lagi, kerana model terhos boleh berubah tanpa kawalan anda dan tanpa versi yang boleh dikunci.

Gunakan API terhos apabila anda memerlukan beberapa klip sebulan, apabila anda memerlukan output yang lebih panjang atau lebih besar daripada yang dihasilkan oleh model sumber terbuka, atau apabila anda mempunyai tarikh akhir pada minggu ini. Kira titik pulang modal dengan jujur. Kad 24 GB yang disewa sepanjang masa pada median Julai 2026 berharga kira-kira 260 dolar sebulan, manakala membeli kad yang sama memerlukan kos pendahuluan yang lebih tinggi sebelum anda menjana satu bingkai pun. Mesin pengehosan sendiri yang tidak digunakan sentiasa kalah kepada harga API bagi setiap klip. Ini ialah pertukaran yang sama untuk menentukan cara anda menyediakan model teks, seperti yang diterangkan dalam Ollama berbanding vLLM untuk penyediaan LLM yang dihoskan sendiri, dan ia bergantung pada persoalan asas dalam sama ada VPS dengan GPU berbaloi atau tidak.

Perkara yang perlu diperiksa apabila render gagal

Render yang terhenti pada penghujung proses, selepas bar sampler selesai, kehabisan memori semasa penyahkodan VAE. Kurangkan bilangan bingkai atau tukar kepada nod penyahkodan berjubin. Menukar bilangan langkah tidak akan membantu kerana penyahkodan berlaku sekali selepas semua langkah selesai dijalankan.

Output yang berwarna hitam sepenuhnya atau bercelaru teruk biasanya bermakna VAE tidak sepadan dengan model. Memuatkan VAE Wan 2.1 bersama model difusi Wan 2.2 menghasilkan keadaan ini, dan tiada ralat dipaparkan di mana-mana dalam log.

Render yang berjalan tetapi mengambil masa berjam-jam pada mesin yang diketahui mempunyai GPU bermakna ComfyUI menggunakan laluan CPU. Semak baris peranti dalam log permulaan, kemudian jalankan semula semakan torch.cuda.is_available() di atas.

Proses yang tiba-tiba hilang dengan Killed dalam dmesg tanpa jejak balik Python ialah pembunuh kehabisan memori kernel. Ini bermakna RAM sistem, bukan VRAM, telah kehabisan. Offloading memerlukan keseluruhan model berada dalam RAM sistem. Oleh itu, mesin 16 GB yang menjalankan offloading untuk model 5B tidak mempunyai memori yang mencukupi. Tambah RAM atau tambah swap.

FAQ

Bolehkah saya menjana video AI pada VPS tanpa GPU?

Tidak, bukan dengan cara yang akan anda gunakan lebih daripada sekali. Klip 720p berdurasi lima saat yang mengambil masa sembilan minit pada GPU 24 GB boleh mengambil masa berjam-jam pada CPU, kerana model itu tidak mempunyai perkakasan matriks untuk menjalankannya dan lebar jalur RAM sistem adalah lebih rendah mengikut satu tertib magnitud berbanding lebar jalur memori GPU. Pelayan CPU boleh mengehos antara muka ComfyUI, menyimpan model anda dan menempatkan aliran kerja anda, tetapi proses pemaparan itu sendiri memerlukan GPU.

Berapa banyak VRAM yang saya perlukan untuk Wan 2.2?

Untuk model TI2V-5B, 8 GB ialah keperluan minimum dengan pemunggahan luar asli ComfyUI, manakala 24 GB ialah kapasiti yang disyorkan Alibaba untuk mencapai kelajuan yang diterbitkan. Untuk model penjanaan teks-ke-video dan imej-ke-video A14B, kad model menetapkan sekurang-kurangnya 80 GB VRAM bagi inferens GPU tunggal. Oleh itu, model tersebut memerlukan kad pusat data.

Berapa panjang klip yang boleh dihos sendiri?

Kira-kira lima saat pada 720p ialah unit praktikal setakat July 2026. Output yang lebih panjang dihasilkan dengan menjana segmen dan mencantumkannya, menggunakan bingkai terakhir satu segmen sebagai bingkai pertama segmen seterusnya. Kualiti berubah pada setiap sambungan. Oleh itu, anggap video panjang sebagai tugas penyuntingan, bukan satu penjanaan.

Adakah menyewa GPU mengikut jam lebih murah daripada membeli kad?

Menyewa lebih berbaloi jika proses pemaparan mengambil masa kurang daripada beberapa jam sehari. Pada median July 2026, iaitu kira-kira 0.36 dolar sejam untuk kad 24 GB, anda boleh menyewa untuk tempoh yang lama sebelum kosnya menyamai harga pembelian kad tersebut. Anda juga tidak perlu membeli perkakasan yang kemudiannya didapati tidak sepadan dengan kelas model yang sebenarnya ingin anda gunakan. Membeli hanya berbaloi apabila pelayan itu digunakan hampir sepanjang hari, setiap hari.

#ai-video#comfyui#gpu#self-hosting#wan#vram