SSD Nodes Learn RAM 8GB — $66/tahun
Panduan Matt ConnorOleh Matt Connor · Diperbarui 2026-08-01

Generator Video AI Self-Hosted: Apa yang Nyata?

Per Juli 2026, Wan 2.2 dan HunyuanVideo menghasilkan klip 720p sekitar lima detik. Ketahui kebutuhan VRAM, biaya GPU sewaan, dan kapan API lebih tepat.

Hal yang benar-benar dapat dilakukan generator video AI yang di-host sendiri

Generator video AI yang di-host sendiri sudah dapat digunakan saat ini, tetapi lebih lambat dan menghasilkan video yang lebih pendek daripada yang ditunjukkan oleh video demo. Per Juli 2026, model terbuka yang layak dijalankan adalah Wan 2.2 dari Alibaba dan HunyuanVideo dari Tencent, serta LTX-Video dari Lightricks jika kecepatan lebih penting daripada realisme. Semuanya berjalan di bawah ComfyUI pada mesin Linux dengan GPU NVIDIA. Hasilnya adalah klip berdurasi sekitar lima detik pada resolusi 720p. Bukan satu adegan. Bukan rekaman jadi berdurasi satu menit.

Berikut jawaban singkatnya sebelum penjelasan rinci. Kartu 24 GB merender klip 720p berdurasi lima detik dalam waktu beberapa menit. Kartu 12 GB melakukan pekerjaan yang sama dalam waktu dua puluh menit atau lebih, karena bobot model tidak muat di memori video dan perangkat lunak terus memindahkan lapisan antara memori video dan RAM sistem. Server tanpa GPU tidak dapat melakukan tugas ini secara praktis. Perhitungan yang membuat pembuatan gambar di CPU menjadi lambat juga membuat pembuatan video di CPU tidak berguna.

Jika Anda sudah membaca tingkatan perangkat keras untuk generator gambar yang di-host sendiri, video menggunakan prinsip yang sama, tetapi setiap angka naik satu tingkat. VRAM (memori video, yaitu RAM yang terpasang di sebelah chip grafis) tetap menjadi satu-satunya spesifikasi yang menentukan apakah proses ini menyenangkan atau menyulitkan.

Mengapa satu video jauh lebih mahal daripada satu gambar

Model difusi menghasilkan gambar dengan menghilangkan noise secara bertahap. Pada setiap langkah, model membaca semua bobotnya. Model video melakukan hal yang sama pada seluruh blok frame sekaligus. Model ini juga menambahkan attention lintas waktu agar frame 80 mengetahui tampilan frame 12. Video berdurasi 5 detik pada 24 frame per detik memiliki 120 frame dalam satu batch.

Attention temporal tersebut menyebabkan biaya tidak bertambah secara proporsional terhadap panjang klip. Menggandakan jumlah frame meningkatkan memori yang diperlukan sampler lebih dari dua kali lipat. Karena itu, kegagalannya bukan berupa proses rendering yang lebih lambat. Proses rendering berhenti.

Ada lonjakan penggunaan memori kedua yang sering tidak diperkirakan. Setelah sampler selesai, VAE (variational autoencoder, komponen yang mengubah latent terkompresi menjadi piksel nyata) mendekode seluruh video latent sekaligus. Proses decode ini dapat memerlukan lebih banyak memori daripada proses sampling. Gejalanya adalah job yang menampilkan progress bar selesai, lalu mencetak pesan berikut:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

Solusinya adalah menggunakan tiled decoding atau klip yang lebih pendek. Dengan mengetahui tahap yang kehabisan memori, Anda tidak perlu menghabiskan waktu satu jam untuk menyesuaikan pengaturan yang keliru.

Berapa banyak VRAM yang diperlukan untuk pembuatan video AI

Dua angka yang dipublikasikan menjadi dasar seluruh keputusan ini, tetapi tampaknya saling bertentangan. Alibaba menyatakan bahwa model Wan 2.2 TI2V-5B menghasilkan klip 720p pada 24 frame per detik dengan durasi lima detik dalam waktu kurang dari sembilan menit pada satu GPU konsumen, seperti 4090, dan merekomendasikan VRAM minimal 24 GB. Dokumentasi ComfyUI menyatakan bahwa model 5B yang sama "seharusnya dapat berjalan dengan baik pada VRAM 8GB dengan offloading native ComfyUI".

Keduanya benar karena mengukur hal yang berbeda. Kapasitas 8 GB cukup agar model dapat berjalan. Kapasitas 24 GB membuatnya berjalan dengan lebih leluasa. Offloading bekerja dengan menyimpan sebagian besar model di RAM sistem dan mengalirkan layer ke GPU pada setiap langkah. Akibatnya, kartu grafis lebih banyak menunggu bus PCIe daripada melakukan perhitungan. Biaya ini muncul pada setiap langkah sampler, bukan hanya sekali.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

Hanya baris terakhir yang merupakan angka dari vendor. Kartu 24 GB menghasilkan 9 menit per klip, sesuai angka yang dipublikasikan Alibaba untuk model ini. Baris lainnya menunjukkan dampak offloading, dan nilainya merupakan perkiraan tingkat besaran, bukan hasil benchmark. Polanya adalah hal yang penting: 40 menit pada kartu 8 GB merupakan konfigurasi yang secara teknis dapat berjalan, tetapi secara praktis menjadi pekerjaan batch yang harus dibiarkan berjalan semalaman.

Model Wan 2.2 yang lebih besar memerlukan pendekatan berbeda. Varian text-to-video dan image-to-video A14B memerlukan VRAM minimal 80 GB untuk inferensi pada satu GPU. Ini adalah perangkat keras pusat data, bukan kartu yang dipasang pada mesin desktop. Pada titik ini, self-hosted mulai berarti menyewa accelerator milik pihak lain berdasarkan durasi penggunaan.

Biaya satu klip pada GPU sewaan

Penyewaan adalah cara yang sebaiknya digunakan kebanyakan orang untuk menguji hal ini, karena kartu yang Anda beli dapat menjadi perangkat keras yang keliru jika model yang akhirnya Anda perlukan membutuhkan 80 GB. Harga median sesuai permintaan di seluruh pasar penyewaan GPU, per Juli 2026:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

Baris 4090 menjalankan model 5B dan biayanya sekitar 0.05 dolar per klip dengan tarif 0.36 dolar per jam. Baris 80 GB menjalankan model 14B. Karena itu, biaya per klipnya meningkat menjadi 0.6 dolar, meskipun perangkat kerasnya sendiri jauh lebih cepat. Model yang lebih besar membutuhkan komputasi lebih banyak untuk setiap detik video.

Lima sen per klip terdengar sangat kecil. Namun, di situlah letak hal yang menyesatkan. Lima detik pertama yang dapat digunakan tidak pernah dihasilkan dalam satu kali render. Pembuatan prompt untuk model video adalah proses pencarian. Dua puluh hingga empat puluh kali render sebelum mendapatkan hasil yang layak adalah hal yang normal untuk shot dengan gerakan tertentu. Oleh karena itu, sesi kerja biayanya mencapai hitungan dolar, bukan sen. Iterasi selama satu sore pada perangkat keras sewaan biayanya kira-kira setara dengan makan siang.

Dua hal terkait penyewaan dapat menimbulkan biaya nyata jika terlewat. Anda tetap ditagih saat mesin mengunduh weights. File Wan 2.2 beserta text encoder dan VAE berukuran hingga puluhan gigabita. Karena itu, pilih provider dengan persistent volume dan lakukan pengunduhan satu kali. Anda juga tetap ditagih saat mesin menganggur dengan sesi SSH yang masih terbuka. Hentikan instance, bukan hanya menutup terminal.

Menginstal ComfyUI di server GPU

Mulai dari Ubuntu 24.04 dengan driver NVIDIA yang sudah terinstal. Periksa driver terlebih dahulu karena tanpa pemeriksaan ini, setiap kegagalan berikutnya akan terlihat sama.

nvidia-smi

Perintah tersebut harus menampilkan tabel yang berisi kartu grafis dan versi CUDA. Jika menampilkan NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, modul kernel belum dimuat. Hal ini biasanya terjadi setelah pemutakhiran kernel tanpa reboot. Perbaiki masalah ini sekarang. Jika tidak, ComfyUI akan beralih ke jalur CPU dan Anda akan menghabiskan waktu satu jam untuk menyalahkan model.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

Pastikan PyTorch mendeteksi kartu grafis sebelum mengunduh satu pun file bobot.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True serta nama kartu grafis Anda berarti stack tersebut berfungsi dengan baik. False berarti wheel yang terinstal adalah build khusus CPU. Hal ini terjadi ketika pip menemukan torch yang tersimpan dalam cache dari instalasi sebelumnya. Instal ulang menggunakan URL indeks di atas.

Unduh file model Wan 2.2

ComfyUI tidak menyertakan bobot model, dan model video bukan satu file. Model ini terdiri dari model difusi, encoder teks, dan VAE. Masing-masing ditempatkan di direktorinya sendiri. Jika file ditempatkan di folder yang salah, node loader tidak akan menampilkannya. Tidak ada error yang menjelaskan penyebabnya.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

Model 5B mendukung text-to-video dan image-to-video. Karena itu, model ini merupakan titik awal yang tepat. Selalu pilih .safetensors daripada .ckpt. File .ckpt adalah objek Python yang dipickle. Saat dimuat, file tersebut menjalankan kode yang ditulis oleh pembuatnya. Sediakan ruang disk yang memadai. Instalasi yang berfungsi dengan satu keluarga model dan output-nya memerlukan 100 GB. File video jauh lebih besar daripada gambar PNG yang dihasilkan workflow gambar. Cadangkan file JSON workflow menggunakan sesuatu seperti pencadangan inkremental terenkripsi ke penyimpanan objek, karena bobot model dapat diunduh ulang, sedangkan workflow yang telah Anda sesuaikan tidak.

Jalankan dan akses dengan aman

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI tidak memiliki layar login dan akun pengguna. Apa pun yang dapat mengakses port 8188 dapat mengantrekan pekerjaan, membaca setiap klip yang telah Anda buat, dan memasang custom nodes, yang berarti eksekusi kode arbitrer di server Anda. Bind ComfyUI ke localhost, lalu akses melalui SSH tunnel dari komputer Anda sendiri.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

Kemudian buka http://127.0.0.1:8188 di browser. Muat workflow template Wan 2.2 dari menu template ComfyUI, bukan dengan menghubungkan node secara manual. Template resmi menyertakan pengaturan sampler yang digunakan untuk menyetel model, dan workflow video memiliki jauh lebih banyak tempat untuk salah menetapkan nilai tanpa disadari dibandingkan workflow gambar.

Saat jawaban yang tepat adalah menggunakan API

Menjalankan pembuatan video secara mandiri merupakan pilihan yang tepat ketika volumenya tinggi dan stabil, ketika frame tidak boleh keluar dari infrastruktur Anda sendiri, atau ketika Anda memerlukan model tertentu atau adapter khusus yang tidak ditawarkan layanan terkelola mana pun. Pilihan ini juga tepat ketika pipeline harus tetap berfungsi dengan cara yang sama dalam satu tahun, karena model terkelola dapat berubah tanpa pemberitahuan dan tanpa versi yang dapat dikunci.

Gunakan API terkelola ketika Anda hanya memerlukan beberapa klip per bulan, ketika output yang diperlukan lebih panjang atau lebih besar daripada yang dapat dihasilkan model terbuka, atau ketika Anda memiliki tenggat waktu minggu ini. Hitung titik impas secara realistis. Kartu 24 GB yang disewa sepanjang waktu dengan harga median pada Juli 2026 biayanya kira-kira 260 dolar per bulan, sedangkan membeli kartu yang sama membutuhkan biaya awal lebih besar daripada jumlah tersebut sebelum Anda menghasilkan satu frame pun. Server yang di-host sendiri tetapi menganggur selalu kalah dari penetapan harga API per klip. Ini merupakan pertukaran yang sama dengan yang menentukan cara Anda menyediakan model teks, sebagaimana dibahas dalam Ollama dibandingkan dengan vLLM untuk penyediaan LLM yang di-host sendiri, dan hal ini bergantung pada pertanyaan yang lebih mendasar dalam apakah VPS dengan GPU memang sepadan dengan biayanya.

Hal yang perlu diperiksa saat render gagal

Render yang berhenti tepat di akhir, setelah bilah sampler selesai, kehabisan memori saat proses VAE decode. Kurangi jumlah frame atau gunakan node tiled decode. Mengubah jumlah step tidak akan membantu karena proses decode hanya berjalan sekali, setelah semua step selesai.

Output yang sepenuhnya hitam atau sangat kacau biasanya berarti VAE tidak cocok dengan model. VAE Wan 2.1 yang dimuat untuk model difusi Wan 2.2 menghasilkan kondisi tersebut, dan tidak ada error yang muncul di log.

Render yang berjalan tetapi memerlukan waktu berjam-jam pada mesin yang diketahui memiliki GPU berarti ComfyUI menggunakan jalur CPU. Periksa baris perangkat di log startup, lalu jalankan kembali pemeriksaan torch.cuda.is_available() di atas.

Proses yang tiba-tiba menghilang dengan Killed di dmesg tanpa traceback Python berarti kernel menjalankan pembunuh proses karena kehabisan memori. Jadi, masalahnya ada pada RAM sistem, bukan VRAM. Offloading memerlukan seluruh model berada di RAM sistem. Artinya, mesin dengan RAM 16 GB yang melakukan offloading model 5B tidak memiliki cukup memori. Tambahkan RAM atau swap.

FAQ

Dapatkah saya membuat video AI di VPS tanpa GPU?

Tidak, setidaknya tidak dengan cara yang layak digunakan lebih dari satu kali. Klip 720p berdurasi lima detik yang memerlukan waktu sembilan menit pada GPU 24 GB dapat memerlukan waktu berjam-jam pada CPU. Penyebabnya, model tidak memiliki perangkat keras matriks untuk menjalankan komputasi, sedangkan bandwidth RAM sistem jauh lebih rendah daripada bandwidth memori GPU. Server CPU dapat meng-host antarmuka ComfyUI, menyimpan model, dan menampung workflow, tetapi proses rendering tetap memerlukan GPU.

Berapa banyak VRAM yang diperlukan Wan 2.2?

Untuk model TI2V-5B, 8 GB adalah batas minimum dengan native offloading ComfyUI, sedangkan 24 GB diperlukan untuk mencapai kecepatan yang dipublikasikan Alibaba. Untuk model text-to-video dan image-to-video A14B, model card mensyaratkan sedikitnya 80 GB VRAM untuk inferensi dengan satu GPU. Karena itu, model tersebut memerlukan kartu untuk pusat data.

Berapa lama klip yang di-host sendiri dapat dibuat?

Sekitar lima detik pada 720p adalah durasi praktis per unit per Juli 2026. Output yang lebih panjang dibuat dengan menghasilkan beberapa segmen lalu menggabungkannya. Frame terakhir dari satu segmen digunakan sebagai frame pertama segmen berikutnya. Kualitas dapat berubah pada setiap sambungan. Karena itu, perlakukan video panjang sebagai pekerjaan penyuntingan, bukan satu kali generasi.

Apakah menyewa GPU per jam lebih murah daripada membeli kartu?

Menyewa lebih menguntungkan jika rendering dilakukan kurang dari beberapa jam per hari. Dengan median sekitar 0.36 dolar per jam untuk kartu 24 GB pada Juli 2026, Anda dapat menyewa dalam waktu lama sebelum biayanya menyamai harga pembelian kartu tersebut. Anda juga tidak perlu membeli perangkat keras yang ternyata tidak sesuai dengan kelas model yang sebenarnya ingin digunakan. Membeli hanya lebih menguntungkan jika server digunakan hampir sepanjang hari, setiap hari.

#ai-video#comfyui#gpu#self-hosting#wan#vram