SSD Nodes Learn Hosting plans →
Panduan Matt ConnorOleh Matt Connor · Diperbarui 2026-08-13

Generator Video AI Mandiri: Kebutuhan dan Biaya Nyata

Pelajari hasil model video terbuka per Juli 2026, kebutuhan VRAM 12 atau 24 GB, biaya klip lima detik di GPU sewaan, dan kapan API lebih tepat.

Kemampuan sebenarnya generator video AI yang di-host sendiri

Generator video AI yang di-host sendiri sudah dapat digunakan saat ini, tetapi lebih lambat dan menghasilkan video yang lebih pendek daripada yang ditunjukkan dalam demo. Per Juli 2026, model terbuka yang layak dijalankan adalah Wan 2.2 dari Alibaba dan HunyuanVideo dari Tencent, serta LTX-Video dari Lightricks jika kecepatan lebih penting daripada realisme. Semua model tersebut berjalan di ComfyUI pada mesin Linux dengan GPU NVIDIA. Hasilnya adalah klip berdurasi sekitar lima detik pada resolusi 720p. Bukan sebuah adegan. Bukan rekaman jadi berdurasi satu menit.

Berikut jawaban singkatnya sebelum penjelasan rinci. GPU dengan VRAM 24 GB merender klip 720p berdurasi lima detik dalam waktu beberapa menit. GPU dengan VRAM 12 GB membutuhkan waktu dua puluh menit atau lebih untuk pekerjaan yang sama, karena bobot model tidak muat di memori video dan perangkat lunak terus memindahkan lapisan antara memori tersebut dan RAM sistem. Server tanpa GPU tidak dapat menjalankan proses ini secara praktis. Perhitungan yang membuat pembuatan gambar dengan CPU menjadi lambat juga membuat pembuatan video dengan CPU tidak berguna.

Jika Anda sudah membaca tingkatan perangkat keras untuk generator gambar yang di-host sendiri, video menggunakan argumen yang sama, tetapi setiap angkanya naik satu kelas. VRAM (memori video, yaitu RAM yang disolder di dekat chip grafis) tetap menjadi satu-satunya spesifikasi yang menentukan apakah proses ini nyaman atau menyulitkan.

Mengapa satu video jauh lebih mahal daripada satu gambar

Model difusi menghasilkan gambar dengan melakukan denoising secara bertahap. Setiap tahap membaca semua bobot dalam model. Model video melakukan hal yang sama pada seluruh blok frame sekaligus. Model ini juga menambahkan attention lintas waktu agar frame 80 mengetahui tampilan frame 12. Video berdurasi lima detik pada 24 frame per detik berisi 120 frame dalam satu batch.

Attention temporal tersebut menyebabkan biaya tidak bertambah secara proporsional terhadap panjang klip. Jika jumlah frame dilipatgandakan, memori yang dibutuhkan sampler bertambah lebih dari dua kali lipat. Karena itu, kegagalannya bukan berupa rendering yang lebih lambat. Proses render dapat berhenti.

Ada lonjakan penggunaan memori kedua yang sering tidak diperkirakan. Setelah sampler selesai, VAE (variational autoencoder, komponen yang mengubah latent terkompresi menjadi piksel sebenarnya) melakukan decode terhadap seluruh video latent sekaligus. Proses decode ini dapat membutuhkan memori lebih besar daripada proses sampling. Gejalanya adalah job yang menampilkan progress bar selesai, lalu mencetak pesan berikut:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

Solusinya adalah tiled decoding atau menggunakan klip yang lebih pendek. Dengan mengetahui tahap yang kehabisan memori, Anda tidak perlu menghabiskan waktu satu jam untuk menyesuaikan pengaturan yang salah.

Berapa VRAM yang dibutuhkan untuk menghasilkan video AI

Dua angka yang dipublikasikan menjadi dasar keputusan ini, tetapi tampak saling bertentangan. Alibaba menyatakan bahwa model Wan 2.2 TI2V-5B menghasilkan klip 720p pada 24 frame per detik dengan durasi lima detik dalam waktu kurang dari sembilan menit pada satu GPU konsumen, seperti 4090, dan merekomendasikan VRAM minimal 24 GB. Dokumentasi ComfyUI menyatakan bahwa model 5B yang sama “seharusnya dapat berjalan dengan baik pada VRAM 8GB menggunakan native offloading ComfyUI”.

Keduanya benar karena mengukur hal yang berbeda. Model tersebut dapat berjalan dengan VRAM 8 GB. VRAM 24 GB membuatnya dapat berjalan dengan lebih lancar. Offloading bekerja dengan menyimpan sebagian besar model di RAM sistem dan mengalirkan layer ke GPU pada setiap langkah. Akibatnya, GPU lebih banyak menunggu bus PCIe daripada melakukan komputasi. Biaya ini muncul pada setiap langkah sampler, bukan hanya sekali.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

Hanya baris terakhir yang merupakan angka dari vendor. Kartu 24 GB menghasilkan 9 menit per klip, sesuai angka yang dipublikasikan Alibaba untuk model ini. Baris lainnya menunjukkan dampak offloading. Angka tersebut merupakan perkiraan berdasarkan orde besaran, bukan hasil benchmark. Polanya adalah hal yang penting: 40 menit pada kartu 8 GB secara teknis dapat digunakan, tetapi secara praktis merupakan batch job yang perlu dibiarkan berjalan semalaman.

Model Wan 2.2 yang lebih besar berada pada skala yang berbeda. Varian text-to-video dan image-to-video A14B memerlukan VRAM minimal 80 GB untuk inference pada satu GPU. Ini adalah perangkat keras data center, bukan kartu yang dipasang pada komputer meja, dan pada titik ini self-hosting mulai berarti menyewa accelerator milik pihak lain berdasarkan durasi penggunaan. Perhitungan yang sama menjadi jauh lebih besar pada sisi text, ketika self-hosting model 2,8 triliun parameter seperti Kimi K3 tidak lagi menjadi pertanyaan tentang satu kartu, melainkan tentang berapa banyak kartu 80 GB yang mampu Anda hubungkan secara bersamaan.

Biaya satu klip pada GPU sewaan

Penyewaan adalah cara yang sebaiknya digunakan kebanyakan orang untuk menguji ini, karena kartu yang Anda beli bisa menjadi perangkat keras yang tidak sesuai jika model yang akhirnya ingin Anda gunakan memerlukan 80 GB. Harga median sesuai permintaan di seluruh pasar penyewaan GPU per Juli 2026:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

Baris 4090 menjalankan model 5B dan biayanya sekitar 0.05 dolar per klip dengan tarif 0.36 dolar per jam. Baris 80 GB menjalankan model 14B. Karena itu, biaya per klipnya meningkat menjadi 0.6 dolar meskipun perangkat kerasnya sendiri jauh lebih cepat. Model yang lebih besar memerlukan komputasi lebih banyak untuk setiap detik video.

Lima sen per klip terdengar sangat murah. Di situlah letak hal yang menyesatkan. Lima detik pertama yang benar-benar dapat digunakan tidak pernah dihasilkan dalam satu kali render. Pembuatan prompt untuk model video adalah proses pencarian, dan dua puluh hingga empat puluh render sebelum mendapatkan hasil yang layak adalah hal yang normal untuk shot dengan gerakan tertentu. Karena itu, satu sesi kerja biasanya memerlukan biaya dalam hitungan dolar, bukan sen. Sore untuk melakukan iterasi pada perangkat keras sewaan biayanya kira-kira setara dengan makan siang.

Dua hal terkait penyewaan dapat menimbulkan biaya nyata jika terlewat. Anda tetap ditagih saat mesin mengunduh weights. File Wan 2.2 beserta text encoder dan VAE berukuran hingga puluhan gigabita. Karena itu, pilih provider yang menyediakan persistent volume dan lakukan pengunduhan satu kali. Anda juga tetap ditagih saat mesin menganggur dengan sesi SSH yang masih terbuka. Hentikan instance, bukan sekadar menutup terminal.

Pasang ComfyUI pada server GPU

Mulai dengan Ubuntu 24.04 dan driver NVIDIA yang sudah terpasang. Periksa driver terlebih dahulu karena tanpa pemeriksaan ini, semua kegagalan berikutnya akan terlihat sama.

nvidia-smi

Perintah tersebut harus menampilkan tabel yang berisi kartu Anda dan versi CUDA. Jika menampilkan NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, modul kernel belum dimuat. Hal ini biasanya terjadi setelah pemutakhiran kernel tanpa reboot. Perbaiki masalah ini sekarang. Jika tidak, ComfyUI akan menggunakan jalur CPU dan Anda dapat menghabiskan waktu satu jam dengan menyalahkan model.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

Pastikan PyTorch mengenali kartu tersebut sebelum mengunduh satu pun file bobot.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True beserta nama kartu Anda berarti stack tersebut berfungsi dengan baik. False berarti wheel yang terpasang adalah build khusus CPU. Hal ini terjadi ketika pip menemukan torch yang tersimpan dalam cache dari instalasi sebelumnya. Pasang ulang menggunakan URL indeks di atas.

Unduh file model Wan 2.2

ComfyUI tidak menyertakan weights, dan model video bukan satu file. Model ini terdiri atas model difusi, text encoder, dan VAE. Masing-masing file ditempatkan di direktori tersendiri. Jika file ditempatkan di folder yang salah, node loader tidak akan menampilkannya. Tidak ada error yang menjelaskan penyebabnya.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

Model 5B mendukung text-to-video dan image-to-video. Karena itu, model ini merupakan pilihan awal yang tepat. Selalu pilih .safetensors daripada .ckpt. File .ckpt adalah objek Python yang diserialisasi dengan pickle. Saat dimuat, file tersebut menjalankan kode yang ditulis oleh pembuatnya. Sediakan ruang disk yang cukup. Instalasi yang berfungsi dengan satu keluarga model dan outputnya memerlukan 100 GB. File video jauh lebih besar daripada gambar PNG yang dihasilkan workflow gambar. Cadangkan file JSON workflow menggunakan sesuatu seperti backup inkremental terenkripsi ke object storage, karena weights dapat diunduh kembali, sedangkan workflow yang telah Anda sesuaikan tidak.

Jalankan dan akses dengan aman

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI tidak memiliki layar login atau akun pengguna. Apa pun yang dapat mengakses port 8188 dapat mengantrekan job, membaca semua klip yang telah Anda hasilkan, dan memasang custom nodes. Hal ini memungkinkan eksekusi kode arbitrer pada server Anda. Bind ComfyUI ke localhost, lalu akses melalui SSH tunnel dari komputer Anda sendiri.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

Kemudian buka http://127.0.0.1:8188 di browser. Muat workflow template Wan 2.2 dari menu template ComfyUI, bukan dengan menghubungkan node secara manual. Template resmi menyertakan pengaturan sampler yang menjadi dasar tuning model. Workflow video juga memiliki jauh lebih banyak bagian yang dapat menyebabkan nilai keliru tanpa disadari dibandingkan workflow gambar.

Kapan jawaban yang tepat adalah menggunakan API

Self-hosting untuk pembuatan video merupakan pilihan yang tepat jika volumenya tinggi dan stabil, jika frame tidak boleh meninggalkan infrastruktur Anda, atau jika Anda memerlukan model tertentu atau adapter khusus yang tidak disediakan layanan hosted mana pun. Pilihan ini juga tepat jika pipeline harus tetap berfungsi dengan cara yang sama dalam satu tahun, karena model hosted dapat berubah tanpa menyediakan versi yang dapat dikunci.

Gunakan API hosted jika Anda hanya memerlukan beberapa klip per bulan, jika memerlukan output yang lebih panjang atau lebih besar daripada yang dapat dihasilkan model open source, atau jika Anda memiliki tenggat minggu ini. Hitung titik impas secara realistis. GPU dengan VRAM 24 GB yang disewa sepanjang waktu berdasarkan median Juli 2026 berbiaya sekitar 260 dolar per bulan, sedangkan membeli GPU yang sama memerlukan biaya di muka lebih besar daripada itu sebelum Anda menghasilkan satu frame pun. Server self-hosted yang menganggur selalu kalah dari harga API per klip. Ini adalah pertukaran yang sama seperti saat menentukan cara menyajikan model teks, yang dibahas dalam Ollama dibandingkan dengan vLLM untuk penyajian LLM self-hosted, dan keputusan ini bergantung pada pertanyaan yang lebih mendasar dalam apakah VPS dengan GPU memang sepadan dengan biayanya.

Hal yang perlu diperiksa saat render gagal

Render yang berhenti tepat di akhir, setelah bilah sampler selesai, kehabisan memori saat proses decode VAE. Kurangi jumlah frame atau gunakan node tiled decode. Mengubah jumlah step tidak akan membantu karena proses decode hanya berjalan sekali, setelah semua step selesai.

Output yang sepenuhnya hitam atau sangat kacau biasanya berarti VAE tidak cocok dengan model. VAE Wan 2.1 yang dimuat untuk model difusi Wan 2.2 menghasilkan kondisi tersebut, dan tidak ada error yang muncul di log.

Render yang berjalan tetapi memerlukan waktu berjam-jam pada mesin yang diketahui memiliki GPU berarti ComfyUI menggunakan jalur CPU. Periksa baris perangkat pada log startup, lalu jalankan kembali pemeriksaan torch.cuda.is_available() di atas.

Proses yang menghilang dengan Killed di dmesg tanpa traceback Python menunjukkan bahwa kernel menjalankan out-of-memory killer. Ini berarti RAM sistem, bukan VRAM, yang habis. Offloading memerlukan seluruh model berada di RAM sistem. Karena itu, mesin dengan RAM 16 GB yang melakukan offloading model 5B tidak memiliki kapasitas yang cukup. Tambahkan RAM atau swap.

FAQ

Dapatkah saya membuat video AI pada VPS tanpa GPU?

Tidak, setidaknya tidak dengan cara yang akan Anda gunakan lebih dari sekali. Klip 720p berdurasi lima detik yang memerlukan waktu sembilan menit pada GPU 24 GB dapat memerlukan waktu berjam-jam pada CPU, karena model tidak memiliki perangkat keras matriks untuk menjalankannya dan bandwidth RAM sistem lebih rendah satu orde besarnya dibandingkan bandwidth memori GPU. Server CPU dapat meng-host antarmuka ComfyUI, menyimpan model, dan menampung workflow, tetapi proses rendering itu sendiri memerlukan GPU.

Berapa banyak VRAM yang saya perlukan untuk Wan 2.2?

Untuk model TI2V-5B, 8 GB adalah batas minimum dengan offloading native ComfyUI, sedangkan 24 GB adalah kapasitas yang direkomendasikan Alibaba untuk mencapai kecepatan yang dipublikasikan. Untuk model text-to-video dan image-to-video A14B, model card meminta setidaknya 80 GB VRAM untuk inferensi single-GPU. Jadi, model tersebut memerlukan kartu data center.

Berapa panjang klip yang dapat dihasilkan secara self-hosted?

Sekitar lima detik pada 720p merupakan durasi praktis per unit per Juli 2026. Output yang lebih panjang dibuat dengan menghasilkan beberapa segmen lalu menggabungkannya. Frame terakhir dari satu segmen digunakan sebagai frame pertama segmen berikutnya. Kualitas dapat berubah pada setiap sambungan. Karena itu, perlakukan video panjang sebagai pekerjaan pengeditan, bukan satu kali generasi.

Apakah menyewa GPU per jam lebih murah daripada membeli kartu?

Menyewa lebih menguntungkan jika rendering berlangsung kurang dari beberapa jam per hari. Dengan median sekitar 0.36 dolar per jam untuk kartu 24 GB pada Juli 2026, Anda dapat menyewa dalam waktu lama sebelum biayanya menyamai harga pembelian kartu tersebut. Anda juga tidak perlu membeli perangkat keras yang ternyata tidak sesuai dengan kelas model yang benar-benar ingin digunakan. Membeli hanya lebih menguntungkan jika server digunakan hampir sepanjang hari, setiap hari.