SSD Nodes Learn Hosting plans →
Panduan Matt ConnorOleh Matt Connor · Diperbarui 2026-08-07

Spesifikasi Nyata Generator Gambar AI Self-hosted

Ketahui kebutuhan Stable Diffusion self-hosted: CPU VPS dapat merender 512x512 dalam 1–2 menit, SDXL 1024x1024 hingga 20 menit, plus perintah ComfyUI dan disk 6,94 GB.

Kebutuhan sebenarnya untuk generator gambar AI self-hosted

Generator gambar AI self-hosted terdiri dari satu aplikasi web dan satu file model. Aplikasinya adalah ComfyUI, dan dapat berjalan pada server Linux apa pun. Model menentukan kebutuhan perangkat keras Anda. Checkpoint kelas SDXL adalah satu file berukuran 6.94 GB, dan file tersebut perlu ditempatkan di memori GPU. Fakta ini menentukan seluruh anggaran, jadi baca tingkatan perangkat keras di bawah sebelum menyewa server.

Ringkasan apa adanya: VPS yang hanya menggunakan CPU dapat memasang dan menjalankan software tersebut. VPS ini juga dapat menghasilkan gambar berukuran 512x512 menggunakan model Stable Diffusion 1.5 yang lebih lama, dengan waktu sekitar satu atau dua menit per gambar. Mesin yang sama saat menjalankan SDXL pada ukuran 1024x1024 membutuhkan waktu sepuluh hingga dua puluh menit per gambar. Ini bukan akibat konfigurasi yang rusak. Ini adalah konsekuensi perhitungan sumber daya, dan panduan ini menjelaskannya.

Mengapa ukuran model menentukan mesin

Pembuatan gambar menjalankan loop denoising. Render 30 langkah meneruskan seluruh model ke gambar sebanyak 30 kali, dan setiap langkah membaca semua weight. SDXL dengan presisi setengah memiliki weight sekitar 6.9 GB, sehingga render 30 langkah memindahkan sekitar 200 GB melalui memori sebelum gambar ditampilkan.

GPU dengan video memory (VRAM, memori yang disolder di samping chip grafis) sebesar 24 GB membaca data dengan kecepatan ratusan gigabyte per detik dan dapat menampung seluruh 6.9 GB sekaligus. VPS dengan CPU membaca RAM sistem dengan kecepatan puluhan gigabyte per detik dan tidak memiliki perangkat keras matriks untuk operasi konvolusi, sehingga loop yang sama berjalan satu hingga dua tingkat besaran lebih lambat. Ini adalah argumen bandwidth memori yang sama seperti pada model teks, dan layak dibaca bersama kapan VPS dengan GPU benar-benar sepadan dengan biayanya.

Pembuatan gambar berbeda dari pembuatan teks dalam satu hal penting. Model chat mengalirkan token, sehingga mesin yang lambat tetap terasa dapat digunakan karena kata-kata muncul saat Anda membacanya. Gambar baru muncul setelah langkah terakhir selesai. Lambat berarti Anda harus menatap bilah progres.

Tangga perangkat keras, dengan angka nyata

Blok di bawah ini memuat angka tipikal untuk satu gambar SDXL berukuran 1024x1024, 30 langkah, dan sampler Euler, per Juli 2026. Anggap angka tersebut sebagai perkiraan orde besarnya. Sampler, jumlah langkah, dan resolusi yang Anda gunakan dapat mengubahnya.

ChartOne SDXL image, 1024x1024, 30 steps (typical, July 2026)
The data behind this chart
[
  {
    "label": "8 vCPU VPS, no GPU",
    "seconds_per_image": 780
  },
  {
    "label": "8GB VRAM GPU",
    "seconds_per_image": 32
  },
  {
    "label": "12GB VRAM GPU",
    "seconds_per_image": 18
  },
  {
    "label": "24GB VRAM GPU",
    "seconds_per_image": 9
  }
]

Baris CPU adalah 780 detik, atau sekitar tiga belas menit. Kartu 24 GB membutuhkan 9 detik. Itulah selisih performa yang Anda bayar.

Baca tangga tersebut dengan cara berikut. Di bawah 8 GB VRAM, SDXL tetap dapat berjalan karena ComfyUI secara otomatis memindahkan layer ke RAM sistem dan dapat menggunakan kartu dengan VRAM sekecil 1 GB. Offloading menambah waktu pada setiap langkah, sehingga kartu 6 GB menghasilkan gambar dalam waktu mendekati satu menit, bukan tiga puluh detik. Pada 8 GB, model dasar dapat dimuat dan proses render berjalan lancar. Pada 12 GB, Anda dapat memuat satu atau dua ControlNet bersama checkpoint tanpa offloading. Pada 24 GB, Anda dapat menjalankan SDXL, refiner, dan upscaling dalam satu workflow, serta mulai melatih adapter LoRA, yang membutuhkan memori jauh lebih besar daripada proses generate gambar.

Kemampuan dan keterbatasan CPU VPS

CPU VPS dapat melakukan lebih banyak hal daripada yang diperkirakan banyak orang, tetapi juga lebih sedikit daripada yang tersirat dalam materi pemasaran. Pahami batasnya secara spesifik.

CPU VPS dapat menginstal ComfyUI, menyajikan antarmuka web, menyimpan pustaka model, menjalankan antrean, dan menghasilkan gambar tanpa GPU sama sekali. Dengan Stable Diffusion 1.5 pada 512x512 dan 20 langkah, perkirakan sekitar 60 hingga 150 detik per gambar pada 8 vCPU modern dengan RAM 16 GB. Untuk tugas batch yang berjalan semalaman atau endpoint gambar bervolume rendah di belakang antrean, kinerja tersebut masih memadai.

CPU VPS tidak dapat memberikan pengalaman kerja interaktif. Iterasi prompt berarti menghasilkan dua puluh render dalam satu jam, tetapi dengan waktu tiga belas menit per render, Anda hanya mendapatkan empat render. CPU VPS juga tidak dapat digunakan untuk pelatihan. Fine-tuning LoRA pada CPU memerlukan waktu dalam hitungan hari, bukan jam, sehingga anggap fitur ini tidak tersedia.

Aturan memori untuk penggunaan CPU-only berbeda dari aturan untuk GPU. Bobot model dimuat ke RAM sistem, sehingga Anda memerlukan ukuran model ditambah ruang kerja: sekitar 16 GB RAM untuk SDXL dan sekitar 8 GB untuk SD 1.5. Server dengan RAM 4 GB akan memulai ComfyUI, lalu prosesnya dihentikan oleh out-of-memory killer di tengah render pertama. Kondisi ini terlihat ketika proses menghilang dengan Killed di dmesg tanpa Python traceback.

Instal ComfyUI pada mesin GPU

Berikut adalah perintah dari upstream. Mulai dari instalasi Ubuntu 24.04 yang bersih dengan driver NVIDIA yang sudah terpasang. Konfirmasikan driver terlebih dahulu, karena tanpa pemeriksaan ini semua kegagalan berikutnya terlihat sama.

nvidia-smi

Perintah tersebut harus menampilkan tabel yang berisi kartu Anda dan versi CUDA. command not found atau NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver berarti driver belum terpasang atau modul kernel tidak dimuat setelah upgrade. Perbaiki masalah tersebut sebelum melanjutkan, karena ComfyUI akan diam-diam beralih ke CPU dan Anda akan menyalahkan perangkat lunaknya.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

Virtual environment bukan saran opsional. PyTorch menarik banyak dependensi, dan memasangnya secara system-wide pada mesin yang menjalankan hal lain dapat merusak layanan tersebut. Pastikan PyTorch dapat mendeteksi kartu sebelum melanjutkan.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True ditambah nama kartu Anda berarti stack tersebut berfungsi. False berarti wheel yang Anda pasang tidak cocok dengan driver, biasanya karena wheel torch khusus CPU sudah tersimpan dalam cache. Instal ulang menggunakan index URL di atas.

Dapatkan model dan siapkan ruang disk

ComfyUI tidak menyertakan weights. Checkpoint disimpan di models/checkpoints, file VAE di models/vae, dan adapter LoRA di models/loras.

cd ~/ComfyUI/models/checkpoints
wget https://huggingface.co/stabilityai/stable-diffusion-xl-base-1.0/resolve/main/sd_xl_base_1.0.safetensors

Selalu pilih .safetensors daripada .ckpt. File .ckpt adalah objek Python yang dipickle, dan memuatnya akan menjalankan kode dari pihak yang membuatnya. Format safetensors hanya menyimpan tensor, sehingga file berbahaya tidak dapat menjalankan apa pun.

Penyimpanan adalah biaya yang sering dilupakan. Satu checkpoint dasar SDXL berukuran 6.94 GB. Refiner berukuran 6 GB lagi. Satu model ControlNet berukuran 1.4 hingga 2.5 GB, upscaler berukuran 60 hingga 350 MB, dan LoRA berukuran 20 hingga 400 MB. Pengguna yang menyukai ini biasanya mengunduh model dasar kedua dan ketiga dalam waktu satu minggu. Siapkan ruang disk 100 GB untuk instalasi yang dapat digunakan, dan pantau juga direktori outputs: file PNG berukuran 1024x1024 masing-masing berukuran 1 hingga 2 MB, dan batch yang berjalan tanpa pengawasan dapat memenuhi disk kecil secara perlahan. Letakkan models/ dan output/ pada volume yang dapat diperbesar, lalu cadangkan file JSON workflow menggunakan sesuatu seperti pencadangan inkremental terenkripsi ke object storage. weights dapat diunduh kembali. Workflow yang telah Anda sesuaikan tidak dapat dipulihkan dengan cara yang sama.

Jalankan dan akses dengan aman

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI melayani koneksi pada port 8188. Pada mesin yang hanya menggunakan CPU, tambahkan --cpu. Opsi ini memaksa penggunaan jalur CPU agar proses tidak gagal karena perangkat CUDA tidak tersedia.

Bind ke 127.0.0.1, bukan ke 0.0.0.0. ComfyUI tidak memiliki halaman login atau akun pengguna. Apa pun yang dapat menjangkau port tersebut dapat memasukkan pekerjaan ke antrean, membaca semua gambar yang telah Anda hasilkan, dan memasang custom nodes. Artinya, pihak tersebut dapat menjalankan kode arbitrer pada server Anda. Sebagai gantinya, akses ComfyUI melalui SSH tunnel dari laptop Anda.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

Kemudian buka http://127.0.0.1:8188 secara lokal. Jika Anda memerlukan akses multi-pengguna yang sebenarnya, tempatkan reverse proxy dengan autentikasi di depannya dan tetap bind aplikasi ke localhost. Alasan yang sama berlaku untuk layanan self-hosted tanpa autentikasi apa pun. Ini juga merupakan pola standar dalam deployment Docker Compose pada VPS.

Jalankan terus dengan systemd

Antrean render yang berhenti saat sesi SSH Anda ditutup bukanlah service. Tulis /etc/systemd/system/comfyui.service.

[Unit]
Description=ComfyUI
After=network-online.target

[Service]
User=comfy
WorkingDirectory=/home/comfy/ComfyUI
ExecStart=/home/comfy/ComfyUI/venv/bin/python main.py --listen 127.0.0.1 --port 8188
Restart=on-failure
RestartSec=5

[Install]
WantedBy=multi-user.target
sudo systemctl daemon-reload
sudo systemctl enable --now comfyui
systemctl status comfyui

active (running) dan baris log yang berbunyi To see the GUI go to: http://127.0.0.1:8188 berarti service tersebut aktif. Perhatikan bahwa ExecStart secara langsung menentukan interpreter di dalam virtual environment, karena systemd tidak menjalankan shell profile Anda dan activate tidak pernah terjadi.

Rekomendasi praktis berdasarkan anggaran

Jika Anda ingin mencoba pembuatan gambar dan biaya lebih penting daripada kecepatan, gunakan CPU VPS dengan RAM 16 GB, jalankan SD 1.5 pada 512x512, lalu terima waktu sekitar satu atau dua menit per gambar. Ini adalah titik awal yang realistis, dan biayanya hanya sebagian kecil dibandingkan opsi yang dilengkapi GPU. Tempat ini juga tepat untuk meng-host pustaka model dan workflow selama Anda menentukan pilihan.

Jika Anda mengulangi eksperimen prompt setiap hari, sewa GPU dengan VRAM minimal 12 GB per jam dari GPU cloud, lalu matikan saat tidak digunakan. Pembuatan gambar biasanya berlangsung secara sporadis, dan GPU yang menganggur tetapi tetap ditagihkan setiap bulan adalah penyebab paling umum pemborosan biaya. Simpan checkpoint pada block storage murah dan mount storage tersebut.

Jika Anda melayani pengguna lain atau melatih adapter LoRA, Anda memerlukan VRAM 24 GB dan mesin yang tetap aktif. Pada tahap ini, mesin yang sama biasanya juga layak digunakan untuk menjalankan language model lokal, seperti setup yang dijelaskan dalam self-hosting LLM dengan Ollama.

Apa pun tingkatan yang Anda pilih, ukur mesin Anda sendiri sebelum mempercayai angka yang dipublikasikan. Masukkan prompt yang sama ke antrean sebanyak lima kali, lalu baca nilai detik per iterasi yang dicetak ComfyUI di konsolnya. Angka tersebut menunjukkan posisi nyata mesin Anda.

FAQ

Dapatkah saya menjalankan Stable Diffusion tanpa GPU?

Ya. ComfyUI berjalan dengan python main.py --cpu dan menghasilkan gambar nyata tanpa kartu grafis. Untuk Stable Diffusion 1.5 pada resolusi 512x512, perkirakan sekitar 60 hingga 150 detik per gambar. Untuk SDXL pada resolusi 1024x1024, perkirakan sepuluh hingga dua puluh menit dengan 8 vCPU modern. Ini cukup untuk batch semalaman dan endpoint dengan volume rendah. Pendekatan ini tidak sesuai untuk iterasi prompt, dan pelatihan sama sekali tidak praktis.

Berapa VRAM yang diperlukan untuk SDXL?

VRAM 8 GB dapat menjalankan SDXL dengan baik pada resolusi 1024x1024. Di bawah kapasitas tersebut, ComfyUI secara otomatis memindahkan layer ke RAM sistem dan tetap dapat berjalan hingga sekitar 1 GB VRAM. Namun, setiap langkah yang dipindahkan membutuhkan waktu tambahan. VRAM 12 GB memungkinkan Anda memuat ControlNet bersama checkpoint. VRAM 24 GB mencakup base, refiner, dan upscaling dalam satu workflow, serta merupakan batas praktis minimum untuk melatih adapter LoRA.

Berapa ruang disk yang diperlukan model?

Checkpoint base SDXL saja berukuran 6.94 GB, sedangkan refiner menambahkan sekitar 6 GB. Setiap model ControlNet berukuran 1.4 hingga 2.5 GB, adapter LoRA berukuran 20 hingga 400 MB, dan upscaler berukuran hingga 350 MB. Sediakan 100 GB untuk instalasi yang dapat digunakan dengan beberapa model base. Pantau direktori output secara terpisah karena setiap file PNG berukuran 1024x1024 dapat berukuran 1 hingga 2 MB.

Apakah aman mengekspos ComfyUI ke Internet publik?

Tidak. ComfyUI tidak memiliki autentikasi dalam bentuk apa pun. Sistem custom-node-nya juga memasang dan menjalankan kode Python dari antarmuka. Karena itu, port yang terbuka memungkinkan eksekusi kode jarak jauh pada server Anda. Bind ComfyUI ke 127.0.0.1, akses melalui SSH tunnel dengan ssh -N -L 8188:127.0.0.1:8188 you@your-server, dan tempatkan reverse proxy dengan autentikasi di depannya jika lebih dari satu orang memerlukan akses.

Mengapa render saya dihentikan tanpa pesan error?

Jika proses menghilang dengan Killed di dmesg tanpa traceback Python, penyebabnya adalah Linux out-of-memory killer, bukan bug ComfyUI. Pada mesin yang hanya menggunakan CPU, bobot model berada di RAM sistem. Karena itu, SDXL memerlukan sekitar 16 GB dan SD 1.5 sekitar 8 GB, ditambah ruang kerja. Tambahkan RAM, tambahkan swap, atau gunakan model yang lebih kecil dengan resolusi lebih rendah.