SSD Nodes Learn RAM 8GB — $66/tahun
Panduan Matt ConnorOleh Matt Connor · Diperbarui 2026-08-01

Spesifikasi Nyata untuk Generator Gambar AI Mandiri

Ketahui kebutuhan Stable Diffusion: CPU VPS hanya 1–2 menit untuk 512x512, SDXL 10–20 menit, plus perintah instalasi ComfyUI dan kebutuhan disk.

Kebutuhan sebenarnya untuk generator gambar AI yang di-host sendiri

Generator gambar AI yang di-host sendiri terdiri dari satu aplikasi web dan satu file model. Aplikasinya adalah ComfyUI, dan aplikasi ini berjalan pada server Linux apa pun. Model menentukan perangkat keras yang Anda perlukan. Checkpoint kelas SDXL berukuran 6.94 GB dan harus berada di memori GPU. Satu fakta ini menentukan seluruh anggaran, jadi baca tingkatan perangkat keras di bawah sebelum menyewa server.

Ringkasan yang jujur: VPS yang hanya menggunakan CPU dapat memasang dan menyediakan perangkat lunak tersebut, serta menghasilkan gambar berukuran 512x512 dengan model Stable Diffusion 1.5 yang lebih lama dalam waktu satu atau dua menit per gambar. Pada server yang sama, SDXL dengan ukuran 1024x1024 membutuhkan waktu sepuluh hingga dua puluh menit per gambar. Itu bukan konfigurasi yang rusak. Ini adalah konsekuensi perhitungan, dan panduan ini menjelaskannya.

Mengapa ukuran model menentukan mesin

Pembuatan gambar menjalankan loop denoising. Render 30 langkah menerapkan model lengkap ke gambar sebanyak 30 kali, dan setiap langkah membaca semua weight. SDXL pada presisi setengah memiliki sekitar 6.9 GB weight, sehingga render 30 langkah memindahkan sekitar 200 GB melalui memori sebelum gambar tampil.

GPU dengan video memory (VRAM) sebesar 24 GB (memori yang disolder di samping chip grafis) membaca data dengan kecepatan ratusan gigabyte per detik dan dapat menampung seluruh 6.9 GB sekaligus. VPS CPU membaca RAM sistem dengan kecepatan puluhan gigabyte per detik dan tidak memiliki perangkat keras matriks untuk operasi konvolusi. Karena itu, loop yang sama berjalan satu hingga dua tingkat magnitudo lebih lambat. Ini adalah argumen bandwidth memori yang sama dengan yang menentukan kinerja model teks, dan pembahasannya dapat dibaca bersama kapan VPS dengan GPU benar-benar sepadan dengan biayanya.

Pembuatan gambar berbeda dari pembuatan teks dalam satu hal penting. Model chat mengalirkan token, sehingga mesin yang lambat tetap terasa dapat digunakan karena kata-kata muncul saat Anda membacanya. Gambar baru tampil setelah langkah terakhir selesai. Mesin yang lambat berarti Anda harus menatap bilah progres.

Tingkatan perangkat keras, dengan angka nyata

Blok di bawah ini memuat angka umum untuk satu gambar SDXL berukuran 1024x1024, 30 langkah, menggunakan sampler Euler, per Juli 2026. Anggap angka tersebut sebagai perkiraan orde besarnya. Sampler, jumlah langkah, dan resolusi yang Anda gunakan dapat mengubahnya.

ChartOne SDXL image, 1024x1024, 30 steps (typical, July 2026)
The data behind this chart
[
  {
    "label": "8 vCPU VPS, no GPU",
    "seconds_per_image": 780
  },
  {
    "label": "8GB VRAM GPU",
    "seconds_per_image": 32
  },
  {
    "label": "12GB VRAM GPU",
    "seconds_per_image": 18
  },
  {
    "label": "24GB VRAM GPU",
    "seconds_per_image": 9
  }
]

Baris CPU menunjukkan 780 detik, atau sekitar tiga belas menit. Kartu 24 GB membutuhkan 9 detik. Itulah selisih kinerja yang Anda bayar.

Baca tingkatan ini sebagai berikut. Di bawah 8 GB VRAM, SDXL tetap dapat berjalan karena ComfyUI secara otomatis memindahkan layer ke RAM sistem dan dapat menggunakan kartu dengan kapasitas hanya 1 GB. Pemindahan ini menambah waktu pada setiap langkah, sehingga kartu 6 GB menghasilkan satu gambar dalam waktu yang lebih mendekati satu menit daripada tiga puluh detik. Pada 8 GB, model dasar dapat dimuat dan proses render berjalan dengan lancar. Pada 12 GB, Anda dapat memuat satu atau dua ControlNet bersama checkpoint tanpa pemindahan ke RAM sistem. Pada 24 GB, Anda dapat menjalankan SDXL, refiner, dan upscaling dalam satu workflow, serta mulai melatih adapter LoRA, yang membutuhkan memori jauh lebih besar daripada proses generasi.

Hal yang dapat dan tidak dapat dilakukan VPS CPU

VPS CPU dapat melakukan lebih banyak daripada yang diperkirakan, tetapi lebih sedikit daripada yang tersirat dalam materi pemasaran. Pahami batasnya secara spesifik.

VPS CPU dapat memasang ComfyUI, menyediakan antarmuka web, menyimpan pustaka model, menjalankan antrean, dan menghasilkan gambar tanpa GPU sama sekali. Dengan Stable Diffusion 1.5 pada 512x512 dan 20 langkah, perkirakan sekitar 60 hingga 150 detik per gambar pada 8 vCPU modern dengan RAM 16 GB. Untuk tugas batch yang berjalan semalaman atau endpoint gambar bervolume rendah di belakang antrean, kemampuan ini benar-benar memadai.

VPS CPU tidak dapat menyediakan pekerjaan interaktif. Iterasi prompt berarti melakukan dua puluh render dalam satu jam. Jika setiap render memerlukan tiga belas menit, Anda hanya mendapatkan empat render. VPS CPU juga tidak dapat digunakan untuk melatih model. Fine-tuning LoRA pada CPU dihitung dalam hitungan hari, bukan jam, sehingga anggap fitur ini tidak tersedia.

Aturan memori untuk penggunaan CPU saja berbeda dari aturan GPU. Bobot model dimuat ke RAM sistem, sehingga Anda memerlukan ukuran model ditambah ruang kerja: sekitar 16 GB RAM untuk SDXL dan sekitar 8 GB untuk SD 1.5. Server dengan RAM 4 GB akan memulai ComfyUI, lalu dihentikan oleh pembunuh kehabisan memori di tengah render pertama. Kondisi ini terlihat ketika proses menghilang dengan Killed di dmesg tanpa traceback Python.

Instal ComfyUI pada mesin GPU

Berikut adalah perintah dari upstream. Mulai dari instalasi Ubuntu 24.04 yang bersih dengan driver NVIDIA yang sudah terpasang. Konfirmasikan driver terlebih dahulu, karena tanpa pemeriksaan ini semua kegagalan berikutnya akan terlihat sama.

nvidia-smi

Perintah tersebut harus menampilkan tabel yang berisi kartu Anda dan versi CUDA. command not found atau NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver berarti driver belum terpasang atau modul kernel tidak dimuat setelah pemutakhiran. Perbaiki masalah tersebut sebelum melanjutkan, karena ComfyUI akan beralih ke CPU secara diam-diam dan Anda akan menyalahkan perangkat lunaknya.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

Lingkungan virtual bukan sekadar saran opsional. PyTorch menarik banyak dependensi, dan memasangnya secara global pada mesin yang menjalankan hal lain dapat merusak aplikasi tersebut. Verifikasi bahwa PyTorch dapat mendeteksi kartu sebelum melanjutkan.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True beserta nama kartu Anda berarti stack tersebut berfungsi. False berarti wheel yang Anda pasang tidak cocok dengan driver, biasanya karena wheel torch khusus CPU sudah tersimpan dalam cache. Pasang ulang menggunakan URL indeks di atas.

Dapatkan model dan rencanakan kapasitas disk

ComfyUI tidak menyertakan weights. Simpan checkpoint di models/checkpoints, file VAE di models/vae, dan adapter LoRA di models/loras.

cd ~/ComfyUI/models/checkpoints
wget https://huggingface.co/stabilityai/stable-diffusion-xl-base-1.0/resolve/main/sd_xl_base_1.0.safetensors

Selalu pilih .safetensors daripada .ckpt. File .ckpt adalah objek Python yang diserialisasikan dengan pickle. Saat dimuat, file tersebut menjalankan kode dari pihak yang membuatnya. Format safetensors hanya menyimpan tensor. Karena itu, file berbahaya tidak dapat menjalankan apa pun.

Kapasitas penyimpanan sering terlupakan. Satu checkpoint dasar SDXL berukuran 6.94 GB. Refiner berukuran 6 GB tambahan. Satu model ControlNet berukuran 1.4 hingga 2.5 GB, upscaler berukuran 60 hingga 350 MB, dan LoRA berukuran 20 hingga 400 MB. Pengguna yang rutin memakai sistem ini biasanya mengunduh model dasar kedua dan ketiga dalam waktu seminggu. Sediakan kapasitas disk 100 GB untuk instalasi yang siap digunakan. Pantau juga direktori output: file PNG 1024x1024 berukuran 1 hingga 2 MB per file, dan batch yang dibiarkan berjalan dapat memenuhi disk kecil tanpa disadari. Simpan models/ dan output/ pada volume yang kapasitasnya dapat ditambah. Cadangkan file JSON workflow dengan metode seperti pencadangan inkremental terenkripsi ke penyimpanan objek. Weights dapat diunduh ulang. Workflow yang telah Anda sesuaikan tidak dapat dipulihkan dengan cara yang sama.

Jalankan dan akses dengan aman

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI melayani koneksi pada port 8188. Pada server yang hanya menggunakan CPU, tambahkan --cpu. Opsi ini memaksa penggunaan jalur CPU dan mencegah kegagalan karena perangkat CUDA tidak tersedia.

Ikat ComfyUI ke 127.0.0.1, bukan ke 0.0.0.0. ComfyUI tidak memiliki layar login atau akun pengguna. Apa pun yang dapat mengakses port tersebut dapat memasukkan tugas ke antrean, membaca semua gambar yang telah Anda buat, dan memasang custom node. Tindakan ini memungkinkan eksekusi kode arbitrer di server Anda. Sebagai gantinya, akses ComfyUI melalui tunnel SSH dari laptop Anda.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

Kemudian buka http://127.0.0.1:8188 secara lokal. Jika memerlukan akses multi-pengguna yang sebenarnya, tempatkan reverse proxy dengan autentikasi di depannya dan tetap ikat aplikasi ke localhost. Alasan yang sama berlaku untuk layanan self-hosted lain yang tidak memiliki autentikasi. Ini juga merupakan pola standar dalam deployment Docker Compose pada VPS.

Tetap jalankan di bawah systemd

Antrean render yang berhenti saat sesi SSH Anda ditutup bukanlah layanan. Tulis /etc/systemd/system/comfyui.service.

[Unit]
Description=ComfyUI
After=network-online.target

[Service]
User=comfy
WorkingDirectory=/home/comfy/ComfyUI
ExecStart=/home/comfy/ComfyUI/venv/bin/python main.py --listen 127.0.0.1 --port 8188
Restart=on-failure
RestartSec=5

[Install]
WantedBy=multi-user.target
sudo systemctl daemon-reload
sudo systemctl enable --now comfyui
systemctl status comfyui

active (running) dan baris log yang berbunyi To see the GUI go to: http://127.0.0.1:8188 menunjukkan bahwa layanan tersebut aktif. Perhatikan bahwa ExecStart secara langsung menentukan interpreter di dalam lingkungan virtual, karena systemd tidak menjalankan profil shell Anda dan activate tidak pernah terjadi.

Rekomendasi praktis berdasarkan anggaran

Jika Anda ingin mencoba pembuatan gambar dan biaya lebih penting daripada kecepatan, gunakan CPU VPS dengan RAM 16 GB, jalankan SD 1.5 pada 512x512, dan terima waktu sekitar satu atau dua menit per gambar. Ini adalah titik awal yang realistis dan biayanya hanya sebagian kecil dari biaya mesin yang dilengkapi GPU. Tempat ini juga cocok untuk meng-host pustaka model dan workflow sambil Anda menentukan kebutuhan.

Jika Anda mengiterasikan prompt setiap hari, sewa GPU dengan VRAM minimal 12 GB per jam dari cloud GPU, lalu matikan saat sudah selesai. Pembuatan gambar biasanya berlangsung secara burst, dan GPU yang menganggur tetapi tetap ditagihkan bulanan adalah penyebab paling umum pemborosan biaya. Simpan checkpoint di block storage yang murah dan mount storage tersebut.

Jika Anda menyediakan layanan untuk orang lain atau melatih adapter LoRA, Anda memerlukan VRAM 24 GB dan mesin yang tetap aktif. Pada tahap ini, mesin yang sama biasanya juga bermanfaat untuk menjalankan language model secara lokal, seperti yang dijelaskan dalam menjalankan LLM secara mandiri dengan Ollama.

Apa pun tingkat yang Anda pilih, ukur mesin Anda sendiri sebelum mempercayai angka yang dipublikasikan. Masukkan prompt yang sama ke antrean sebanyak lima kali, lalu baca jumlah detik per iterasi yang dicetak ComfyUI di konsolnya. Angka tersebut menunjukkan posisi Anda yang sebenarnya.

FAQ

Dapatkah saya menjalankan Stable Diffusion tanpa GPU?

Ya. ComfyUI berjalan dengan python main.py --cpu dan menghasilkan gambar nyata tanpa kartu grafis. Untuk Stable Diffusion 1.5 pada 512x512, perkirakan sekitar 60 hingga 150 detik per gambar. Untuk SDXL pada 1024x1024, waktunya sekitar sepuluh hingga dua puluh menit dengan 8 vCPU modern. Ini sesuai untuk batch semalaman dan endpoint dengan volume rendah. Cara ini tidak sesuai untuk iterasi prompt, dan pelatihan sama sekali tidak praktis.

Berapa banyak VRAM yang diperlukan untuk SDXL?

8 GB dapat menjalankan SDXL dengan lancar pada 1024x1024. Di bawah jumlah tersebut, ComfyUI secara otomatis memindahkan layer ke RAM sistem dan tetap dapat berjalan hingga sekitar 1 GB VRAM. Namun, setiap langkah yang dipindahkan memerlukan waktu tambahan. 12 GB memungkinkan Anda memuat ControlNet bersama checkpoint. 24 GB mencukupi untuk base, refiner, dan upscaling dalam satu workflow, serta merupakan batas praktis minimum untuk melatih adapter LoRA.

Berapa banyak ruang disk yang diperlukan model?

Checkpoint base SDXL saja berukuran 6.94 GB, sedangkan refiner menambah sekitar 6 GB. Setiap model ControlNet berukuran 1.4 hingga 2.5 GB, adapter LoRA berukuran 20 hingga 400 MB, dan upscaler berukuran hingga 350 MB. Sediakan 100 GB untuk instalasi yang dapat digunakan dengan beberapa model base. Pantau direktori output secara terpisah karena file PNG 1024x1024 berukuran 1 hingga 2 MB per file.

Apakah aman membuka ComfyUI ke internet publik?

Tidak. ComfyUI tidak memiliki autentikasi dalam bentuk apa pun. Sistem custom-node-nya memasang dan menjalankan kode Python dari antarmuka. Karena itu, port yang terbuka memungkinkan eksekusi kode jarak jauh di server Anda. Bind ke 127.0.0.1, akses melalui tunnel SSH menggunakan ssh -N -L 8188:127.0.0.1:8188 you@your-server, dan tempatkan reverse proxy dengan autentikasi di depannya jika lebih dari satu orang memerlukan akses.

Mengapa render saya dihentikan tanpa pesan kesalahan?

Jika proses menghilang dengan Killed di dmesg tanpa traceback Python, penyebabnya adalah Linux out-of-memory killer, bukan bug ComfyUI. Pada mesin yang hanya menggunakan CPU, bobot model berada di RAM sistem. Karena itu, SDXL memerlukan sekitar 16 GB dan SD 1.5 sekitar 8 GB, ditambah ruang kerja. Tambah RAM, tambahkan swap, atau gunakan model yang lebih kecil dan resolusi yang lebih rendah.

#stable-diffusion#comfyui#ai#images#self-hosting#gpu