SSD Nodes Learn 8GB RAM — $66/वर्ष
मार्गदर्शक Matt Connorद्वारे Matt Connor · अपडेटेड 2026-08-01

स्वतःचे AI इमेज जनरेटर चालवण्यासाठी आवश्यक हार्डवेअर

Stable Diffusion आणि SDXL साठी नेमके किती VRAM आणि रॅम लागते ते जाणून घ्या. ComfyUI इन्स्टॉल करण्यापूर्वी CPU VPS च्या मर्यादा आणि हार्डवेअर बजेटचे अचूक गणित येथे वाचा.

स्वतः होस्ट केलेल्या AI इमेज जनरेटरसाठी खरोखर काय आवश्यक आहे

स्वतः होस्ट केलेला AI इमेज जनरेटर म्हणजे एक वेब ॲप आणि एक मॉडेल फाइल. हे ॲप ComfyUI आहे आणि ते कोणत्याही Linux बॉक्सवर चालते. मॉडेल तुमच्या हार्डवेअरची गरज ठरवते. SDXL-क्लास चेकपॉईंट ही 6.94 GB ची एकच फाइल असते आणि ती GPU मेमरीमध्ये राहणे आवश्यक असते. ही एकच गोष्ट संपूर्ण बजेट ठरवते, म्हणून काहीही भाड्याने घेण्यापूर्वी खालील हार्डवेअर श्रेणी वाचा.

थोडक्यात सत्य: केवळ CPU असलेला VPS सॉफ्टवेअर इन्स्टॉल आणि सर्व्ह करू शकतो. तो जुन्या Stable Diffusion 1.5 मॉडेलसह 512x512 आकाराच्या प्रतिमा प्रति मिनिट एक किंवा दोन या वेगाने तयार करू शकतो. तोच बॉक्स SDXL वापरून 1024x1024 आकाराची प्रतिमा तयार करण्यासाठी दहा ते वीस मिनिटे घेतो. हे सेटअप खराब झालेले नाही. हे केवळ गणित आहे आणि हे मार्गदर्शक ते स्पष्ट करते.

मॉडेलचा आकार मशीन का ठरवतो

इमेज जनरेशनमध्ये डीनॉइजिंग लूप (denoising loop) चालते. 30-स्टेप रेंडरमध्ये संपूर्ण मॉडेल प्रतिमेवरून 30 वेळा फिरवले जाते आणि प्रत्येक वेळी सर्व वेट्स (weights) वाचले जातात. SDXL हाफ प्रिसिजनमध्ये सुमारे 6.9 GB वेट्सचा असतो, त्यामुळे 30-स्टेप रेंडरमध्ये चित्र दिसण्यापूर्वी मेमरीमधून साधारणपणे 200 GB डेटा प्रवाहित होतो.

ज्या GPU मध्ये 24 GB व्हिडिओ मेमरी (VRAM, ग्राफिक्स चिपच्या शेजारी असलेली मेमरी) असते, ती शेकडो GB प्रति सेकंद वेगाने डेटा वाचते आणि सर्व 6.9 GB डेटा एकाच वेळी साठवू शकते. CPU VPS सिस्टिम RAM मधून दहापट GB प्रति सेकंद वेगाने डेटा वाचते आणि त्यात कन्व्होल्युशनसाठी (convolutions) मॅट्रिक्स हार्डवेअर नसते, त्यामुळे तोच लूप एक ते दोन पटीने संथ चालतो. हा मेमरी-बँडविड्थचा मुद्दा टेक्स्ट मॉडेल्ससाठीही लागू होतो आणि GPU असलेला VPS कधी फायदेशीर ठरतो हे वाचणे उपयुक्त ठरेल.

इमेज जनरेशन आणि टेक्स्ट जनरेशनमध्ये एक महत्त्वाचा फरक आहे. चॅट मॉडेल टोकन्स स्ट्रीम करते, त्यामुळे संथ मशीनवरही शब्द वाचताना दिसत असल्याने ते वापरण्यायोग्य वाटते. इमेज मात्र शेवटची स्टेप पूर्ण झाल्यावरच दिसते. संथ असणे म्हणजे प्रोग्रेस बारकडे पाहत बसणे होय.

हार्डवेअरची श्रेणी आणि प्रत्यक्ष आकडेवारी

खालील ब्लॉक मध्ये जुलै 2026 च्या स्थितीनुसार, 1024x1024 रिझोल्यूशन, 30 स्टेप्स आणि Euler सॅम्पलर वापरून तयार केलेल्या एका SDXL प्रतिमेसाठीची प्रातिनिधिक आकडेवारी दिली आहे. याकडे केवळ एक ढोबळ अंदाज म्हणून पहा. तुमचा सॅम्पलर, स्टेप्सची संख्या आणि रिझोल्यूशननुसार या आकड्यांमध्ये बदल होऊ शकतो.

ChartOne SDXL image, 1024x1024, 30 steps (typical, July 2026)
The data behind this chart
[
  {
    "label": "8 vCPU VPS, no GPU",
    "seconds_per_image": 780
  },
  {
    "label": "8GB VRAM GPU",
    "seconds_per_image": 32
  },
  {
    "label": "12GB VRAM GPU",
    "seconds_per_image": 18
  },
  {
    "label": "24GB VRAM GPU",
    "seconds_per_image": 9
  }
]

CPU साठी लागणारा वेळ 780 सेकंद, म्हणजेच सुमारे तेरा मिनिटे आहे. 24 GB कार्डसाठी हा वेळ 9 सेकंद आहे. हाच तो फरक आहे ज्यासाठी तुम्ही गुंतवणूक करत आहात.

ही श्रेणी खालीलप्रमाणे वाचा. 8 GB पेक्षा कमी VRAM असल्यास, SDXL तरीही चालू शकते, कारण ComfyUI आपोआप लेयर्सना सिस्टम RAM वर ऑफलोड करते आणि 1 GB इतक्या कमी क्षमतेच्या कार्डवरही ते काम करू शकते. ऑफलोडिंगमुळे प्रत्येक स्टेपला वेळ लागतो, त्यामुळे 6 GB कार्डवर प्रति प्रतिमा लागणारा वेळ तीस सेकंदांऐवजी एका मिनिटाच्या जवळ असतो. 8 GB वर बेस मॉडेल व्यवस्थित बसते आणि रेंडरिंग करणे सोयीचे ठरते. 12 GB असल्यास, तुम्ही ऑफलोडिंगशिवाय चेकपॉईंटसोबत एक किंवा दोन ControlNet वापरू शकता. 24 GB असल्यास, तुम्ही एकाच वर्कफ्लोमध्ये SDXL, रिफायनर आणि अपस्केलिंग चालवू शकता, तसेच तुम्ही LoRA अडॅप्टर्सचे ट्रेनिंग सुरू करू शकता, ज्यासाठी इमेज जनरेशनपेक्षा कितीतरी जास्त मेमरीची आवश्यकता असते.

CPU VPS काय करू शकतो आणि काय करू शकत नाही

हे लोकांच्या अपेक्षेपेक्षा जास्त आणि मार्केटिंगमध्ये सांगितल्यापेक्षा कमी काम करू शकते. यातील सीमारेषा स्पष्ट असणे आवश्यक आहे.

CPU VPS वर ComfyUI इन्स्टॉल करता येते, वेब इंटरफेस सर्व्ह करता येतो, मॉडेल लायब्ररी साठवता येते, क्यू (queue) व्यवस्थापित करता येते आणि GPU नसतानाही प्रतिमा तयार (generate) करता येतात. 8 आधुनिक vCPU आणि 16 GB RAM असलेल्या सिस्टमवर, Stable Diffusion 1.5 वापरून 512x512 रिझोल्यूशन आणि 20 स्टेप्ससाठी प्रति प्रतिमा साधारणपणे 60 ते 150 सेकंद लागतात. रात्रभर चालणाऱ्या बॅच जॉबसाठी किंवा क्यूच्या मागे असलेल्या कमी व्हॉल्यूमच्या इमेज एंडपॉइंटसाठी, हे काम खरोखरच समाधानकारक आहे.

CPU VPS तुम्हाला परस्परसंवादी (interactive) कामासाठी उपयुक्त ठरणार नाही. प्रॉम्प्टमध्ये वारंवार बदल करून काम करण्यासाठी तासाला वीस रेंडर्सची गरज असते, तर येथे प्रत्येक रेंडरला लागणाऱ्या वेळेमुळे तुम्ही तासाला फक्त चारच रेंडर्स करू शकाल. तसेच, यावर ट्रेनिंग करणे शक्य नाही. CPU वर LoRA फाइन-ट्यूनिंग करण्यासाठी तासांऐवजी दिवसांचा कालावधी लागतो, त्यामुळे ते उपलब्ध नाही असेच समजा.

CPU-ओन्ली सेटअपसाठी मेमरीचा नियम GPU पेक्षा वेगळा आहे. मॉडेल्सचे वेट्स (weights) सिस्टम RAM मध्ये लोड होतात, त्यामुळे तुम्हाला मॉडेलच्या आकारापेक्षा जास्त मेमरी लागते: SDXL साठी सुमारे 16 GB RAM आणि SD 1.5 साठी सुमारे 8 GB RAM आवश्यक आहे. 4 GB RAM असलेल्या सर्व्हरवर ComfyUI सुरू होईल, परंतु पहिल्या रेंडरच्या वेळीच आउट-ऑफ-मेमरी किलर (OOM killer) मुळे प्रक्रिया बंद होईल. हे Killed मध्ये dmesg द्वारे दिसून येईल आणि त्यात कोणतीही Python ट्रेसबॅक माहिती मिळणार नाही.

GPU मशीनवर ComfyUI इंस्टॉल करा

हे अपस्ट्रीम कमांड्स आहेत. NVIDIA ड्रायव्हर आधीच असलेल्या स्वच्छ Ubuntu 24.04 इन्स्टॉलपासून सुरुवात करा. प्रथम ड्रायव्हरची खात्री करा, कारण या तपासणीशिवाय नंतर येणारे प्रत्येक अपयश सारखेच दिसते.

nvidia-smi

यामुळे तुमच्या कार्डची माहिती आणि CUDA व्हर्जन असलेली एक टेबल प्रिंट झाली पाहिजे. command not found किंवा NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver चा अर्थ असा आहे की ड्रायव्हर गहाळ आहे किंवा अपग्रेडनंतर कर्नल मॉड्यूल लोड झाले नाही. पुढे जाण्यापूर्वी ते दुरुस्त करा, कारण ComfyUI कोणतीही सूचना न देता आपोआप CPU वर स्विच होईल आणि तुम्ही सॉफ्टवेअरला दोष द्याल.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

व्हर्च्युअल एन्व्हायर्नमेंट वापरणे हा केवळ सल्ला नाही. PyTorch मोठ्या प्रमाणात डिपेंडन्सी ट्री खेचते, आणि इतर काहीही चालणाऱ्या मशीनवर ते सिस्टिम-वाईड इंस्टॉल केल्यास इतर गोष्टी खराब होऊ शकतात. पुढे जाण्यापूर्वी PyTorch ला कार्ड दिसत असल्याची खात्री करा.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True आणि त्यासोबत तुमच्या कार्डचे नाव दिसणे म्हणजे स्टॅक व्यवस्थित काम करत आहे. False चा अर्थ असा आहे की तुम्ही इंस्टॉल केलेली व्हील (wheel) ड्रायव्हरशी जुळत नाही, सहसा याचे कारण असे असते की केवळ CPU साठी असलेली टॉर्च व्हील आधीच कॅशेमध्ये असते. वरील इंडेक्स URL वापरून पुन्हा इंस्टॉल करा.

मॉडेल मिळवा आणि डिस्कचे नियोजन करा

ComfyUI मध्ये कोणतेही वेट्स (weights) आधीच नसतात. चेकपॉइंट्स models/checkpoints मध्ये, VAE फाइल्स models/vae मध्ये आणि LoRA अडॅप्टर्स models/loras मध्ये ठेवावेत.

cd ~/ComfyUI/models/checkpoints
wget https://huggingface.co/stabilityai/stable-diffusion-xl-base-1.0/resolve/main/sd_xl_base_1.0.safetensors

नेहमी .ckpt पेक्षा .safetensors ला प्राधान्य द्या. .ckpt फाइल ही एक पिकल्ड (pickled) Python ऑब्जेक्ट असते आणि ती लोड केल्यास ती तयार करणाऱ्या व्यक्तीचा कोड कार्यान्वित होतो. safetensors फॉरमॅटमध्ये फक्त टेन्सर्स असतात, त्यामुळे एखादी घातक फाइल काहीही रन करू शकत नाही.

स्टोरेजचा खर्च लोक विसरतात. एक SDXL बेस चेकपॉइंट 6.94 GB चा असतो. रिफायनरसाठी आणखी 6 GB लागतात. एक ControlNet मॉडेल 1.4 ते 2.5 GB, अपस्केलर 60 ते 350 MB आणि LoRA 20 ते 400 MB जागा घेते. जे लोक याचा वापर करतात, ते एका आठवड्यात दुसरे आणि तिसरे बेस मॉडेल डाउनलोड करतात. कार्यरत इन्स्टॉलेशनसाठी 100 GB डिस्कची तरतूद करा आणि आउटपुट डिरेक्टरीवरही लक्ष ठेवा: 1024x1024 PNG फाइल्स प्रत्येकी 1 ते 2 MB च्या असतात आणि बॅच प्रोसेस चालू असल्यास लहान डिस्क लवकर भरते. models/ आणि output/ अशा व्हॉल्यूमवर ठेवा जो तुम्ही वाढवू शकता आणि तुमच्या वर्कफ्लो JSON फाइल्सचा बॅकअप ऑब्जेक्ट स्टोरेजवर एनक्रिप्टेड इंक्रीमेंटल बॅकअप सारख्या पर्यायाने घ्या. वेट्स पुन्हा डाउनलोड करता येतात, पण तुम्ही ट्यून केलेले वर्कफ्लो पुन्हा मिळवता येत नाहीत.

ते चालवा आणि सुरक्षितपणे प्रवेश मिळवा

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI हे 8188 या पोर्टवर सेवा देते. जर तुम्ही फक्त CPU वापरत असाल, तर --cpu जोडा. हे CUDA डिव्हाइस नसल्यास येणारी त्रुटी टाळून, जबरदस्तीने CPU पाथ वापरण्यास भाग पाडते.

ते 0.0.0.0 वर नाही, तर 127.0.0.1 वर बाइंड करा. ComfyUI मध्ये कोणतीही लॉगिन स्क्रीन किंवा युजर अकाउंट्स नसतात. जो कोणी या पोर्टपर्यंत पोहोचू शकतो, तो जॉब्स क्यूमध्ये टाकू शकतो, तुम्ही तयार केलेल्या सर्व प्रतिमा पाहू शकतो आणि कस्टम नोड्स इन्स्टॉल करू शकतो. हे तुमच्या सर्व्हरवर आर्बिट्ररी कोड एक्झिक्युशन (arbitrary code execution) करण्यासारखे आहे. त्याऐवजी, तुमच्या लॅपटॉपवरून SSH टनेलद्वारे त्याला ॲक्सेस करा.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

त्यानंतर स्थानिक पातळीवर http://127.0.0.1:8188 उघडा. जर तुम्हाला खरोखरच मल्टी-युजर ॲक्सेसची गरज असेल, तर त्याच्या समोर ऑथेंटिकेशनसह एक रिव्हर्स प्रॉक्सी ठेवा आणि ॲपला localhost वरच बाइंड करून ठेवा. हेच तर्क कोणत्याही ऑथेंटिकेशन नसलेल्या सेल्फ-होस्टेड सर्व्हिसला लागू होते आणि VPS वरील Docker Compose डिप्लॉयमेंट्स मध्ये ही एक मानक पद्धत आहे.

systemd अंतर्गत सेवा सुरू ठेवणे

तुमचे SSH सत्र बंद झाल्यावर बंद पडणारी रेंडर रांग ही सेवा (service) नसते. /etc/systemd/system/comfyui.service लिहा.

[Unit]
Description=ComfyUI
After=network-online.target

[Service]
User=comfy
WorkingDirectory=/home/comfy/ComfyUI
ExecStart=/home/comfy/ComfyUI/venv/bin/python main.py --listen 127.0.0.1 --port 8188
Restart=on-failure
RestartSec=5

[Install]
WantedBy=multi-user.target
sudo systemctl daemon-reload
sudo systemctl enable --now comfyui
systemctl status comfyui

active (running) आणि To see the GUI go to: http://127.0.0.1:8188 अशी लॉग ओळ दिसणे म्हणजे सेवा सुरू आहे. लक्षात घ्या की ExecStart हे व्हर्च्युअल एन्व्हायरनमेंटमधील इंटरप्रिटरचे थेट नाव देते, कारण systemd तुमचे शेल प्रोफाईल चालवत नाही आणि activate कधीही घडत नाही.

बजेटनुसार व्यावहारिक शिफारस

जर तुम्हाला इमेज जनरेशन करून पाहायचे असेल आणि वेगापेक्षा खर्च महत्त्वाचा असेल, तर 16 GB RAM असलेला CPU VPS घ्या. त्यावर 512x512 रिझोल्यूशनवर SD 1.5 चालवा आणि प्रति इमेज एक ते दोन मिनिटांचा वेळ गृहीत धरा. हा एक प्रामाणिक सुरुवातीचा टप्पा आहे आणि GPU असलेल्या कोणत्याही पर्यायापेक्षा याचा खर्च खूपच कमी असतो. तुम्ही निर्णय घेईपर्यंत मॉडेल लायब्ररी आणि वर्कफ्लो होस्ट करण्यासाठी ही योग्य जागा आहे.

जर तुम्ही दररोज प्रॉम्प्ट्सवर काम करत असाल, तर GPU क्लाउडवरून तासाच्या भाड्याने किमान 12 GB VRAM असलेला GPU घ्या आणि काम संपल्यावर तो बंद करा. इमेज जनरेशन हे अधूनमधून करायचे काम आहे आणि महिन्याभराचे बिल आकारला जाणारा आयडल GPU हा अनावश्यक खर्च वाढवण्याचा सर्वात सामान्य मार्ग आहे. चेकपॉइंट्स स्वस्त ब्लॉक स्टोरेजवर ठेवा आणि ते माउंट करा.

जर तुम्ही इतरांना सेवा देत असाल किंवा LoRA अडॅप्टर्सना ट्रेन करत असाल, तर तुम्हाला 24 GB VRAM आणि स्वतःचे मशीन लागेल. अशा वेळी, तेच मशीन Ollama सह स्वतःचे LLM होस्ट करणे मध्ये वर्णन केल्याप्रमाणे स्थानिक लँग्वेज मॉडेल चालवण्यासाठी देखील वापरता येते.

तुम्ही कोणताही पर्याय निवडला तरी, कोणत्याही प्रकाशित आकडेवारीवर विश्वास ठेवण्यापूर्वी तुमच्या स्वतःच्या मशीनची क्षमता मोजा. एकाच प्रॉम्प्टला पाच वेळा रांगेत लावा आणि ComfyUI च्या कन्सोलमध्ये दिसणारा 'सेकंद-प्रति-इटरेशन' (seconds-per-iteration) आकडा तपासा. तो आकडा म्हणजे तुमची प्रत्यक्ष क्षमता आहे.

FAQ

मी GPU शिवाय Stable Diffusion चालवू शकतो का?

हो. ComfyUI हे python main.py --cpu सह चालते आणि कोणत्याही ग्राफिक्स कार्डशिवाय प्रत्यक्ष प्रतिमा तयार करते. 8 आधुनिक vCPUs वर, 512x512 रिझोल्यूशनवर Stable Diffusion 1.5 साठी प्रति प्रतिमा साधारणपणे 60 ते 150 सेकंद आणि 1024x1024 रिझोल्यूशनवर SDXL साठी दहा ते वीस मिनिटे लागतात. हे रात्रभर चालणाऱ्या बॅचेस आणि कमी-व्हॉल्यूम एंडपॉइंट्ससाठी योग्य आहे. हे प्रॉम्प्ट इटरेशनसाठी काम करत नाही आणि ट्रेनिंग पूर्णपणे अशक्य आहे.

SDXL साठी मला किती VRAM ची आवश्यकता आहे?

8 GB VRAM वर SDXL 1024x1024 रिझोल्यूशनवर आरामात चालते. त्यापेक्षा कमी असल्यास, ComfyUI आपोआप लेयर्स सिस्टम RAM वर ऑफलोड करते आणि सुमारे 1 GB VRAM पर्यंत काम करते, परंतु प्रत्येक ऑफलोड केलेल्या स्टेपसाठी वेळ जास्त लागतो. 12 GB VRAM मुळे तुम्ही चेकपॉईंटसोबत ControlNet वापरू शकता आणि 24 GB VRAM मध्ये बेस, रिफायनर आणि अपस्केलिंग एकाच वर्कफ्लोमध्ये करता येते; LoRA अडॅप्टर्सच्या ट्रेनिंगसाठी हे व्यावहारिक किमान प्रमाण आहे.

मॉडेल्ससाठी किती डिस्क स्पेस लागते?

केवळ SDXL बेस चेकपॉईंट 6.94 GB चा आहे आणि रिफायनरमुळे त्यात आणखी सुमारे 6 GB ची भर पडते. ControlNet मॉडेल्स प्रत्येकी 1.4 ते 2.5 GB, LoRA अडॅप्टर्स 20 ते 400 MB आणि अपस्केलर्स 350 MB पर्यंत असतात. काही बेस मॉडेल्ससह कार्यरत इंस्टॉलेशनसाठी 100 GB जागा राखून ठेवा आणि आउटपुट डिरेक्टरीवर स्वतंत्रपणे लक्ष ठेवा, कारण 1024x1024 PNG फाइल्स प्रत्येकी 1 ते 2 MB जागा घेतात.

ComfyUI सार्वजनिक इंटरनेटवर उघडणे सुरक्षित आहे का?

नाही. ComfyUI मध्ये कोणत्याही प्रकारचे प्रमाणीकरण (authentication) नाही आणि त्याची कस्टम-नोड सिस्टम इंटरफेसवरून Python कोड इन्स्टॉल करून चालवते, त्यामुळे उघडा पोर्ट म्हणजे तुमच्या सर्व्हरवर रिमोट कोड एक्झिक्युशन होय. याला 127.0.0.1 वर बाइंड करा, ssh -N -L 8188:127.0.0.1:8188 you@your-server वापरून SSH टनेलद्वारे प्रवेश करा आणि जर एकापेक्षा जास्त व्यक्तींना प्रवेश हवा असेल तर त्यासमोर एक प्रमाणीकरण करणारा रिव्हर्स प्रॉक्सी ठेवा.

माझा रेंडर कोणत्याही त्रुटी संदेशाशिवाय का बंद झाला?

प्रक्रिया dmesg मध्ये Killed सह अचानक बंद होणे आणि कोणताही Python ट्रेसबॅक न मिळणे, हे Linux च्या out-of-memory किलरमुळे घडते, ComfyUI मधील बगमुळे नाही. CPU-ओन्ली मशीनवर वेट्स (weights) सिस्टम RAM मध्ये राहतात, त्यामुळे SDXL साठी सुमारे 16 GB आणि SD 1.5 साठी सुमारे 8 GB RAM, तसेच वर्किंग स्पेसची आवश्यकता असते. RAM वाढवा, स्वॅप (swap) वाढवा किंवा लहान मॉडेल आणि कमी रिझोल्यूशन वापरा.

#stable-diffusion#comfyui#ai#images#self-hosting#gpu