Mahitaji Halisi ya Jenereta ya Picha ya AI ya Kujipangia
Jua maunzi halisi ya kuendesha Stable Diffusion mwenyewe: CPU VPS, mahitaji ya SDXL, amri za kusakinisha ComfyUI, na nafasi ya diski ya 6.94 GB.
Kile ambavyo jenereta ya picha ya AI inayojipangia mwenyewe inahitaji
Jenereta ya picha ya AI inayojipangia mwenyewe inahitaji programu moja ya wavuti pamoja na faili moja ya modeli. Programu hiyo ni ComfyUI, na inaendeshwa kwenye mashine yoyote ya Linux. Modeli ndiyo huamua mahitaji ya maunzi yako. Checkpoint ya kiwango cha SDXL ni faili moja yenye ukubwa wa 6.94 GB, na inahitaji kukaa kwenye kumbukumbu ya GPU. Jambo hilo moja huamua bajeti yote, kwa hiyo soma viwango vya maunzi hapa chini kabla ya kukodisha seva yoyote.
Muhtasari wa kweli ni huu: VPS yenye CPU pekee inaweza kusakinisha na kutoa huduma ya programu, na inaweza kuzalisha picha za 512x512 kwa kutumia modeli ya zamani ya Stable Diffusion 1.5 ndani ya dakika moja au mbili kwa kila picha. Mashine hiyo hiyo ikiendesha SDXL kwa 1024x1024, huchukua dakika kumi hadi ishirini kwa kila picha. Hiyo haimaanishi kuwa usanidi umeharibika. Ni suala la hesabu, na mwongozo huu unaeleza sababu yake.
Kwa nini ukubwa wa modeli huamua mashine
Uzalishaji wa picha hutumia mzunguko wa kuondoa kelele. Utoaji wa hatua 30 hupitisha modeli nzima kwenye picha mara 30, na kila hatua husoma kila uzito. SDXL katika usahihi wa nusu ina takribani GB 6.9 za uzito, kwa hiyo utoaji wa hatua 30 hupitisha takribani GB 200 kwenye kumbukumbu kabla hujaona picha.
GPU yenye GB 24 za kumbukumbu ya video (VRAM, yaani kumbukumbu iliyounganishwa karibu na chipu ya michoro) husoma kwa kasi ya mamia ya gigabaiti kwa sekunde, na huhifadhi GB zote 6.9 kwa wakati mmoja. VPS yenye CPU husoma RAM ya mfumo kwa kasi ya makumi ya gigabaiti kwa sekunde, na haina vifaa vya matrix kwa ajili ya convolution, kwa hiyo mzunguko huo huo huendesha kwa kasi iliyo polepole mara 10 hadi 100. Hii ni hoja ileile ya kipimo data cha kumbukumbu inayotawala modeli za maandishi, na inafaa kusomwa pamoja na wakati VPS yenye GPU inafaa kweli kwa gharama yake.
Uzalishaji wa picha hutofautiana na uzalishaji wa maandishi kwa njia moja muhimu. Modeli ya mazungumzo hutiririsha tokeni, kwa hiyo mashine polepole bado huonekana kutumika kwa sababu maneno huonekana unaposoma. Picha huonekana tu hatua ya mwisho inapokamilika. Polepole kunamaanisha kutazama upau wa maendeleo.
Ngazi ya maunzi, ikiwa na nambari halisi
Kisanduku kilicho hapa chini kina takwimu za kawaida za picha moja ya SDXL yenye ukubwa wa 1024x1024, hatua 30 na sampuli ya Euler, kufikia Julai 2026. Zichukulie kama makadirio ya ukubwa wa jumla. Sampuli, idadi ya hatua na mwonekano unaotumia vinaweza kuzibadilisha.
The data behind this chart
[
{
"label": "8 vCPU VPS, no GPU",
"seconds_per_image": 780
},
{
"label": "8GB VRAM GPU",
"seconds_per_image": 32
},
{
"label": "12GB VRAM GPU",
"seconds_per_image": 18
},
{
"label": "24GB VRAM GPU",
"seconds_per_image": 9
}
]Mstari wa CPU ni 780 sekunde, takriban dakika kumi na tatu. Kadi ya 24 GB ni 9 sekunde. Huo ndio utofauti unaolipia.
Soma ngazi hii kwa njia ifuatayo. Chini ya 8 GB za VRAM, SDXL bado hufanya kazi kwa sababu ComfyUI huhamishia tabaka kwenye RAM ya mfumo kiotomatiki na inaweza kutumia kadi yenye kiasi kidogo kama 1 GB. Kuhamisha tabaka hupunguza kasi katika kila hatua, kwa hiyo kadi ya 6 GB hutoa picha moja kwa muda unaokaribia dakika moja badala ya sekunde thelathini. Kwenye 8 GB, modeli msingi inatoshea na uonyeshaji hufanyika kwa urahisi. Kwenye 12 GB, unaweza kuweka ControlNet moja au mbili pamoja na checkpoint bila kuhamisha tabaka. Kwenye 24 GB, unaweza kuendesha SDXL pamoja na refiner na kuongeza mwonekano katika workflow moja, na unaweza kuanza kufunza adapta za LoRA, ambazo zinahitaji kumbukumbu nyingi zaidi kuliko uundaji wa picha.
VPS ya CPU inaweza na haiwezi kufanya nini
Inaweza kufanya zaidi ya watu wanavyotarajia, na chini ya kile ambacho matangazo yanadokeza. Eleza kwa usahihi mipaka hiyo.
VPS ya CPU inaweza kusakinisha ComfyUI, kutoa kiolesura cha wavuti, kuhifadhi maktaba yako ya modeli, kuendesha foleni, na kutengeneza picha bila GPU kabisa. Kwa Stable Diffusion 1.5 katika 512x512 na hatua 20, tarajia takriban sekunde 60 hadi 150 kwa kila picha kwenye vCPU 8 za kisasa zenye 16 GB ya RAM. Kwa kazi ya kundi inayotekelezwa usiku kucha, au endpoint ya picha yenye matumizi machache iliyo nyuma ya foleni, uwezo huo unatosha.
VPS ya CPU haiwezi kukupa kazi shirikishi. Kubadilisha prompt kunamaanisha kutengeneza picha 20 kwa saa moja, na kwa dakika 13 kwa kila picha utapata picha 4. Pia haiwezi kufundisha modeli. Fine-tuning ya LoRA kwenye CPU hupimwa kwa siku, si saa. Kwa hiyo, ichukulie kuwa haipatikani.
Kanuni ya kumbukumbu kwa matumizi ya CPU pekee ni tofauti na kanuni ya GPU. Weights hupakiwa kwenye RAM ya mfumo. Kwa hiyo, unahitaji ukubwa wa modeli pamoja na nafasi ya kufanya kazi: takriban 16 GB ya RAM kwa SDXL, na takriban 8 GB kwa SD 1.5. Mashine yenye 4 GB itaanzisha ComfyUI, kisha itasitishwa na out-of-memory killer katikati ya utengenezaji wa kwanza wa picha. Hali hii huonekana mchakato kutoweka pamoja na Killed katika dmesg, bila Python traceback.
Sakinisha ComfyUI kwenye mashine yenye GPU
Hizi ni amri za upstream. Anza na usakinishaji safi wa Ubuntu 24.04, huku kiendeshi cha NVIDIA kikiwa tayari kimesakinishwa. Thibitisha kiendeshi kwanza, kwa sababu bila ukaguzi huu kila hitilafu inayofuata huonekana sawa.
nvidia-smiHii lazima ichapishe jedwali lenye kadi yako na toleo la CUDA. command not found, au NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, humaanisha kuwa kiendeshi hakipo au moduli ya kernel haikupakiwa baada ya uboreshaji. Rekebisha hilo kabla ya kuendelea, kwa sababu ComfyUI itatumia CPU kimya kimya na utailaumu programu.
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txtMazingira pepe si ushauri wa hiari. PyTorch huvuta mti mkubwa wa vitegemezi, na kukisakinisha katika mfumo mzima kwenye mashine inayoendesha kitu kingine ndiyo njia ya kuvuruga programu hiyo nyingine. Thibitisha kuwa PyTorch inaweza kuona kadi kabla ya kuendelea.
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"True pamoja na jina la kadi yako humaanisha kuwa stack inafanya kazi. False humaanisha kuwa wheel uliyosakinisha haiendani na kiendeshi, kwa kawaida kwa sababu wheel ya torch ya CPU pekee ilikuwa tayari imehifadhiwa kwenye cache. Sakinisha tena ukitumia URL ya index iliyo hapo juu.
Pata modeli, na panga nafasi ya diski
ComfyUI haiji na uzani wa modeli. Checkpoint huwekwa katika models/checkpoints, faili za VAE katika models/vae, na adapta za LoRA katika models/loras.
cd ~/ComfyUI/models/checkpoints
wget https://huggingface.co/stabilityai/stable-diffusion-xl-base-1.0/resolve/main/sd_xl_base_1.0.safetensorsDaima pendelea .safetensors badala ya .ckpt. Faili ya .ckpt ni kitu cha Python kilichohifadhiwa kwa pickle, na kuipakia hutekeleza msimbo kutoka kwa aliyeitengeneza. Muundo wa safetensors huhifadhi tensor pekee, hivyo faili hasidi haiwezi kutekeleza chochote.
Nafasi ya hifadhi ni gharama ambayo watu husahau. Checkpoint moja ya msingi ya SDXL ni 6.94 GB. Refiner inaongeza 6 GB. Modeli moja ya ControlNet hutumia 1.4 hadi 2.5 GB, upscaler hutumia 60 hadi 350 MB, na LoRA hutumia 20 hadi 400 MB. Mtu yeyote anayefanya kazi hii kwa kawaida hupakua modeli ya pili na ya tatu ya msingi ndani ya wiki moja. Tenga 100 GB za nafasi ya diski kwa usakinishaji unaofanya kazi, na pia fuatilia saraka ya matokeo: faili za PNG za 1024x1024 zina ukubwa wa 1 hadi 2 MB kila moja, na kundi linaloendeshwa bila uangalizi hujaza diski ndogo bila kutambuliwa. Weka models/ na output/ kwenye volume unayoweza kuongeza ukubwa, na uhifadhi nakala rudufu za faili zako za workflow za JSON kwa kitu kama nakala rudufu za ziada zilizosimbwa kwa njia fiche kwenye hifadhi ya vitu. Uzani unaweza kupakuliwa tena. Workflow ulizorekebisha haziwezi.
Iendeshe, na uifikie kwa usalama
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188ComfyUI hutumia port 8188. Kwenye mashine yenye CPU pekee, ongeza --cpu. Hii hulazimisha kutumia njia ya CPU badala ya kushindwa kwa sababu kifaa cha CUDA hakijawekwa.
Funga huduma kwenye 127.0.0.1, wala si kwenye 0.0.0.0. ComfyUI haina skrini ya kuingia na haina akaunti za watumiaji. Kitu chochote kinachofikia port hiyo kinaweza kupanga kazi, kusoma kila picha uliyotengeneza, na kusakinisha custom nodes. Hilo linaweza kuruhusu utekelezaji wa msimbo wowote kwenye server yako. Badala yake, ifikie kupitia SSH tunnel kutoka kwenye laptop yako.
ssh -N -L 8188:127.0.0.1:8188 you@your-serverKisha fungua http://127.0.0.1:8188 kwenye kifaa chako cha ndani. Ikiwa unahitaji ufikiaji halisi wa watumiaji wengi, weka reverse proxy yenye uthibitishaji mbele yake na uendelee kufunga programu kwenye localhost. Hoja hiyo hiyo inatumika kwa huduma yoyote ya kujihudumia isiyo na uthibitishaji, na huo ndio mpangilio wa kawaida katika usambazaji wa Docker Compose kwenye VPS.
Iendelee kufanya kazi chini ya systemd
Foleni ya uwasilishaji inayokufa kipindi kikao chako cha SSH kinapofungwa si huduma. Andika /etc/systemd/system/comfyui.service.
[Unit]
Description=ComfyUI
After=network-online.target
[Service]
User=comfy
WorkingDirectory=/home/comfy/ComfyUI
ExecStart=/home/comfy/ComfyUI/venv/bin/python main.py --listen 127.0.0.1 --port 8188
Restart=on-failure
RestartSec=5
[Install]
WantedBy=multi-user.targetsudo systemctl daemon-reload
sudo systemctl enable --now comfyui
systemctl status comfyuiactive (running) na mstari wa kumbukumbu unaosomeka To see the GUI go to: http://127.0.0.1:8188 humaanisha kuwa inafanya kazi. Kumbuka kuwa ExecStart hutaja moja kwa moja kitafsiri kilicho ndani ya mazingira pepe, kwa sababu systemd haiendeshi wasifu wa shell yako na activate haitokei kamwe.
Pendekezo la kiutendaji kulingana na bajeti
Ikiwa unataka kujaribu utengenezaji wa picha na gharama ni muhimu zaidi kuliko kasi, tumia VPS ya CPU yenye 16 GB ya RAM, endesha SD 1.5 kwa 512x512, na ukubali kusubiri dakika moja au mbili kwa kila picha. Hii ndiyo sehemu halisi ya kuanzia, na inagharimu sehemu ndogo ya gharama ya mashine yoyote yenye GPU. Pia ni mahali pazuri pa kuhifadhi maktaba ya modeli na workflows wakati unaamua.
Ikiwa unabadilisha prompts kila siku, kodisha GPU yenye angalau 12 GB ya VRAM kwa saa kutoka kwa huduma ya GPU cloud, na izime unapoacha kuitumia. Utengenezaji wa picha hufanyika kwa vipindi vifupi vya kazi, na GPU isiyotumika inayotozwa kila mwezi ndiyo sababu ya kawaida ya watu kutumia zaidi ya bajeti hapa. Hifadhi checkpoints kwenye block storage ya bei nafuu na uzimount.
Ikiwa unawahudumia watu wengine, au unafunza LoRA adapters, unahitaji 24 GB ya VRAM na mashine utakayoendelea kuitumia. Katika hatua hiyo, mashine hiyo kwa kawaida hujilipia kwa kuendesha pia language model ya ndani, ambayo ndiyo usanidi ulioelezwa katika kujiendeshea LLM kwa Ollama.
Bila kujali kiwango unachochagua, pima mashine yako mwenyewe kabla ya kuamini takwimu yoyote iliyochapishwa. Weka prompt hiyo hiyo kwenye foleni mara tano na usome sekunde kwa kila iteration ambazo ComfyUI huonyesha kwenye console yake. Nambari hiyo ndiyo nafasi yako halisi kwenye viwango hivi.
FAQ
Je, ninaweza kuendesha Stable Diffusion bila GPU?
Ndiyo. ComfyUI huendesha kwa python main.py --cpu na hutengeneza picha halisi bila kadi ya michoro. Tarajia takribani sekunde 60 hadi 150 kwa kila picha ya Stable Diffusion 1.5 katika 512x512, na dakika kumi hadi ishirini kwa SDXL katika 1024x1024, kwa kutumia vCPU 8 za kisasa. Hii inafaa kwa makundi ya kazi ya usiku kucha na vituo vya mwisho vyenye mzigo mdogo. Haifai kwa kujaribu prompt mara kwa mara, na mafunzo hayawezekani kabisa.
Ninahitaji VRAM kiasi gani kwa SDXL?
8 GB huendesha SDXL vizuri katika 1024x1024. Chini ya hapo, ComfyUI huhamisha tabaka kwenye RAM ya mfumo kiotomatiki na bado hufanya kazi hadi takribani 1 GB ya VRAM, lakini kila hatua inayohamishwa huongeza muda. 12 GB hukuruhusu kuweka ControlNet pamoja na checkpoint, na 24 GB inatosha kwa base pamoja na refiner na upscaling katika workflow moja. Pia, 24 GB ndiyo kiwango cha chini kinachofaa kwa mafunzo ya LoRA adapters.
Modeli zinahitaji nafasi kiasi gani kwenye diski?
Checkpoint ya SDXL base pekee ina ukubwa wa 6.94 GB, na refiner huongeza takribani 6 GB zaidi. Modeli za ControlNet zina ukubwa wa 1.4 hadi 2.5 GB kila moja, LoRA adapters zina 20 hadi 400 MB, na upscalers zina hadi 350 MB. Tenga 100 GB kwa usakinishaji unaofanya kazi wenye modeli kadhaa za base. Fuatilia directory ya matokeo kando, kwa sababu faili za PNG za 1024x1024 huwa na ukubwa wa 1 hadi 2 MB kila moja.
Je, ni salama kuweka ComfyUI wazi kwenye intaneti ya umma?
Hapana. ComfyUI haina uthibitishaji wa aina yoyote, na mfumo wake wa custom-node husakinisha na kuendesha msimbo wa Python kutoka kwenye interface. Kwa hiyo, port iliyo wazi inaruhusu utekelezaji wa msimbo kwa mbali kwenye server yako. Ifunge kwenye 127.0.0.1, ifikie kupitia SSH tunnel kwa ssh -N -L 8188:127.0.0.1:8188 you@your-server, na uweke reverse proxy yenye uthibitishaji mbele yake ikiwa zaidi ya mtu mmoja anahitaji ufikiaji.
Kwa nini render yangu ilizimwa bila ujumbe wa hitilafu?
Mchakato kutoweka pamoja na Killed katika dmesg bila Python traceback ni Linux out-of-memory killer, wala si hitilafu ya ComfyUI. Kwenye mashine inayotumia CPU pekee, weights huhifadhiwa kwenye RAM ya mfumo. Kwa hiyo, SDXL inahitaji takribani 16 GB na SD 1.5 takribani 8 GB, pamoja na nafasi ya muda ya kufanya kazi. Ongeza RAM, ongeza swap, au tumia modeli ndogo na resolution ya chini.