SSD Nodes Learn 8GB RAM — $66/рік
Посібники Matt ConnorВід Matt Connor · Оновлено 2026-08-01

Яке залізо потрібне для власного AI-генератора зображень

Чесна градація для Stable Diffusion: що може CPU VPS, скільки триває SDXL, як встановити ComfyUI і скільки диска закласти під модель 6.94 GB.

Що насправді потрібно для власного генератора зображень на основі AI

Власний генератор зображень на основі AI — це один вебзастосунок і один файл моделі. Застосунок — це ComfyUI, і він працює на будь-якому Linux-сервері. Модель визначає вимоги до обладнання. Контрольна точка класу SDXL — це один файл розміром 6.94 GB, який має зберігатися в пам’яті GPU. Саме цей факт визначає весь бюджет, тому ознайомтеся з наведеною нижче градацією обладнання, перш ніж щось орендувати.

Коротко: VPS лише з CPU може встановити програмне забезпечення й обслуговувати запити. Він може генерувати зображення розміром 512x512 за допомогою старішої моделі Stable Diffusion 1.5 приблизно за одну-дві хвилини на зображення. На тому самому сервері генерація зображення SDXL розміром 1024x1024 триватиме від десяти до двадцяти хвилин. Це не означає, що налаштування несправне. Це наслідок обчислень, і в цьому посібнику пояснено причину.

Чому розмір моделі визначає вимоги до машини

Генерація зображень виконується в циклі денойзингу. Під час рендерингу на 30 кроків повна модель проходить через зображення 30 разів, і на кожному кроці зчитуються всі ваги. SDXL у режимі половинної точності займає приблизно 6.9 GB для ваг, тому до появи зображення під час рендерингу на 30 кроків через пам’ять проходить приблизно 200 GB даних.

GPU із 24 GB відеопам’яті (VRAM — пам’яті, розміщеної поруч із графічним чипом) зчитує дані зі швидкістю сотні гігабайтів на секунду й одночасно вміщує всі 6.9 GB. CPU VPS зчитує дані із системної RAM зі швидкістю десятки гігабайтів на секунду та не має спеціалізованого матричного обладнання для згорток, тому той самий цикл виконується на один-два порядки повільніше. Це той самий аргумент щодо пропускної здатності пам’яті, який визначає продуктивність текстових моделей. Його варто розглянути разом із матеріалом коли VPS із GPU справді виправдовує витрати.

Генерація зображень має одну важливу відмінність від генерації тексту. Чат-модель передає токени потоком, тому навіть повільна машина залишається придатною для роботи: слова з’являються під час читання. Зображення з’являється лише після завершення останнього кроку. Повільна робота означає, що вам доводиться дивитися на індикатор виконання.

Апаратна шкала з реальними числами

Нижче наведено типові показники для одного зображення SDXL із роздільною здатністю 1024x1024, 30 кроками та семплером Euler станом на July 2026. Вважайте їх порядком величини. Семплер, кількість кроків і роздільна здатність впливають на ці значення.

ChartOne SDXL image, 1024x1024, 30 steps (typical, July 2026)
The data behind this chart
[
  {
    "label": "8 vCPU VPS, no GPU",
    "seconds_per_image": 780
  },
  {
    "label": "8GB VRAM GPU",
    "seconds_per_image": 32
  },
  {
    "label": "12GB VRAM GPU",
    "seconds_per_image": 18
  },
  {
    "label": "24GB VRAM GPU",
    "seconds_per_image": 9
  }
]

Для CPU значення становить 780 секунд, тобто приблизно тринадцять хвилин. Для карти з 24 GB це 9 секунд. Саме за цей розрив ви платите під час вибору обладнання.

Інтерпретуйте шкалу так. Якщо VRAM менше 8 GB, SDXL усе одно працює, оскільки ComfyUI автоматично вивантажує шари до системної RAM і може працювати навіть із картою, що має лише 1 GB. Вивантаження збільшує час на кожному кроці, тому карта на 6 GB забезпечує час обробки ближче до однієї хвилини на зображення, а не до тридцяти секунд. За наявності 8 GB базова модель вміщується в пам’яті, і рендеринг працює стабільно. За наявності 12 GB можна одночасно завантажити ControlNet або два екземпляри разом із checkpoint без вивантаження. За наявності 24 GB можна запускати SDXL, refiner і upscaling в одному робочому процесі, а також почати навчання LoRA-адаптерів, для якого потрібно значно більше пам’яті, ніж для генерації.

Що може і чого не може CPU VPS

Він може більше, ніж очікують, але менше, ніж випливає з рекламних матеріалів. Чітко визначте межі.

На CPU VPS можна встановити ComfyUI, обслуговувати вебінтерфейс, зберігати бібліотеку моделей, запускати чергу та генерувати зображення взагалі без GPU. Для Stable Diffusion 1.5 у роздільності 512x512 і з 20 кроками на 8 сучасних vCPU та 16 GB RAM одне зображення генерується приблизно за 60–150 секунд. Для пакетного завдання, яке виконується протягом ночі, або для кінцевої точки з низьким навантаженням, що працює через чергу, цього достатньо.

CPU VPS не підходить для інтерактивної роботи. Ітеративне уточнення запиту означає двадцять рендерів за годину, а за тринадцять хвилин на кожен вийде лише чотири. Він також не підходить для навчання. LoRA fine-tuning на CPU займає дні, а не години, тому вважайте таку можливість недоступною.

Для роботи лише на CPU діє інше правило щодо пам’яті, ніж для GPU. Ваги моделей завантажуються в системну RAM, тому потрібен обсяг для моделі та робочий простір: приблизно 16 GB RAM для SDXL і приблизно 8 GB для SD 1.5. На сервері з 4 GB ComfyUI запуститься, але потім процес буде завершено out-of-memory killer під час першого рендеру. Це проявляється як зникнення процесу з Killed у dmesg без traceback від Python.

Встановлення ComfyUI на машині з GPU

Це команди з upstream. Почніть із чистого встановлення Ubuntu 24.04, де драйвер NVIDIA вже встановлено. Спочатку перевірте драйвер, оскільки без цієї перевірки всі подальші помилки виглядають однаково.

nvidia-smi

Команда має вивести таблицю з вашою відеокартою та версією CUDA. command not found або NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver означає, що драйвер відсутній або модуль ядра не завантажився після оновлення. Виправте це перед продовженням, оскільки ComfyUI непомітно перейде на CPU, а ви помилково звинуватите програмне забезпечення.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

Віртуальне середовище не є необов’язковою рекомендацією. PyTorch встановлює велике дерево залежностей, а його загальносистемне встановлення на сервері, де працюють інші компоненти, може порушити їхню роботу. Перед продовженням перевірте, чи бачить PyTorch відеокарту.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True разом із назвою вашої відеокарти означає, що стек працює. False означає, що встановлений wheel несумісний із драйвером. Зазвичай це трапляється, коли в кеші вже є CPU-only wheel для torch. Перевстановіть його з URL індексу вище.

Отримайте модель і сплануйте дисковий простір

ComfyUI не містить ваг моделей. Файли checkpoint зберігайте в models/checkpoints, файли VAE — у models/vae, а адаптери LoRA — у models/loras.

cd ~/ComfyUI/models/checkpoints
wget https://huggingface.co/stabilityai/stable-diffusion-xl-base-1.0/resolve/main/sd_xl_base_1.0.safetensors

Завжди надавайте перевагу .safetensors, а не .ckpt. Файл .ckpt є серіалізованим об’єктом Python, і його завантаження виконує код, створений автором цього файлу. Формат safetensors містить лише тензори, тому шкідливий файл не може виконати код.

Обсяг сховища часто не враховують. Один базовий checkpoint SDXL займає 6.94 GB. Refiner займає ще 6 GB. Одна модель ControlNet займає від 1.4 до 2.5 GB, апскейлер — від 60 до 350 MB, а LoRA — від 20 до 400 MB. За тиждень активного використання зазвичай завантажують другу й третю базові моделі. Виділіть 100 GB дискового простору для робочої інсталяції. Також контролюйте каталог outputs: PNG-файли розміром 1024x1024 займають від 1 до 2 MB кожен, а пакетна обробка без нагляду непомітно заповнює невеликий диск. Розмістіть models/ і output/ на томі, обсяг якого можна збільшити. Створюйте резервні копії JSON-файлів робочих процесів за допомогою, наприклад, шифрованого інкрементного резервного копіювання в об’єктне сховище. Ваги моделей можна завантажити повторно. Налаштовані робочі процеси — ні.

Запустіть і забезпечте безпечний доступ

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI працює на порту 8188. На сервері лише з CPU додайте --cpu. Цей параметр примусово вмикає режим CPU та запобігає помилці через відсутній пристрій CUDA.

Прив’яжіть сервіс до 127.0.0.1, а не до 0.0.0.0. У ComfyUI немає екрана входу та облікових записів користувачів. Будь-хто, хто має доступ до порту, може додавати завдання в чергу, читати всі створені вами зображення та встановлювати custom nodes. Це дає змогу виконувати довільний код на сервері. Натомість підключайтеся через SSH-тунель зі свого ноутбука.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

Потім відкрийте http://127.0.0.1:8188 локально. Якщо потрібен повноцінний доступ для кількох користувачів, розмістіть перед ним reverse proxy з автентифікацією та залиште застосунок прив’язаним до localhost. Такий самий підхід застосовується до будь-якого self-hosted сервісу без автентифікації. Це стандартний шаблон для розгортань Docker Compose на VPS.

Запустіть це під керуванням systemd

Черга рендерингу, яка завершує роботу після закриття сеансу SSH, не є службою. Створіть /etc/systemd/system/comfyui.service.

[Unit]
Description=ComfyUI
After=network-online.target

[Service]
User=comfy
WorkingDirectory=/home/comfy/ComfyUI
ExecStart=/home/comfy/ComfyUI/venv/bin/python main.py --listen 127.0.0.1 --port 8188
Restart=on-failure
RestartSec=5

[Install]
WantedBy=multi-user.target
sudo systemctl daemon-reload
sudo systemctl enable --now comfyui
systemctl status comfyui

active (running) і рядок журналу To see the GUI go to: http://127.0.0.1:8188 означають, що службу запущено. Зверніть увагу: ExecStart безпосередньо вказує інтерпретатор у віртуальному середовищі, оскільки systemd не завантажує профіль оболонки, а activate ніколи не виконується.

Практичні рекомендації залежно від бюджету

Якщо ви хочете спробувати генерацію зображень і вартість для вас важливіша за швидкість, виберіть CPU VPS з 16 GB RAM, запускайте SD 1.5 у роздільній здатності 512x512 і прийміть, що генерація одного зображення триватиме хвилину або дві. Це реалістична точка входу. Такий варіант коштує лише частину ціни будь-якої конфігурації з GPU. Тут також зручно розмістити бібліотеку моделей і робочі процеси, поки ви визначаєтеся з конфігурацією.

Якщо ви щодня ітеративно налаштовуєте промпти, погодинно орендуйте в GPU cloud GPU щонайменше з 12 GB VRAM і вимикайте його після завершення роботи. Генерація зображень має нерегулярне навантаження. Найчастіше перевитрати виникають через GPU, який оплачується щомісяця, але простоює. Зберігайте checkpoint-файли в недорогому block storage і монтуйте його.

Якщо ви обслуговуєте інших користувачів або навчаєте LoRA-адаптери, вам потрібно 24 GB VRAM і машина, яку ви не вимикаєте. На цьому етапі та сама машина зазвичай виправдовує витрати, якщо додатково запускати на ній локальну мовну модель. Саме таку конфігурацію описано в розділі самостійне розгортання LLM за допомогою Ollama.

Незалежно від вибраного рівня, виміряйте продуктивність власної машини, перш ніж покладатися на опубліковані показники. Поставте в чергу один і той самий промпт 5 разів і перегляньте показник секунд на ітерацію, який ComfyUI виводить у консолі. Це ваш фактичний рівень продуктивності.

FAQ

Чи можна запускати Stable Diffusion без GPU?

Так. ComfyUI працює з python main.py --cpu і створює справжні зображення без відеокарти. Для Stable Diffusion 1.5 у роздільній здатності 512x512 на 8 сучасних vCPU одне зображення створюється приблизно за 60–150 секунд. Для SDXL у роздільній здатності 1024x1024 це займає від 10 до 20 хвилин. Така конфігурація підходить для пакетної обробки вночі та кінцевих точок із невеликим навантаженням. Вона не підходить для ітеративного добору промптів, а навчання моделей практично неможливе.

Скільки VRAM потрібно для SDXL?

8 GB достатньо для комфортної роботи SDXL у роздільній здатності 1024x1024. Якщо VRAM менше, ComfyUI автоматично вивантажує шари до системної RAM і продовжує працювати навіть приблизно з 1 GB VRAM. Однак кожен крок із вивантаженням збільшує час обробки. 12 GB дають змогу одночасно завантажити ControlNet і checkpoint. 24 GB достатньо для базової моделі, refiner та upscaling в одному workflow, а також це практичний мінімум для навчання адаптерів LoRA.

Скільки дискового простору потрібно для моделей?

Лише базовий checkpoint SDXL займає 6.94 GB, а refiner додає ще приблизно 6 GB. Моделі ControlNet займають від 1.4 до 2.5 GB кожна, адаптери LoRA — від 20 до 400 MB, а моделі upscaling — до 350 MB. Виділіть 100 GB для робочої інсталяції з кількома базовими моделями. Окремо контролюйте каталог виводу, оскільки PNG-файли розміром 1024x1024 займають від 1 до 2 MB кожен.

Чи безпечно відкривати ComfyUI у публічному інтернеті?

Ні. ComfyUI не має жодної автентифікації, а його система custom-node встановлює та запускає Python-код через інтерфейс. Тому відкритий порт дає змогу віддалено виконувати код на сервері. Прив’яжіть його до 127.0.0.1, підключайтеся через SSH-тунель із ssh -N -L 8188:127.0.0.1:8188 you@your-server і налаштуйте reverse proxy з автентифікацією, якщо доступ потрібен більш ніж одному користувачу.

Чому мій render завершився без повідомлення про помилку?

Якщо процес зникає з Killed у dmesg і без traceback Python, це означає, що спрацював механізм Linux для завершення процесів через нестачу пам’яті, а не сталася помилка ComfyUI. На сервері лише з CPU ваги моделей зберігаються в системній RAM. Тому для SDXL потрібно приблизно 16 GB, а для SD 1.5 — приблизно 8 GB, додатково до робочого простору. Додайте RAM або swap чи використовуйте меншу модель і нижчу роздільну здатність.

#stable-diffusion#comfyui#ai#images#self-hosting#gpu