Self-hosted AI-відео: що реально дають моделі
Перевірте, що Wan 2.2, HunyuanVideo і LTX-Video реально створюють у July 2026: 5 секунд у 720p, потрібний VRAM і вартість орендованого GPU.
Що насправді може self-hosted AI-генератор відео
Self-hosted AI-генератор відео вже придатний для роботи, але він повільніший і має менші можливості, ніж показують демонстраційні ролики. Станом на July 2026 моделі з відкритим кодом, які варто запускати, — Wan 2.2 від Alibaba і HunyuanVideo від Tencent, а також LTX-Video від Lightricks, якщо швидкість важливіша за реалістичність. Усі вони працюють у ComfyUI на Linux-машині з NVIDIA GPU. На виході ви отримуєте кліп тривалістю приблизно п’ять секунд у 720p. Не сцену. Не хвилину готового відео.
Ось коротка відповідь перед подробицями. Відеокарта з 24 GB рендерить кліп тривалістю п’ять секунд у 720p за кілька хвилин. Відеокарті з 12 GB для цього потрібно двадцять хвилин або більше, тому що ваги моделі не вміщуються у відеопам’ять, і програмне забезпечення постійно переміщує шари між нею та системною RAM. Сервер без GPU не може виконувати це в практично придатний спосіб. Обчислення, через які генерація зображень на CPU є повільною, роблять генерацію відео на CPU безглуздою.
Якщо ви вже читали про градації апаратного забезпечення для self-hosted генератора зображень, то відео — це той самий принцип, але кожне число потрібно змістити на один клас вище. VRAM (відеопам’ять, RAM, розпаяна поруч із графічним чипом) і далі є єдиною характеристикою, яка визначає, чи буде робота комфортною, чи проблемною.
Чому одне відео коштує набагато дорожче за одне зображення
Ди diffusion-модель генерує зображення, поступово прибираючи шум на кожному кроці. На кожному кроці вона зчитує всі ваги моделі. Відеомодель робить те саме одночасно для цілого блоку кадрів. Вона також застосовує attention між кадрами в часі, щоб кадр 80 «знав», який вигляд мав кадр 12. П’ять секунд із частотою 24 кадри на секунду — це 120 кадрів в одному batch.
Саме temporal attention не дає витратам пам’яті передбачувано масштабуватися з тривалістю кліпу. Подвоєння кількості кадрів збільшує обсяг пам’яті, потрібний sampler, більш ніж удвічі. Тому проблема проявляється не в повільнішому рендерингу. Рендеринг завершується помилкою.
Є ще один стрибок споживання пам’яті, якого часто не очікують. Після завершення роботи sampler VAE (variational autoencoder, компонент, який перетворює стиснене latent-представлення на звичайні пікселі) декодує все відео з latent-представлення одночасно. Для цього декодування може знадобитися більше пам’яті, ніж для sampling. Ознака проблеми — job показує завершений progress bar, а потім виводить:
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiBРішення — tiled decoding або коротший кліп. Якщо визначити, на якому етапі завершилася доступна пам’ять, можна не витрачати годину на налаштування неправильного параметра.
Скільки VRAM потрібно для генерації відео за допомогою AI
Два опубліковані показники визначають усе рішення, але на перший погляд суперечать один одному. Alibaba зазначає, що модель Wan 2.2 TI2V-5B створює кліпи у форматі 720p зі швидкістю 24 кадри на секунду та тривалістю п’ять секунд менш ніж за дев’ять хвилин на одній споживчій GPU, наприклад 4090, і рекомендує щонайменше 24 GB VRAM. У документації ComfyUI зазначено, що та сама модель 5B «має без проблем працювати на 8GB vram із native offloading у ComfyUI».
Обидва твердження правильні, оскільки вони описують різні умови. На 8 GB модель поміщається в пам’ять. На 24 GB вона працює без значних обмежень. Offloading зберігає більшу частину моделі в системній RAM і передає її шари в GPU на кожному кроці, тому GPU витрачає час на очікування шини PCIe замість обчислень. Ця затримка виникає на кожному кроці sampler, а не лише один раз.
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]Лише останній рядок містить показник від виробника. Відеокарта з 24 GB створює один кліп за 9 хвилин. Це опублікований Alibaba показник для цієї моделі. Інші рядки показують вплив offloading і мають порядок величини, а не статус результатів бенчмарку. Важлива саме форма залежності: 40 хвилин на відеокарті з 8 GB — це технічно працездатна конфігурація, але практично пакетне завдання, яке доведеться залишити виконуватися на ніч.
Більші моделі Wan 2.2 працюють за зовсім іншими вимогами. Варіант A14B для text-to-video та image-to-video потребує щонайменше 80 GB VRAM для inference на одній GPU. Це обладнання для дата-центрів, а не відеокарта для робочого комп’ютера. На цьому рівні self-hosting фактично означає погодинну оренду чужого accelerator. У задачах, пов’язаних із текстом, той самий розрахунок масштабується набагато далі: self-hosting моделі Kimi K3 із 2.8 трильйона параметрів перестає бути питанням про одну відеокарту й стає питанням про те, скільки відеокарт із 80 GB ви можете дозволити собі об’єднати.
Скільки коштує кліп на орендованому GPU
Оренда — найкращий спосіб протестувати це для більшості користувачів, оскільки придбана відеокарта може виявитися непридатною, якщо потрібній вам моделі знадобиться 80 GB. Медіанні ціни GPU на ринку оренди за запитом станом на July 2026:
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]Рядок 4090 запускає модель 5B і коштує приблизно 0.05 доларів за кліп за ціни 0.36 доларів за годину. GPU з 80 GB запускають моделі 14B, тому вартість одного кліпу зростає до 0.6 доларів, хоча саме обладнання значно швидше. Що більша модель, то більше обчислень потрібно на кожну секунду відео.
П’ять центів за кліп звучить як незначна сума, але саме це вводить в оману. Перші придатні для використання п’ять секунд ніколи не отримують за один рендер. Створення відео за допомогою моделі — це пошук, і для кадру з конкретним рухом нормально виконати від двадцяти до сорока рендерів, перш ніж отримати вдалий результат. Тому робоча сесія коштує вже долари, а не центи, і кілька годин ітерацій на орендованому обладнанні обходяться приблизно як обід.
Якщо не врахувати два нюанси оренди, вони можуть суттєво збільшити витрати. Оплата нараховується, поки машина завантажує ваги, а файли Wan 2.2 разом із text encoder і VAE займають десятки GB. Тому обирайте провайдера зі persistent volume і завантажте файли один раз. Оплата також нараховується, коли машина простоює з відкритою SSH-сесією. Зупиняйте інстанс, а не лише закривайте термінал.
Встановлення ComfyUI на GPU-сервері
Почніть з Ubuntu 24.04, де драйвер NVIDIA уже встановлено. Спочатку перевірте драйвер, оскільки без цієї перевірки всі подальші помилки виглядають однаково.
nvidia-smiКоманда має вивести таблицю з вашою відеокартою та версією CUDA. Якщо вона виводить NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, модуль ядра не завантажено. Зазвичай це трапляється після оновлення ядра без перезавантаження. Виправте проблему на цьому етапі. Інакше ComfyUI перейде на використання CPU, і ви витратите годину на пошук проблеми в моделі.
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txtПереконайтеся, що PyTorch бачить відеокарту, перш ніж завантажувати хоча б один файл ваг.
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"True разом із назвою вашої відеокарти означає, що стек працює правильно. False означає, що встановлено wheel лише для CPU. Це трапляється, коли pip знаходить у кеші torch із попереднього встановлення. Перевстановіть пакет, використавши наведений вище URL індексу.
Завантажте файли моделі Wan 2.2
ComfyUI не постачається з вагами, а відеомодель складається не з одного файлу. Це diffusion model, text encoder і VAE, кожен із яких потрібно розмістити у власному каталозі. Якщо помістити файл не в ту папку, loader node просто не покаже його у списку й не пояснить причину помилкою.
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensorsМодель 5B підтримує і text-to-video, і image-to-video, тому це оптимальний варіант для початку. Завжди надавайте перевагу .safetensors над .ckpt. Файл .ckpt є серіалізованим об’єктом Python, тому його завантаження запускає код, написаний автором цього файлу. Передбачте достатньо місця на диску: робоча інсталяція з одним сімейством моделей і результатами роботи потребує 100 GB, а відеофайли значно більші за PNG-зображення, які залишає image workflow. Створюйте резервні копії JSON-файлів workflow, наприклад за допомогою зашифрованого інкрементного резервного копіювання в object storage, оскільки ваги можна завантажити повторно, а налаштовані workflow — ні.
Запустіть його та отримуйте доступ безпечно
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188У ComfyUI немає екрана входу та облікових записів користувачів. Будь-хто, хто має доступ до порту 8188, може поставити завдання в чергу, прочитати всі створені вами кліпи та встановити custom nodes, що дає змогу виконати довільний код на сервері. Прив’яжіть його до localhost і підключайтеся через SSH-тунель зі свого комп’ютера.
ssh -N -L 8188:127.0.0.1:8188 you@your-serverПотім відкрийте http://127.0.0.1:8188 у браузері. Завантажте шаблонний workflow Wan 2.2 через меню шаблонів ComfyUI, а не з’єднуйте nodes вручну. В офіційних шаблонах містяться параметри sampler, під які оптимізовано модель. У video workflow значно більше місць, де можна непомітно вказати неправильне значення, ніж в image workflow.
Коли чесно варто використовувати API
Self-hosting генерації відео — правильний вибір, якщо обсяг високий і стабільний, якщо кадри не повинні залишати вашу інфраструктуру або якщо вам потрібна конкретна модель чи custom adapter, якого не пропонує жоден hosted service. Це також правильний вибір, якщо pipeline має працювати так само й через рік, оскільки hosted model може змінитися без можливості зафіксувати версію.
Використовуйте hosted API, якщо вам потрібно кілька кліпів на місяць, якщо потрібен результат більшої тривалості або роздільної здатності, ніж генерують open models, або якщо дедлайн — цього тижня. Чесно розрахуйте точку беззбитковості. Відеокарта на 24 GB, орендована цілодобово за медіанною ціною в July 2026, коштує приблизно 260 доларів на місяць, а купівля такої самої відеокарти коштує дорожче ще до генерації першого кадру. Неактивний self-hosted сервер щоразу програє тарифікації API за кліп. Це та сама дилема, від якої залежить спосіб обслуговування text models, описаний у Ollama проти vLLM для self-hosted LLM serving, і вона доповнює базовіше питання з чи вартий VPS із GPU своїх грошей взагалі.
Що перевірити, якщо рендеринг завершується помилкою
Якщо рендеринг завершується помилкою наприкінці, після завершення індикатора семплера, у VAE decode закінчилася пам’ять. Зменште кількість кадрів або перейдіть на node для tiled decode. Зміна кількості кроків не допоможе, оскільки decode виконується один раз після завершення всіх кроків.
Повністю чорний або сильно спотворений результат зазвичай означає, що VAE не відповідає моделі. Wan 2.1 VAE, завантажений для Wan 2.2 diffusion model, дає саме такий результат, і в журналі помилка не з’являється.
Якщо рендеринг виконується, але триває годинами на машині, яка точно має GPU, це означає, що ComfyUI працює через CPU path. Перевірте рядок із пристроєм у startup log, а потім повторно виконайте перевірку torch.cuda.is_available() вище.
Якщо процес зникає разом із Killed у dmesg без traceback Python, це kernel out-of-memory killer. Отже, закінчилася системна RAM, а не VRAM. Для offloading уся модель має бути розміщена в системній RAM. Тому на машині з 16 GB RAM для offloading моделі 5B пам’яті недостатньо. Додайте RAM або налаштуйте swap.
FAQ
Чи можна генерувати відео за допомогою AI на VPS без GPU?
Ні, не в практичний спосіб для регулярного використання. Кліп тривалістю п’ять секунд у роздільності 720p, який генерується за дев’ять хвилин на GPU з 24 GB пам’яті, на CPU потребуватиме багато годин. Причина в тому, що модель не має матричного апаратного забезпечення для виконання обчислень, а пропускна здатність системної RAM на порядок нижча за пропускну здатність пам’яті GPU. CPU-сервер може розміщувати інтерфейс ComfyUI, зберігати моделі та workflow, але для самого рендерингу потрібен GPU.
Скільки VRAM потрібно для Wan 2.2?
Для моделі TI2V-5B мінімальним обсягом є 8 GB за використання native offloading у ComfyUI, а для заявленої швидкості Alibaba рекомендує 24 GB. Для моделей A14B text-to-video та image-to-video в описі моделі вказано щонайменше 80 GB VRAM для inference на одному GPU. Тому для них потрібні карти для дата-центрів.
Якої тривалості може бути self-hosted кліп?
Станом на July 2026 практичною одиницею є приблизно п’ять секунд у роздільності 720p. Довший результат отримують генерацією сегментів і їхнім об’єднанням. Для цього останній кадр одного сегмента використовують як перший кадр наступного. На стиках якість поступово змінюється, тому довге відео слід розглядати як завдання монтажу, а не як одну генерацію.
Чи дешевше орендувати GPU погодинно, ніж купити карту?
Оренда вигідніша, якщо рендеринг триває менше кількох годин на день. За медіанною ціною станом на July 2026 — приблизно 0.36 долара на годину за карту з 24 GB — можна довго орендувати GPU, перш ніж витрати зрівняються з ціною такої карти. Крім того, не доведеться купувати обладнання, яке виявиться непридатним для потрібного класу моделі. Купівля вигідна лише тоді, коли сервер завантажений більшу частину дня, щодня.