SSD Nodes Learn 8GB RAM — $66/рік
Посібники Matt ConnorВід Matt Connor · Оновлено 2026-08-01

Власний AI-генератор відео: реальні можливості

Дізнайтеся, що створюють Wan 2.2, HunyuanVideo і LTX-Video у July 2026, скільки VRAM потрібно, скільки коштує кліп на GPU та коли обрати API.

Що насправді може робити власний AI-генератор відео

Власний AI-генератор відео вже можна використовувати, але він повільніший і має менші можливості, ніж показують демонстраційні ролики. Станом на July 2026 серед відкритих моделей, які варто запускати, є Wan 2.2 від Alibaba і HunyuanVideo від Tencent, а також LTX-Video від Lightricks, якщо швидкість важливіша за реалістичність. Усі вони працюють у ComfyUI на машині з Linux і GPU NVIDIA. На виході ви отримуєте кліп тривалістю приблизно п’ять секунд у роздільній здатності 720p. Не сцену. Не хвилину готового відео.

Ось коротка відповідь перед деталями. Карта на 24 GB рендерить кліп тривалістю п’ять секунд у 720p за кілька хвилин. Карта на 12 GB виконує те саме завдання за двадцять хвилин або більше, оскільки ваги не вміщуються у відеопам’яті, і програмне забезпечення постійно переміщує шари між нею та системною RAM. Сервер без GPU не може виконувати це у практично придатний спосіб. Обчислення, через які генерація зображень на CPU була повільною, роблять генерацію відео на CPU беззмістовною.

Якщо ви вже прочитали порівняння апаратних вимог для власного AI-генератора зображень, то відео — це той самий підхід, але всі числові показники зміщені на один клас вище. VRAM (відеопам’ять, RAM, припаяна поруч із графічним чипом) і далі є єдиною характеристикою, яка визначає, чи буде робота комфортною, чи проблемною.

Чому одне відео коштує набагато дорожче за одне зображення

Diffusion model генерує зображення, поетапно усуваючи шум, і на кожному етапі зчитує всі ваги моделі. Video model робить те саме одночасно для цілого блоку кадрів і додає увагу між кадрами в часі, щоб кадр 80 враховував вигляд кадру 12. П’ять секунд із частотою 24 кадри на секунду — це 120 кадрів в одному пакеті.

Саме тому витрати не зростають пропорційно тривалості кліпу. Подвоєння кількості кадрів збільшує обсяг пам’яті, потрібний sampler, більш ніж удвічі. Тому проблема проявляється не в повільнішому рендерингу. Рендеринг завершується аварійно.

Є ще один стрибок використання пам’яті, якого часто не очікують. Після завершення роботи sampler VAE (variational autoencoder, компонент, який перетворює стиснений latent на реальні пікселі) одночасно декодує все latent-відео. Для цього декодування може знадобитися більше пам’яті, ніж для sampling. Ознака проблеми — завдання показує завершену шкалу прогресу, а потім виводить:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

Використайте tiled decoding або скоротіть кліп. Якщо визначити, на якому етапі закінчилася пам’ять, можна не витрачати годину на налаштування не того параметра.

Скільки VRAM потрібно для генерації відео за допомогою AI

Два опубліковані показники визначають усе рішення, але на перший погляд суперечать один одному. Alibaba зазначає, що модель Wan 2.2 TI2V-5B створює кліпи у форматі 720p зі швидкістю 24 кадри на секунду та тривалістю п’ять секунд менш ніж за дев’ять хвилин на одній споживчій GPU, наприклад 4090, і рекомендує щонайменше 24 GB VRAM. У документації ComfyUI зазначено, що та сама модель 5B «має без проблем працювати на 8GB vram із native offloading у ComfyUI».

Обидва твердження правильні, оскільки вимірюють різні параметри. 8 GB — це мінімальний обсяг, за якого модель запускається. 24 GB — це обсяг, за якого вона працює без значних обмежень. Offloading зберігає більшу частину моделі в системній RAM і передає шари до GPU на кожному кроці, тому відеокарта витрачає час на очікування шини PCIe, а не на обчислення. Ці витрати виникають на кожному кроці sampler, а не лише один раз.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

Лише останній рядок містить показник від постачальника. На карті з 24 GB один кліп створюється за 9 хвилин. Це опублікований Alibaba показник для цієї моделі. Інші рядки показують вплив offloading і мають порядок величини, а не статус результатів benchmark. Важливе саме співвідношення: 40 хвилин на карті з 8 GB — це технічно робоча конфігурація, але практично batch job, який доведеться залишити виконуватися на ніч.

Більші моделі Wan 2.2 працюють за іншими вимогами. Варіанти A14B для text-to-video та image-to-video потребують щонайменше 80 GB VRAM для inference на одній GPU. Це обладнання для дата-центрів, а не відеокарта для робочої станції. На цьому рівні self-hosted фактично означає погодинну оренду чужого accelerator.

Вартість кліпу на орендованому GPU

Оренда — найкращий варіант для тестування для більшості користувачів, оскільки придбана відеокарта може виявитися непридатною, якщо потрібній моделі знадобиться 80 GB. Медіанні ціни за запитом на ринку оренди GPU станом на July 2026:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

У рядку для 4090 використовується модель 5B. Вартість становить приблизно 0.05 доларів за кліп за ціни 0.36 доларів на годину. У рядках для 80 GB використовуються моделі 14B, тому вартість одного кліпу зростає до 0.6 доларів, хоча саме обладнання працює значно швидше. Більша модель потребує більше обчислень на кожну секунду відео.

П’ять центів за кліп здаються незначною сумою. Саме це вводить в оману. Перші придатні п’ять секунд відео ніколи не є результатом одного рендерингу. Створення відео за допомогою моделі — це пошук, тому для кадру з конкретним рухом нормально виконати від двадцяти до сорока рендерингів, перш ніж отримати потрібний результат. Отже, робоча сесія коштує вже долари, а не центи. Кілька годин ітерацій на орендованому обладнанні коштують приблизно як обід.

Якщо не врахувати два нюанси оренди, вони можуть суттєво збільшити витрати. Оплата нараховується, поки сервер завантажує ваги. Файли Wan 2.2 разом із текстовим енкодером і VAE займають десятки гігабайт, тому обирайте провайдера зі сталим томом і завантажте їх один раз. Оплата також нараховується, поки сервер простоює з відкритою SSH-сесією. Зупиняйте інстанс, а не лише закривайте термінал.

Встановлення ComfyUI на GPU-сервері

Почніть з Ubuntu 24.04, де вже встановлено драйвер NVIDIA. Спочатку перевірте драйвер, оскільки без цієї перевірки всі наступні помилки виглядатимуть однаково.

nvidia-smi

Команда має вивести таблицю з вашою відеокартою та версією CUDA. Якщо вона виводить NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, модуль ядра не завантажено. Зазвичай це трапляється після оновлення ядра без перезавантаження. Виправте проблему на цьому етапі. Інакше ComfyUI перейде на шлях виконання через CPU, і ви витратите годину на пошук проблеми в моделі.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

Переконайтеся, що PyTorch бачить відеокарту, перш ніж завантажувати хоча б один файл вагових коефіцієнтів.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True разом із назвою вашої відеокарти означає, що стек працює правильно. False означає, що встановлено wheel лише для CPU. Це трапляється, коли pip знаходить кешований torch з попереднього встановлення. Повторно встановіть пакет, використавши наведений вище URL індексу.

Завантаження файлів моделі Wan 2.2

ComfyUI не містить ваг, а відеомодель складається не з одного файлу. До неї належать diffusion model, text encoder і VAE, причому кожен компонент потрібно зберігати у власному каталозі. Якщо помістити файл не в ту папку, loader node просто не покаже його, не пояснивши причину помилкою.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

Модель 5B підтримує і text-to-video, і image-to-video, тому саме з неї доцільно почати. Завжди надавайте перевагу .safetensors перед .ckpt. Файл .ckpt є серіалізованим об’єктом Python, тому його завантаження виконує код, написаний автором цього файлу. Передбачте достатньо місця на диску: робоча інсталяція з одним сімейством моделей і файлами результатів потребує 100 GB, а відеофайли значно більші за PNG-зображення, які залишає image workflow. Створюйте резервні копії JSON-файлів workflow, наприклад за допомогою зашифрованих інкрементних резервних копій у object storage, оскільки ваги можна завантажити повторно, а налаштовані workflow — ні.

Запустіть і безпечно підключіться

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

У ComfyUI немає сторінки входу та облікових записів користувачів. Будь-хто, хто може підключитися до порту 8188, може поставити завдання в чергу, прочитати всі створені вами кліпи та встановити custom nodes, що дає змогу виконувати довільний код на вашому сервері. Прив’яжіть його до localhost і підключайтеся через SSH-тунель зі свого комп’ютера.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

Потім відкрийте http://127.0.0.1:8188 у браузері. Завантажте шаблон робочого процесу Wan 2.2 з меню шаблонів ComfyUI, а не з’єднуйте вузли вручну. В офіційних шаблонах задано параметри sampler, для яких було налаштовано модель. У робочому процесі для відео значно більше місць, де можна непомітно вказати неправильне значення, ніж у робочому процесі для зображень.

Коли чесною відповіддю є використання API

Самостійне розгортання генерації відео є правильним вибором, якщо обсяг роботи великий і стабільний, якщо кадри не повинні залишати вашу інфраструктуру або якщо вам потрібна конкретна модель чи спеціальний адаптер, якого немає в жодному хостингу. Це також правильний вибір, якщо конвеєр має працювати так само й через рік, оскільки хостингова модель може змінитися без можливості зафіксувати її версію.

Використовуйте hosted API, якщо вам потрібно кілька кліпів на місяць, якщо потрібен результат, довший або більший за той, який створюють відкриті моделі, або якщо крайній термін спливає цього тижня. Чесно розрахуйте точку беззбитковості. Відеокарта на 24 GB, орендована цілодобово за медіанною ціною станом на July 2026, коштує приблизно 260 доларів на місяць, а придбання такої самої відеокарти коштує більше цієї суми одразу, ще до генерації першого кадру. Неактивний власний сервер щоразу програє тарифікації API за кліп. Це той самий компроміс, який визначає спосіб обслуговування текстових моделей і розглядається в Ollama проти vLLM для обслуговування власних LLM, а також він ґрунтується на базовішому питанні з чи варто взагалі витрачати кошти на VPS із GPU.

Що перевірити, якщо рендеринг завершується помилкою

Якщо рендеринг завершується наприкінці, після завершення індикатора семплера, це означає, що під час декодування VAE не вистачило пам’яті. Зменште кількість кадрів або використайте вузол тайлового декодування. Зміна кількості кроків не допоможе, оскільки декодування виконується один раз після завершення всіх кроків.

Повністю чорний або сильно спотворений результат зазвичай означає, що VAE не відповідає моделі. Завантаження VAE Wan 2.1 для дифузійної моделі Wan 2.2 дає саме такий результат, і в журналі помилок не буде.

Якщо рендеринг виконується, але триває годинами на машині, яка має GPU, це означає, що ComfyUI використовує CPU. Перевірте рядок із пристроєм у журналі запуску, а потім повторно виконайте перевірку torch.cuda.is_available() вище.

Якщо процес зникає з Killed у dmesg без traceback від Python, це означає, що спрацював засіб завершення процесів ядра через нестачу пам’яті. Отже, проблема в системній RAM, а не у VRAM. Для offloading уся модель має перебувати в системній RAM. Тому на машині з 16 GB RAM для offloading моделі 5B пам’яті недостатньо. Додайте RAM або налаштуйте swap.

FAQ

Чи можна генерувати відео за допомогою AI на VPS без GPU?

Ні, якщо ви плануєте робити це регулярно. П’ятисекундний кліп у форматі 720p, рендеринг якого на GPU з 24 GB триває 9 хвилин, на CPU може створюватися багато годин. Це пов’язано з тим, що модель не має матричного апаратного забезпечення для виконання обчислень, а пропускна здатність системної RAM на порядок нижча за пропускну здатність пам’яті GPU. Сервер із CPU може розміщувати інтерфейс ComfyUI, зберігати моделі та робочі процеси, але для самого рендерингу потрібен GPU.

Скільки VRAM потрібно для Wan 2.2?

Для моделі TI2V-5B мінімально потрібно 8 GB за умови використання штатного вивантаження ComfyUI. Для заявленої швидкодії Alibaba рекомендує 24 GB. Для текстово-відео та зображення-відео моделей A14B у картці моделі зазначено щонайменше 80 GB VRAM для виконання на одному GPU. Тому для них потрібні серверні GPU.

Якою може бути тривалість кліпу на власній інфраструктурі?

Станом на July 2026 практичною одиницею є приблизно п’ять секунд у форматі 720p. Довший результат отримують шляхом генерації сегментів і їх об’єднання. Останній кадр одного сегмента використовують як перший кадр наступного. Під час об’єднання якість може поступово змінюватися. Тому довге відео слід розглядати як завдання з монтажу, а не як одну генерацію.

Чи дешевше орендувати GPU погодинно, ніж купувати карту?

Оренда вигідніша, якщо рендеринг триває менше кількох годин на день. За медіанною ціною станом на July 2026 — приблизно 0.36 долара на годину за карту з 24 GB — можна довго орендувати GPU, перш ніж витрати зрівняються з ціною придбання такої карти. Крім того, не потрібно купувати обладнання, яке виявиться невідповідним класу моделі, яку ви фактично хочете використовувати. Придбання вигідне лише тоді, коли сервер завантажений більшу частину дня, щодня.

#ai-video#comfyui#gpu#self-hosting#wan#vram