Self-hosted ИИ-генератор видео: обзор возможностей 2026
Узнайте, на что способны модели Wan 2.2 и HunyuanVideo в июле 2026 года. Разбираем требования к VRAM, реальную стоимость рендеринга 5 секунд видео и выбор между GPU и API.
На что на самом деле способен self-hosted ИИ-генератор видео
Self-hosted ИИ-генератор видео работает уже сегодня, но он медленнее и скромнее, чем показывают демонстрационные ролики. По состоянию на июль 2026 года стоит использовать открытые модели Wan 2.2 от Alibaba и HunyuanVideo от Tencent, а также LTX-Video от Lightricks, если скорость важнее реалистичности. Все они работают через ComfyUI на Linux-машине с GPU NVIDIA. На выходе вы получаете клип длительностью около пяти секунд в разрешении 720p. Это не сцена. Это не минута готового видеоряда.
Вот краткий ответ перед подробностями. Карта с 24 GB VRAM рендерит пятисекундный клип 720p за несколько минут. Карта с 12 GB выполняет ту же задачу за двадцать минут или дольше, так как веса модели не помещаются в видеопамять, и программное обеспечение постоянно перемещает слои между GPU и системной RAM. Сервер без GPU не может выполнять эту задачу сколько-нибудь эффективно. Арифметика, которая делала генерацию изображений на CPU медленной, делает генерацию видео на CPU бессмысленной.
Если вы уже читали аппаратную лестницу для self-hosted генератора изображений, то в случае с видео аргументация та же, только все требования сдвинуты на класс выше. VRAM (видеопамять, RAM, распаянная рядом с графическим чипом) по-прежнему остается единственной характеристикой, определяющей, будет ли этот процесс приносить удовольствие или станет мучением.
Почему одно видео стоит значительно дороже одного изображения
Диффузионная модель генерирует изображение путем пошагового удаления шума, при этом на каждом шаге считываются все веса модели. Видеомодель выполняет те же действия для целого блока кадров одновременно, добавляя механизм внимания по временной шкале, чтобы кадр 80 «знал», как выглядел кадр 12. Пять секунд при 24 кадрах в секунду — это 120 кадров в одном пакете.
Именно из-за этого временного внимания стоимость не растет линейно вместе с длительностью клипа. Удвоение количества кадров более чем в два раза увеличивает объем памяти, необходимый сэмплеру, поэтому при нехватке ресурсов рендеринг не просто замедляется — он аварийно завершается.
Существует второй скачок потребления памяти, который часто становится неожиданностью. После завершения работы сэмплера VAE (вариационный автокодировщик, компонент, преобразующий сжатое латентное представление в реальные пиксели) декодирует всё латентное видео целиком. Этот процесс декодирования может требовать больше памяти, чем сам сэмплинг. Симптомом является задача, которая показывает заполненную полосу прогресса, а затем выводит следующее сообщение:
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiBРешением является тайловое декодирование (tiled decoding) или сокращение длительности клипа. Понимание того, на каком этапе закончилась память, избавляет от бесполезной настройки параметров в течение часа.
Сколько видеопамяти (VRAM) нужно для генерации видео с помощью ИИ
Два опубликованных показателя определяют всё решение, и на первый взгляд они противоречат друг другу. Alibaba заявляет, что модель Wan 2.2 TI2V-5B создает 720p-клипы с частотой 24 кадра в секунду длительностью пять секунд менее чем за девять минут на одном потребительском GPU, таком как 4090, и рекомендует минимум 24 ГБ VRAM. Документация ComfyUI утверждает, что та же модель 5B «должна хорошо помещаться в 8 ГБ VRAM при использовании нативного offloading в ComfyUI».
Оба утверждения верны, так как они измеряют разные вещи. 8 ГБ — это предел, при котором модель помещается в память. 24 ГБ — это комфортный объем. Механизм offloading работает за счет удержания большей части модели в оперативной памяти (RAM) и последовательной передачи слоев в GPU на каждом шаге, поэтому видеокарта тратит время на ожидание данных по шине PCIe, а не на вычисления. Вы платите эту цену на каждом шаге сэмплера, а не один раз.
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]Только последняя строка является показателем от производителя. Карта с 24 ГБ VRAM показывает результат 9 минут на клип, что соответствует опубликованным Alibaba данным для этой модели. Остальные строки показывают влияние offloading, и это скорее порядковые оценки, чем результаты бенчмарков. Важна сама тенденция: 40 минут на карте с 8 ГБ — это технически рабочая конфигурация, но на практике это пакетное задание, которое вы оставляете выполняться на всю ночь.
Более крупные модели Wan 2.2 — это другой уровень. Варианты A14B для генерации видео по тексту и изображению требуют не менее 80 ГБ VRAM для инференса на одном GPU. Это оборудование уровня дата-центров, а не карта для настольного ПК, и именно здесь self-hosting начинает означать почасовую аренду чужого ускорителя. Та же арифметика работает еще жестче в области текстовых моделей, где self-hosting модели с 2.8 триллионами параметров, такой как Kimi K3, перестает быть вопросом об одной карте и превращается в вопрос о том, сколько карт по 80 ГБ вы можете позволить себе объединить.
Стоимость клипа при аренде GPU
Аренда — оптимальный способ тестирования для большинства пользователей, так как купленная видеокарта может оказаться неподходящей, если выбранной модели потребуется 80 GB памяти. Медианные цены на аренду GPU по состоянию на июль 2026 года:
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]Строка с 4090 соответствует запуску модели 5B и стоит около 0.05 долларов за клип при цене 0.36 долларов в час. Строки с 80 GB соответствуют запуску моделей 14B; именно поэтому стоимость за клип возрастает до 0.6 долларов, несмотря на то, что само оборудование работает значительно быстрее. Больше модель — больше вычислительных ресурсов на секунду видео.
Пять центов за клип кажутся незначительной суммой, но это обманчивое впечатление. Первые пять секунд пригодного видео никогда не получаются с первой попытки. Работа с видеомоделью — это поиск, и двадцать-сорок генераций до получения удачного результата для кадра с конкретным движением — норма. Таким образом, рабочая сессия обходится в доллары, а не в центы, и послеобеденное время итераций на арендованном оборудовании стоит примерно как обед.
Два нюанса аренды могут привести к реальным расходам, если их упустить. Тарификация идет, пока сервер загружает веса, а файлы Wan 2.2 вместе с текстовым энкодером и VAE занимают десятки гигабайт, поэтому выбирайте провайдера с постоянным хранилищем (persistent volume) и загружайте данные один раз. Также тарификация продолжается, пока сервер простаивает с открытой SSH-сессией. Останавливайте инстанс, а не просто закрывайте терминал.
Установка ComfyUI на сервер с GPU
Начните с Ubuntu 24.04 с уже установленным драйвером NVIDIA. Сначала проверьте драйвер, так как без этой проверки любая последующая ошибка будет выглядеть одинаково.
nvidia-smiЭта команда должна вывести таблицу с вашей видеокартой и версией CUDA. Если выводится NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, значит, модуль ядра не загружен, что обычно происходит после обновления ядра без перезагрузки. Исправьте это сейчас. В противном случае ComfyUI переключится на использование CPU, и вы потратите час, пытаясь понять, почему модель работает медленно.
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txtУбедитесь, что PyTorch видит видеокарту, прежде чем скачивать файлы весов.
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"True вместе с названием вашей видеокарты означает, что стек работает корректно. False означает, что установлен пакет только для CPU; это происходит, если pip находит кэшированный torch от предыдущей установки. Переустановите пакет, используя указанный выше index URL.
Загрузка файлов модели Wan 2.2
В ComfyUI нет встроенных весов, а видеомодель не состоит из одного файла. Это диффузионная модель, текстовый энкодер и VAE, каждый из которых размещается в своей директории. Если поместить файл не в ту папку, узел загрузчика просто не отобразит его в списке, не выдав при этом никакой ошибки.
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensorsМодель 5B поддерживает как преобразование текста в видео, так и изображения в видео, поэтому она является оптимальной отправной точкой. Всегда отдавайте предпочтение .safetensors перед .ckpt. Файл .ckpt представляет собой сериализованный объект Python (pickle), поэтому его загрузка запускает код, написанный автором файла. Выделите достаточно места на диске: для полноценной установки с одним семейством моделей и результатами работы потребуется 100 GB, а видеофайлы значительно больше, чем PNG-изображения, остающиеся после генерации статичных картинок. Делайте резервные копии JSON-файлов ваших рабочих процессов с помощью инструментов вроде шифрованного инкрементального резервного копирования в объектное хранилище, так как веса можно скачать повторно, а настроенные вами рабочие процессы — нет.
Запуск и обеспечение безопасности
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188В ComfyUI нет экрана входа или системы учетных записей. Любой, кто имеет доступ к порту 8188, может ставить задачи в очередь, просматривать все созданные вами клипы и устанавливать пользовательские узлы (custom nodes), что равносильно выполнению произвольного кода на вашем сервере. Привяжите сервис к localhost и подключайтесь к нему через SSH-туннель со своего компьютера.
ssh -N -L 8188:127.0.0.1:8188 you@your-serverЗатем откройте http://127.0.0.1:8188 в браузере. Загрузите шаблон рабочего процесса Wan 2.2 из меню шаблонов ComfyUI, вместо того чтобы соединять узлы вручную. Официальные шаблоны содержат настройки сэмплера, под которые был оптимизирован модель; в рабочем процессе для видео гораздо больше параметров, которые можно случайно настроить неверно, чем в процессе для изображений.
Когда честный ответ — использовать API
Самостоятельный хостинг генерации видео оправдан, если объем задач велик и стабилен, если кадры не должны покидать вашу инфраструктуру или если вам требуется специфическая модель или пользовательский адаптер, который не предлагает ни один облачный сервис. Это также верное решение, если конвейер обработки должен работать точно так же через год, поскольку облачная модель может измениться без предупреждения, а зафиксировать версию невозможно.
Используйте облачный API, если вам нужно несколько клипов в месяц, если требуется результат большей длительности или разрешения, чем могут выдать открытые модели, или если у вас горят сроки на этой неделе. Честно оцените точку безубыточности. Аренда карты с 24 GB видеопамяти в режиме 24/7 по медианной цене июля 2026 года составляет примерно 260 долларов в месяц, а покупка такой же карты требует больших первоначальных вложений еще до генерации первого кадра. Простаивающий собственный сервер всегда проигрывает оплате за клип через API. Это тот же выбор, что и при определении способа обслуживания текстовых моделей, описанный в Ollama против vLLM для хостинга LLM, и он базируется на более фундаментальном вопросе, рассмотренном в стоит ли вообще арендовать VPS с GPU.
Что проверить при сбое рендеринга
Если рендеринг прерывается в самом конце, после завершения работы полосы сэмплера, значит, не хватило памяти при декодировании VAE. Уменьшите количество кадров или переключитесь на узел tiled decode. Изменение количества шагов не поможет, так как декодирование выполняется один раз, уже после завершения всех шагов.
Результат в виде сплошного черного изображения или сильных искажений обычно означает, что VAE не соответствует модели. Загрузка VAE от Wan 2.1 для диффузионной модели Wan 2.2 приводит именно к такому результату, при этом в логах не появляется никаких ошибок.
Если рендеринг выполняется, но занимает часы на машине, где точно есть GPU, значит, ComfyUI работает через CPU. Проверьте строку с устройством в логе запуска, а затем повторно выполните проверку torch.cuda.is_available(), описанную выше.
Если процесс исчезает с кодом Killed в dmesg без трассировки Python, значит, сработал механизм kernel out-of-memory killer. Это означает нехватку системной оперативной памяти, а не VRAM. Для выгрузки (offloading) модель должна целиком помещаться в системную память, поэтому на машине с 16 GB RAM при работе с моделью 5B памяти недостаточно. Увеличьте объем RAM или добавьте swap.
FAQ
Можно ли генерировать AI-видео на VPS без GPU?
Нет, если вы планируете пользоваться этим чаще одного раза. Пятисекундный ролик в разрешении 720p, который на GPU с 24 GB памяти рендерится девять минут, на CPU будет обрабатываться много часов. Причина в том, что у процессора нет аппаратных блоков для матричных вычислений, а пропускная способность системной оперативной памяти на порядок ниже, чем у видеопамяти. Сервер с CPU может выступать хостом для интерфейса ComfyUI, хранить модели и рабочие процессы, но сам рендеринг требует наличия GPU.
Сколько VRAM нужно для Wan 2.2?
Для модели TI2V-5B нижним порогом является 8 GB при использовании нативного offloading в ComfyUI, а 24 GB — это рекомендация Alibaba для достижения заявленной скорости. Для моделей A14B (text-to-video и image-to-video) в документации указано требование не менее 80 GB VRAM для инференса на одном GPU, поэтому для них необходимы серверные видеокарты уровня дата-центров.
Какой длины может быть ролик при self-hosted генерации?
По состоянию на июль 2026 года практическим стандартом является около пяти секунд в разрешении 720p. Более длинные видео создаются путем генерации отдельных сегментов и их последующей склейки, при этом последний кадр одного сегмента используется как первый кадр следующего. Качество на стыках может снижаться, поэтому длинное видео стоит рассматривать как задачу по монтажу, а не как результат одной генерации.
Дешевле ли арендовать GPU по часам, чем покупать видеокарту?
Аренда выгоднее, если вы рендерите менее нескольких часов в день. При средней цене на июль 2026 года около 0.36 доллара в час за карту с 24 GB памяти, вы сможете арендовать её очень долго, прежде чем стоимость аренды сравняется с ценой покупки. Кроме того, вы избегаете риска покупки оборудования, которое окажется неподходящим для моделей, которые вы на самом деле хотите использовать. Покупка выгодна только в том случае, если сервер загружен работой большую часть дня ежедневно.