Локальный генератор видео: что он реально умеет
Проверьте, что дают Wan 2.2 и HunyuanVideo в July 2026: 24 GB VRAM хватает на 5 секунд 720p за несколько минут, а 12 GB требуют 20 минут и более.
Что на самом деле может генератор видео с локальным размещением
Генератор видео на основе ИИ с локальным размещением уже можно использовать, но он работает медленнее и создает меньше возможностей, чем показывают демонстрационные ролики. По состоянию на July 2026 модели с открытым исходным кодом, которые стоит запускать, — это Wan 2.2 от Alibaba и HunyuanVideo от Tencent, а также LTX-Video от Lightricks, если скорость важнее реалистичности. Все они работают в ComfyUI на машине с Linux и GPU NVIDIA. На выходе получается ролик продолжительностью примерно пять секунд в разрешении 720p. Это не сцена. И не минута готового видео.
Сначала — краткий ответ. Карта с 24 GB рендерит ролик длительностью пять секунд в разрешении 720p за несколько минут. Карта с 12 GB выполняет ту же задачу за 20 минут или больше, потому что веса не помещаются в видеопамять, и программное обеспечение постоянно перемещает слои между видеопамятью и системной RAM. Сервер без GPU не может выполнять эту задачу на практике. Те же вычисления, из-за которых генерация изображений на CPU работает медленно, делают генерацию видео на CPU бессмысленной.
Если вы уже прочитали сравнение аппаратных конфигураций для генератора изображений с локальным размещением, то для видео действует тот же принцип, но каждый показатель нужно увеличить на один класс. VRAM (видеопамять, RAM, установленная рядом с графическим процессором) по-прежнему остается единственной характеристикой, которая определяет, будет ли работа удобной или мучительной.
Почему одно видео стоит намного дороже одного изображения
Диффузионная модель генерирует изображение, поэтапно удаляя из него шум. На каждом этапе она считывает все веса модели. Видеомодель делает то же самое сразу для целого блока кадров. Кроме того, она использует механизм внимания по времени, чтобы кадр 80 учитывал содержимое кадра 12. Пять секунд при частоте 24 кадра в секунду — это 120 кадров в одном пакете.
Именно механизм внимания по времени не позволяет считать стоимость пропорциональной длине клипа. При удвоении числа кадров требуемый sampler объем памяти увеличивается более чем в 2 раза. Поэтому сбой проявляется не в замедлении рендеринга. Рендеринг завершается аварийно.
Есть и второй скачок потребления памяти, которого часто не ожидают. После завершения работы sampler VAE (variational autoencoder, компонент, преобразующий сжатое латентное представление в реальные пиксели) декодирует все латентное видео сразу. Для этого декодирования может потребоваться больше памяти, чем для сэмплирования. Признак проблемы — задача показывает полностью заполненную шкалу выполнения, а затем выводит:
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiBИспользуйте tiled decoding или сократите длительность клипа. Если определить, на каком этапе закончилась память, не придется час настраивать неправильный параметр.
Сколько видеопамяти нужно для генерации видео с помощью ИИ
Два опубликованных показателя определяют весь выбор, но на первый взгляд противоречат друг другу. Alibaba указывает, что модель Wan 2.2 TI2V-5B создает клипы 720p со скоростью 24 кадра в секунду и длительностью пять секунд менее чем за девять минут на одной пользовательской видеокарте, например 4090, и рекомендует не менее 24 GB видеопамяти. В документации ComfyUI указано, что та же модель 5B «должна нормально работать с 8GB vram при использовании встроенной выгрузки ComfyUI».
Оба утверждения верны, поскольку измеряют разные параметры. 8 GB — это объем, при котором модель помещается в видеопамять. 24 GB — это объем, при котором она работает без существенных ограничений. При выгрузке большая часть модели хранится в системной RAM, а слои передаются в GPU перед каждым шагом. Поэтому видеокарта в основном ожидает передачи данных по шине PCIe, а не выполняет вычисления. Эта задержка возникает на каждом шаге sampler, а не один раз.
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]Только последняя строка содержит данные от производителя. На карте с 24 GB один клип создается за 9 минут. Это опубликованный Alibaba показатель для данной модели. Остальные строки показывают, как на этот показатель влияет выгрузка. Это оценка порядка величины, а не результаты тестирования. Главное — соотношение: 40 минут на карте с 8 GB — это технически рабочая конфигурация, но на практике пакетная задача, которую придется оставить выполняться на ночь.
Более крупные модели Wan 2.2 требуют другого подхода. Варианты A14B для преобразования текста в видео и изображения в видео требуют не менее 80 GB видеопамяти при выполнении на одном GPU. Это оборудование для центров обработки данных, а не видеокарта для обычного рабочего компьютера. На этом уровне самостоятельное размещение модели обычно означает почасовую аренду чужого ускорителя.
Стоимость одного ролика на арендованном GPU
Аренда — оптимальный способ протестировать модель. Купленная видеокарта может оказаться неподходящей, если для нужной модели потребуется 80 GB. Медианные цены GPU в арендном сегменте по тарифам on-demand на июль 2026 года:
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]На строке с 4090 запускается модель 5B. Стоимость составляет около 0.05 долларов за ролик при цене 0.36 долларов в час. На строках с 80 GB запускаются модели 14B. Поэтому стоимость одного ролика возрастает до 0.6 долларов, хотя само оборудование значительно быстрее. Чем больше модель, тем больше вычислений требуется на каждую секунду видео.
Пять центов за ролик кажутся незначительной суммой. Это вводит в заблуждение. Первые пригодные для использования пять секунд почти никогда не получают за один рендер. Работа с видеомоделью — это поиск. Для кадра с конкретным движением нормально выполнить от двадцати до сорока рендеров, прежде чем получить подходящий результат. Поэтому рабочая сессия обходится в доллары, а не в центы. Несколько часов итераций на арендованном оборудовании стоят примерно как обед.
Если не учитывать два нюанса аренды, расходы быстро растут. Оплата начисляется, пока сервер загружает веса. Файлы Wan 2.2 вместе с текстовым энкодером и VAE занимают десятки гигабайт. Поэтому выбирайте провайдера с постоянным томом и загружайте файлы один раз. Оплата также начисляется, пока сервер простаивает при открытой SSH-сессии. Остановите инстанс, а не просто закрывайте терминал.
Установите ComfyUI на сервере с GPU
Начните с Ubuntu 24.04 и уже установленного драйвера NVIDIA. Сначала проверьте драйвер. Без этой проверки все последующие ошибки выглядят одинаково.
nvidia-smiКоманда должна вывести таблицу с вашей видеокартой и версией CUDA. Если выводится NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, модуль ядра не загружен. Обычно это происходит после обновления ядра без перезагрузки. Исправьте проблему на этом этапе. В противном случае ComfyUI перейдет на использование CPU, и вы потратите час на поиск причины в модели.
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txtУбедитесь, что PyTorch видит видеокарту, прежде чем загружать хотя бы один файл весов.
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"True вместе с названием вашей видеокарты означает, что стек работает правильно. False означает, что установленная версия wheel предназначена только для CPU. Это происходит, когда pip находит в кеше torch от предыдущей установки. Переустановите пакет с указанным выше URL индекса.
Загрузка файлов модели Wan 2.2
ComfyUI не поставляется с весами, а видеомодель состоит не из одного файла. Она включает diffusion model, text encoder и VAE, и каждый компонент нужно поместить в отдельный каталог. Если поместить файл не в ту папку, loader node просто не покажет его и не сообщит, почему это произошло.
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensorsМодель 5B поддерживает и text-to-video, и image-to-video, поэтому с нее разумно начать. Всегда выбирайте .safetensors вместо .ckpt. Файл .ckpt является сериализованным объектом Python, поэтому его загрузка выполняет код, написанный создателем файла. Выделите достаточно места на диске: рабочая установка с одним семейством моделей и результатами ее работы требует 100 GB, а видеофайлы значительно больше PNG-изображений, которые сохраняются после работы с изображениями. Создавайте резервные копии JSON-файлов рабочих процессов, например с помощью зашифрованного инкрементного резервного копирования в объектное хранилище, поскольку веса можно загрузить повторно, а настроенные рабочие процессы — нет.
Запустите и обеспечьте безопасный доступ
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188В ComfyUI нет страницы входа и учетных записей пользователей. Любой, кто может подключиться к порту 8188, может поставить задания в очередь, прочитать все созданные вами клипы и установить пользовательские узлы. Это позволяет выполнять произвольный код на сервере. Привяжите ComfyUI к localhost и подключайтесь к нему через SSH-туннель со своего компьютера.
ssh -N -L 8188:127.0.0.1:8188 you@your-serverЗатем откройте http://127.0.0.1:8188 в браузере. Загрузите шаблон рабочего процесса Wan 2.2 через меню шаблонов ComfyUI, а не соединяйте узлы вручную. В официальных шаблонах указаны параметры сэмплера, под которые была настроена модель. В рабочем процессе для видео гораздо больше мест, где можно незаметно указать неправильное значение, чем в рабочем процессе для изображений.
Когда честный ответ — использовать API
Самостоятельное размещение генерации видео — правильный выбор, если нагрузка высокая и стабильная, если кадры не должны покидать вашу инфраструктуру или если вам нужна конкретная модель либо пользовательский адаптер, которого нет ни в одном размещенном сервисе. Это также правильный выбор, если конвейер должен работать так же и через год, поскольку размещенная модель может измениться без возможности зафиксировать ее версию.
Используйте размещенный API, если вам нужно несколько клипов в месяц, если требуется вывод большей продолжительности или размера, чем создают модели с открытым исходным кодом, или если срок выполнения — уже на этой неделе. Честно рассчитайте точку безубыточности. Видеокарта с 24 GB памяти, арендуемая круглосуточно по медианной цене за July 2026, стоит примерно 260 долларов в месяц, а покупка такой же видеокарты обойдется дороже этой суммы сразу, еще до генерации первого кадра. Неиспользуемый сервер с самостоятельным размещением всегда проигрывает модели оплаты API за каждый клип. Это тот же компромисс, который определяет способ предоставления текстовых моделей и рассматривается в разделе Ollama и vLLM для самостоятельного предоставления LLM, а также более простой вопрос из раздела оправдана ли вообще стоимость VPS с GPU.
Что проверить, если рендеринг завершается с ошибкой
Если рендеринг завершается в самом конце, после завершения полосы sampler, это означает, что при декодировании VAE закончилась память. Уменьшите количество кадров или переключитесь на узел tiled decode. Изменение количества шагов не поможет, поскольку декодирование выполняется один раз после завершения всех шагов.
Полностью черный или сильно искаженный результат обычно означает, что VAE не соответствует модели. Если загрузить VAE Wan 2.1 для diffusion-модели Wan 2.2, результат будет именно таким, при этом в журнале не появится сообщение об ошибке.
Если рендеринг выполняется, но занимает несколько часов на машине, которая точно оснащена GPU, значит, ComfyUI использует путь выполнения на CPU. Проверьте строку с устройством в журнале запуска, затем повторно выполните указанную выше проверку torch.cuda.is_available().
Если процесс исчезает с Killed в dmesg без traceback от Python, это означает срабатывание kernel out-of-memory killer. В данном случае закончилась системная RAM, а не VRAM. При offloading вся модель должна находиться в системной RAM. Поэтому на машине с 16 GB RAM для offloading модели 5B памяти недостаточно. Установите дополнительную RAM или добавьте swap.
FAQ
Можно ли генерировать видео с помощью ИИ на VPS без GPU?
Нет, если Вы планируете делать это регулярно. Создание пятиминутного клипа в разрешении 720p занимает на GPU объемом 24 GB девять минут, а на CPU — много часов. Причина в том, что у модели нет матричного оборудования для вычислений, а пропускная способность системной RAM на порядок ниже пропускной способности памяти GPU. CPU-сервер может размещать интерфейс ComfyUI, хранить модели и рабочие процессы, но для самого рендеринга требуется GPU.
Сколько VRAM требуется для Wan 2.2?
Для модели TI2V-5B минимальный объем составляет 8 GB при использовании встроенной в ComfyUI выгрузки данных. Для достижения заявленной скорости Alibaba рекомендует 24 GB. Для текстовых моделей A14B, преобразующих текст в видео, и моделей преобразования изображения в видео в карточке модели указано не менее 80 GB VRAM для вывода на одной GPU. Поэтому для них требуются серверные карты.
Какой максимальной длины может быть клип на собственном сервере?
По состоянию на July 2026 практической единицей считается клип длительностью около пяти секунд в разрешении 720p. Более длинный результат создают путем генерации сегментов и их объединения. Последний кадр одного сегмента используют как первый кадр следующего. При объединении качество постепенно изменяется, поэтому длинное видео следует рассматривать как задачу монтажа, а не как одну генерацию.
Аренда GPU с почасовой оплатой дешевле покупки карты?
Аренда выгоднее, если рендеринг выполняется менее нескольких часов в день. При медианной цене на July 2026 около 0.36 долларов в час за карту объемом 24 GB Вы сможете долго арендовать GPU, прежде чем расходы сравняются с ценой покупки такой карты. Кроме того, Вам не придется покупать оборудование, которое окажется неподходящим для нужного Вам класса модели. Покупка выгодна только тогда, когда сервер загружен большую часть дня, каждый день.