Generador de vídeo con IA autoalojado: la realidad
Conoce qué generan Wan 2.2, HunyuanVideo y LTX-Video en julio de 2026, cuánta VRAM necesitan, el coste de un clip de 5 segundos y cuándo usar una API.
Qué puede hacer realmente un generador de vídeo con IA autoalojado
Un generador de vídeo con IA autoalojado funciona actualmente, pero es más lento y genera clips más cortos de lo que sugieren los vídeos de demostración. En julio de 2026, los modelos abiertos que merece la pena ejecutar son Wan 2.2 de Alibaba y HunyuanVideo de Tencent, además de LTX-Video de Lightricks cuando la velocidad importa más que el realismo. Todos se ejecutan con ComfyUI en una máquina Linux con una GPU NVIDIA. El resultado es un clip de aproximadamente cinco segundos a 720p. No una escena. No un vídeo terminado de un minuto.
Esta es la respuesta breve antes de entrar en los detalles. Una tarjeta de 24 GB renderiza un clip de cinco segundos a 720p en unos pocos minutos. Una tarjeta de 12 GB tarda veinte minutos o más en hacer el mismo trabajo, porque los pesos no caben en la memoria de vídeo y el software mueve continuamente capas entre la memoria de vídeo y la RAM del sistema. Un servidor sin GPU no puede hacer esto de forma útil. La misma carga de cálculo que hace lenta la generación de imágenes con CPU hace que la generación de vídeo con CPU no resulte práctica.
Si ya has leído la guía de hardware para un generador de imágenes autoalojado, el vídeo sigue el mismo principio, pero con cada cifra desplazada una categoría hacia arriba. La VRAM (memoria de vídeo, la RAM soldada junto al chip gráfico) sigue siendo la única especificación que determina si esta tarea resulta sencilla o problemática.
Por qué un video cuesta mucho más que una imagen
Un modelo de difusión genera una imagen eliminando el ruido por pasos. Cada paso lee todos los pesos del modelo. Un modelo de video hace lo mismo con un bloque completo de fotogramas a la vez. Además, aplica atención temporal para que el fotograma 80 sepa cómo era el fotograma 12. Cinco segundos a 24 fotogramas por segundo son 120 fotogramas en un solo lote.
La atención temporal explica por qué el costo no aumenta de forma proporcional a la duración del clip. Duplicar la cantidad de fotogramas aumenta en más del doble la memoria que necesita el sampler. Por eso, el problema no es que el renderizado sea más lento. El renderizado falla.
Hay un segundo aumento de memoria que suele pasar desapercibido. Cuando termina el sampler, el VAE (variational autoencoder, el componente que convierte el latent comprimido en píxeles reales) decodifica todo el video latent a la vez. Esa decodificación puede necesitar más memoria que el muestreo. El síntoma es un trabajo que muestra una barra de progreso completa y después imprime esto:
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiBLa solución es usar una decodificación por bloques o un clip más corto. Saber en qué etapa se agotó la memoria evita ajustar el parámetro equivocado durante una hora.
¿Cuánta VRAM se necesita para generar videos con IA?
Dos cifras publicadas enmarcan toda la decisión, pero parecen contradecirse. Alibaba indica que el modelo Wan 2.2 TI2V-5B genera clips de 720p a 24 fotogramas por segundo y de cinco segundos de duración en menos de nueve minutos con una sola GPU de consumo, como una 4090, y recomienda al menos 24 GB de VRAM. La documentación de ComfyUI indica que el mismo modelo 5B «debería funcionar correctamente con 8GB de VRAM mediante el offloading nativo de ComfyUI».
Ambas afirmaciones son correctas porque miden cosas diferentes. 8 GB es la cantidad con la que el modelo cabe. 24 GB es la cantidad con la que funciona cómodamente. El offloading mantiene la mayor parte del modelo en la RAM del sistema y transmite las capas a la GPU en cada paso, por lo que la tarjeta pasa el tiempo esperando al bus PCIe en lugar de realizar cálculos. Este coste se paga en cada paso del sampler, no una sola vez.
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]Solo la última fila corresponde a una cifra del proveedor. La tarjeta de 24 GB tarda 9 minutos por clip, que es la cifra publicada por Alibaba para este modelo. Las demás filas muestran el efecto del offloading y representan órdenes de magnitud, no resultados de pruebas comparativas. La tendencia es lo importante: 40 minutos en una tarjeta de 8 GB es una configuración que funciona técnicamente, pero que en la práctica requiere dejar un trabajo ejecutándose durante toda la noche.
Los modelos Wan 2.2 más grandes pertenecen a otra categoría. Las variantes A14B de texto a video y de imagen a video requieren al menos 80 GB de VRAM para la inferencia con una sola GPU. Se trata de hardware de centro de datos, no de una tarjeta que se instala en un equipo de escritorio. A partir de ese punto, el alojamiento propio empieza a significar alquilar el acelerador de otra persona por horas.
Cuánto cuesta un clip en una GPU alquilada
El alquiler es la forma recomendada para probar esto, porque una tarjeta que compre puede no ser el hardware adecuado si el modelo que finalmente necesita requiere 80 GB. Precios medianos bajo demanda en el mercado de alquiler de GPU, a fecha de julio de 2026:
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]La fila de la 4090 ejecuta el modelo 5B y cuesta aproximadamente 0.05 dólares por clip a 0.36 dólares por hora. Las filas de 80 GB ejecutan los modelos 14B. Por eso, su coste por clip sube a 0.6 dólares, aunque el propio hardware sea mucho más rápido. Un modelo más grande requiere más cómputo por segundo de vídeo.
Cinco centavos por clip parecen insignificantes, y ahí está el aspecto engañoso. Sus primeros cinco segundos utilizables nunca son un único renderizado. Crear prompts para un modelo de vídeo es un proceso de búsqueda, y es normal necesitar entre veinte y cuarenta renderizados antes de obtener una toma válida cuando contiene un movimiento específico. Por tanto, una sesión de trabajo cuesta dólares, no centavos, y una tarde de iteración en hardware alquilado cuesta aproximadamente lo mismo que un almuerzo.
Hay dos detalles del alquiler que pueden costar dinero real si los pasa por alto. Se le factura mientras el equipo descarga los pesos, y los archivos de Wan 2.2, junto con su codificador de texto y VAE, ocupan decenas de gigabytes. Elija un proveedor con un volumen persistente y descargue los archivos una sola vez. También se le factura mientras el equipo permanece inactivo con la sesión de SSH abierta. Detenga la instancia en lugar de limitarse a cerrar el terminal.
Instalar ComfyUI en el servidor con GPU
Comience con Ubuntu 24.04 y el controlador de NVIDIA ya instalado. Compruebe primero el controlador, porque sin esta comprobación todos los errores posteriores parecen iguales.
nvidia-smiEl comando debe mostrar una tabla con la tarjeta y una versión de CUDA. Si muestra NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, el módulo del kernel no está cargado. Esto suele ocurrir después de actualizar el kernel sin reiniciar. Corríjalo ahora. De lo contrario, ComfyUI cambiará a la ruta de CPU y perderá una hora buscando el problema en el modelo.
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txtConfirme que PyTorch detecta la tarjeta antes de descargar un solo archivo de pesos.
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"True junto con el nombre de la tarjeta indica que la pila funciona correctamente. False indica que la wheel instalada es la compilación exclusiva para CPU. Esto ocurre cuando pip encuentra una versión de torch en caché de una instalación anterior. Vuelva a instalarla con la URL del índice anterior.
Descargar los archivos del modelo Wan 2.2
ComfyUI no incluye pesos, y un modelo de vídeo no consta de un solo archivo. Consta de un modelo de difusión, un codificador de texto y un VAE. Cada componente va en su propio directorio. Si coloca un archivo en la carpeta incorrecta, el nodo cargador simplemente no lo mostrará, sin ningún error que explique el motivo.
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensorsEl modelo 5B admite tanto texto a vídeo como imagen a vídeo, por lo que es un punto de partida adecuado. Prefiera siempre .safetensors en lugar de .ckpt. Un archivo .ckpt es un objeto de Python serializado con pickle. Al cargarlo, se ejecuta código escrito por quien lo creó. Reserve suficiente espacio en disco: una instalación funcional con una familia de modelos y sus resultados necesita 100 GB. Los archivos de vídeo ocupan mucho más que las imágenes PNG que genera un flujo de trabajo de imágenes. Haga copias de seguridad de sus archivos JSON de flujo de trabajo, por ejemplo mediante copias de seguridad incrementales cifradas en almacenamiento de objetos, porque los pesos se pueden volver a descargar y los flujos de trabajo ajustados no.
Ejecútalo y accede de forma segura
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188ComfyUI no tiene pantalla de inicio de sesión ni cuentas de usuario. Cualquier equipo que pueda acceder al puerto 8188 puede poner trabajos en cola, leer todos los clips que hayas generado e instalar nodos personalizados, lo que permite ejecutar código arbitrario en el servidor. Vincúlalo a localhost y accede mediante un túnel SSH desde tu propio equipo.
ssh -N -L 8188:127.0.0.1:8188 you@your-serverA continuación, abre http://127.0.0.1:8188 en el navegador. Carga el flujo de trabajo de plantilla Wan 2.2 desde el menú de plantillas de ComfyUI en lugar de conectar los nodos manualmente. Las plantillas oficiales incluyen la configuración del muestreador con la que se ajustó el modelo, y un flujo de trabajo de vídeo tiene muchos más puntos en los que un valor puede ser incorrecto sin que sea evidente que un flujo de trabajo de imagen.
Cuándo la respuesta correcta es usar una API
El autoalojamiento de generación de vídeo es la opción adecuada cuando el volumen es alto y constante, cuando los fotogramas no deben salir de tu propia infraestructura o cuando necesitas un modelo específico o un adaptador personalizado que ningún servicio alojado ofrece. También es adecuado cuando la canalización debe funcionar de la misma manera dentro de un año, porque un modelo alojado puede cambiar sin que puedas fijar una versión.
Usa una API alojada cuando necesites unos pocos clips al mes, cuando necesites una salida más larga o de mayor tamaño que la que producen los modelos abiertos o cuando tengas una fecha límite esta semana. Calcula el punto de equilibrio de forma realista. Una tarjeta de 24 GB alquilada de forma continua al precio mediano de julio de 2026 cuesta aproximadamente 260 dólares al mes, y comprar la misma tarjeta cuesta más que eso por adelantado antes de que hayas generado un solo fotograma. Un equipo autoalojado inactivo siempre pierde frente al precio por clip de una API. Es la misma disyuntiva que determina cómo sirves modelos de texto, descrita en Ollama frente a vLLM para servir LLM autoalojados, y se basa en la cuestión más básica de si una VPS con GPU merece realmente la inversión.
Qué comprobar cuando falla un render
Si un render falla al final, después de que se completa la barra del sampler, se agotó la memoria durante la decodificación del VAE. Reduzca el número de fotogramas o cambie a un nodo de decodificación por bloques. Cambiar el número de pasos no ayudará, porque la decodificación se ejecuta una vez, después de que ya se completaron todos los pasos.
Una salida completamente negra o muy distorsionada suele indicar que el VAE no coincide con el modelo. Cargar un VAE de Wan 2.1 con un modelo de difusión de Wan 2.2 produce exactamente ese resultado, y no aparece ningún error en el registro.
Si el render se ejecuta, pero tarda horas en una máquina que tiene GPU, ComfyUI está usando la ruta de CPU. Compruebe en el registro de inicio la línea del dispositivo y vuelva a ejecutar la comprobación torch.cuda.is_available() anterior.
Si el proceso desaparece con Killed en dmesg y no hay un traceback de Python, se activó el terminador del kernel por falta de memoria. En ese caso, el problema está en la RAM del sistema, no en la VRAM. La descarga requiere que todo el modelo resida en la RAM del sistema. Por eso, una máquina con 16 GB que descarga un modelo de 5B se queda sin memoria. Añada RAM o espacio de swap.
FAQ
¿Puedo generar video con IA en un VPS sin GPU?
No, no de una forma que usaría dos veces. Un clip de cinco segundos a 720p que tarda nueve minutos en una GPU de 24 GB tarda muchas horas en una CPU, porque el modelo no tiene hardware matricial donde ejecutarse y el ancho de banda de la RAM del sistema es un orden de magnitud inferior al ancho de banda de la memoria de la GPU. Un servidor con CPU puede alojar la interfaz de ComfyUI, almacenar los modelos y conservar los flujos de trabajo, pero el renderizado necesita una GPU.
¿Cuánta VRAM necesito para Wan 2.2?
Para el modelo TI2V-5B, 8 GB es el mínimo con la descarga nativa de ComfyUI, y 24 GB es la cantidad que recomienda Alibaba para alcanzar la velocidad publicada. Para los modelos de texto a video y de imagen a video A14B, la ficha del modelo solicita al menos 80 GB de VRAM para la inferencia con una sola GPU, por lo que necesitan tarjetas de centro de datos.
¿Cuánto puede durar un clip autoalojado?
Aproximadamente cinco segundos a 720p es la unidad práctica en julio de 2026. El contenido más largo se produce generando segmentos y uniéndolos, mediante el uso del último fotograma de un segmento como primer fotograma del siguiente. La calidad cambia en las uniones, por lo que debe tratar un video largo como un trabajo de edición y no como una sola generación.
¿Es más barato alquilar una GPU por horas que comprar una tarjeta?
Alquilar es más rentable si renderiza menos de unas pocas horas al día. Con la mediana de julio de 2026, de aproximadamente 0.36 dólares por hora para una tarjeta de 24 GB, puede alquilar durante mucho tiempo antes de alcanzar el precio de compra de esa tarjeta y evita comprar hardware que resulte ser de una clase inadecuada para el modelo que realmente quiere usar. Comprar solo es más rentable cuando el equipo está ocupado la mayor parte del día, todos los días.