SSD Nodes Learn Hosting plans →
Guías Matt ConnorPor Matt Connor · Actualizado 2026-08-13

Generador de video con IA autoalojado: realidad

Conoce qué generan Wan 2.2, HunyuanVideo y LTX-Video en julio de 2026, cuánta VRAM necesitan, cuánto cuesta un clip de 5 segundos y cuándo conviene una API.

Qué puede hacer realmente un generador de vídeo con IA autoalojado

Un generador de vídeo con IA autoalojado funciona actualmente, pero es más lento y produce clips más cortos de lo que sugieren los vídeos de demostración. En julio de 2026, los modelos abiertos que merece la pena ejecutar son Wan 2.2, de Alibaba, y HunyuanVideo, de Tencent, además de LTX-Video, de Lightricks, cuando la velocidad importa más que el realismo. Todos se ejecutan con ComfyUI en una máquina Linux con una GPU NVIDIA. El resultado es un clip de aproximadamente cinco segundos a 720p. No es una escena completa. Tampoco es un minuto de metraje terminado.

Esta es la respuesta breve antes de entrar en detalle. Una tarjeta de 24 GB renderiza un clip de cinco segundos a 720p en unos pocos minutos. Una tarjeta de 12 GB tarda veinte minutos o más en hacer el mismo trabajo, porque los pesos no caben en la memoria de vídeo y el software mueve continuamente capas entre la memoria de vídeo y la RAM del sistema. Un servidor sin GPU no puede hacerlo de forma útil. El mismo cálculo que hace lenta la generación de imágenes con CPU hace que la generación de vídeo con CPU no resulte práctica.

Si ya has leído la escala de hardware para un generador de imágenes autoalojado, el vídeo sigue el mismo razonamiento, pero con todos los valores desplazados una categoría hacia arriba. La VRAM (memoria de vídeo, la RAM soldada junto al chip gráfico) sigue siendo la única especificación que determina si esto resulta cómodo o problemático.

Por qué un video cuesta mucho más que una imagen

Un modelo de difusión genera una imagen eliminando el ruido en varios pasos, y cada paso lee todos los pesos del modelo. Un modelo de video hace lo mismo con un bloque completo de fotogramas a la vez. Además, aplica atención temporal para que el fotograma 80 sepa cómo era el fotograma 12. Cinco segundos a 24 fotogramas por segundo son 120 fotogramas en un solo lote.

La atención temporal hace que el costo no aumente de forma lineal con la duración del clip. Duplicar la cantidad de fotogramas aumenta en más del doble la memoria que necesita el muestreador. Por eso, el fallo no consiste en que el renderizado sea más lento. El renderizado se detiene.

Hay un segundo pico de memoria que suele pasar desapercibido. Cuando termina el muestreador, el VAE (autocodificador variacional, el componente que convierte el espacio latente comprimido en píxeles reales) decodifica todo el video latente de una vez. Esa decodificación puede necesitar más memoria que el muestreo. El síntoma es un trabajo que muestra la barra de progreso completa y después imprime esto:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

La solución es usar una decodificación por bloques o un clip más corto. Saber en qué etapa se agotó la memoria evita ajustar el parámetro equivocado durante una hora.

Cuánta VRAM necesita para generar videos con IA

Dos cifras publicadas enmarcan toda la decisión, y parecen contradecirse. Alibaba indica que el modelo Wan 2.2 TI2V-5B genera clips de 720p a 24 fotogramas por segundo y de cinco segundos en menos de nueve minutos con una sola GPU de consumo, como una 4090, y recomienda al menos 24 GB de VRAM. La documentación de ComfyUI indica que el mismo modelo 5B «debería funcionar bien con 8 GB de VRAM mediante el offloading nativo de ComfyUI».

Ambas cifras son correctas porque miden cosas distintas. 8 GB es el mínimo con el que funciona. 24 GB es la cantidad con la que funciona sin limitaciones importantes. El offloading mantiene la mayor parte del modelo en la RAM del sistema y transfiere las capas a la GPU en cada paso. Por eso, la tarjeta pasa buena parte del tiempo esperando al bus PCIe en lugar de ejecutar cálculos. Ese coste se paga en cada paso del sampler, no una sola vez.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

Sólo la última fila procede del proveedor. La tarjeta de 24 GB tarda 9 minutos por clip, que es la cifra publicada por Alibaba para este modelo. Las otras filas muestran el efecto del offloading y representan órdenes de magnitud, no resultados de benchmarks. La tendencia es lo importante: 40 minutos en una tarjeta de 8 GB es una configuración que funciona técnicamente, pero en la práctica equivale a dejar un trabajo por lotes ejecutándose durante toda la noche.

Los modelos Wan 2.2 más grandes pertenecen a otra categoría. Las variantes A14B de texto a video y de imagen a video requieren al menos 80 GB de VRAM para inferencia con una sola GPU. Eso corresponde a hardware de centro de datos, no a una tarjeta que se instala en un equipo de escritorio. Es el punto en el que el alojamiento propio empieza a significar alquilar por horas el acelerador de otra persona. El mismo cálculo escala mucho más en el lado del texto, donde alojar por cuenta propia un modelo de 2,8 billones de parámetros como Kimi K3 deja de ser una cuestión de una sola tarjeta y pasa a ser una cuestión de cuántas tarjetas de 80 GB puede permitirse conectar.

Cuánto cuesta un clip en una GPU alquilada

El alquiler es la opción que debería usar la mayoría para probar este proceso, porque una tarjeta que compre puede no ser adecuada si el modelo que finalmente quiere usar necesita 80 GB. Precios medianos bajo demanda en el mercado de alquiler de GPU, a fecha de julio de 2026:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

La fila de la 4090 ejecuta el modelo 5B y cuesta aproximadamente 0.05 dólares por clip, a 0.36 dólares por hora. Las filas con 80 GB ejecutan los modelos 14B. Por eso, el coste por clip sube a 0.6 dólares, aunque el hardware sea mucho más rápido. Un modelo más grande requiere más cálculo por segundo de vídeo.

Cinco céntimos por clip parece poco, y ahí está el aspecto engañoso. Los primeros cinco segundos utilizables nunca salen de un único renderizado. Crear prompts para un modelo de vídeo es un proceso de búsqueda, y es normal hacer entre veinte y cuarenta renderizados antes de obtener una toma aprovechable cuando se necesita un movimiento específico. Por tanto, una sesión de trabajo cuesta dólares, no céntimos, y una tarde de iteración en hardware alquilado cuesta aproximadamente lo mismo que un almuerzo.

Hay dos detalles del alquiler que pueden generar costes importantes si los pasa por alto. Se le factura mientras el equipo descarga los pesos, y los archivos de Wan 2.2, junto con su codificador de texto y su VAE, ocupan decenas de gigabytes. Por eso, elija un proveedor con un volumen persistente y descargue los archivos una sola vez. También se le factura mientras el equipo permanece inactivo con la sesión SSH abierta. Detenga la instancia en lugar de limitarse a cerrar el terminal.

Instalar ComfyUI en el equipo con GPU

Parta de Ubuntu 24.04 con el controlador de NVIDIA ya instalado. Compruebe primero el controlador, porque sin esta comprobación todos los fallos posteriores parecen iguales.

nvidia-smi

Debe mostrar una tabla con la tarjeta y una versión de CUDA. Si muestra NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, el módulo del kernel no está cargado. Esto suele ocurrir después de actualizar el kernel sin reiniciar. Corríjalo en este punto. De lo contrario, ComfyUI recurrirá a la CPU y perderá una hora buscando el problema en el modelo.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

Confirme que PyTorch detecta la tarjeta antes de descargar un solo archivo de pesos.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True junto con el nombre de la tarjeta indica que la pila funciona correctamente. False indica que la wheel instalada es la compilación exclusiva para CPU. Esto ocurre cuando pip encuentra una versión de torch almacenada en caché de una instalación anterior. Vuelva a instalarla con la URL del índice anterior.

Descargar los archivos del modelo Wan 2.2

ComfyUI no incluye pesos, y un modelo de vídeo no consta de un solo archivo. Está formado por un modelo de difusión, un codificador de texto y un VAE. Cada componente debe ir en su propio directorio. Si coloca un archivo en la carpeta incorrecta, el nodo cargador simplemente no lo mostrará, sin ningún error que explique el motivo.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

El modelo 5B admite tanto texto a vídeo como imagen a vídeo, por lo que es el punto de partida más recomendable. Prefiera siempre .safetensors en lugar de .ckpt. Un archivo .ckpt es un objeto Python serializado con pickle, por lo que cargarlo ejecuta el código escrito por quien lo creó. Reserve suficiente espacio en disco: una instalación funcional con una familia de modelos y sus archivos de salida necesita 100 GB. Los archivos de vídeo ocupan mucho más que las imágenes PNG que genera un flujo de trabajo de imagen. Haga copias de seguridad de los archivos JSON de sus flujos de trabajo, por ejemplo mediante copias de seguridad incrementales cifradas en almacenamiento de objetos, porque los pesos se pueden volver a descargar, pero los flujos de trabajo ajustados no.

Ejecutarlo y acceder de forma segura

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI no tiene pantalla de inicio de sesión ni cuentas de usuario. Cualquier equipo que pueda acceder al puerto 8188 puede poner trabajos en cola, leer todos los clips que haya generado e instalar custom nodes. Esto permite ejecutar código arbitrario en el servidor. Vincúlelo a localhost y acceda mediante un túnel SSH desde su propio equipo.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

Después, abra http://127.0.0.1:8188 en el navegador. Cargue el flujo de trabajo de plantilla Wan 2.2 desde el menú de plantillas de ComfyUI en lugar de conectar los nodos manualmente. Las plantillas oficiales incluyen los ajustes del sampler con los que se ajustó el modelo. Además, un flujo de trabajo de vídeo tiene muchos más puntos en los que un valor puede configurarse incorrectamente sin que resulte evidente que un flujo de trabajo de imagen.

La respuesta honesta es usar una API

El autoalojamiento de generación de vídeo es la opción adecuada cuando el volumen es alto y constante, cuando los fotogramas no deben salir de su propia infraestructura o cuando necesita un modelo específico o un adaptador personalizado que ningún servicio alojado ofrece. También es adecuado cuando la canalización debe seguir funcionando de la misma forma dentro de un año, porque un modelo alojado puede cambiar sin previo aviso y sin una versión que se pueda fijar.

Use una API alojada cuando necesite unos pocos clips al mes, cuando necesite una salida más larga o de mayor tamaño que la que producen los modelos abiertos o cuando tenga una fecha límite esta semana. Calcule el punto de equilibrio de forma realista. Una tarjeta de 24 GB alquilada de forma ininterrumpida al precio mediano de julio de 2026 cuesta aproximadamente 260 dólares al mes, y comprar la misma tarjeta cuesta más que eso por adelantado antes de generar un solo fotograma. Un equipo autoalojado inactivo siempre sale peor que el precio por clip de una API. Es el mismo equilibrio que determina cómo sirve modelos de texto, explicado en Ollama frente a vLLM para servir LLM autoalojados, y depende de la cuestión más básica de si un VPS con una GPU merece realmente la inversión.

Qué comprobar cuando falla un renderizado

Si un renderizado falla al final, después de que se complete la barra del sampler, se agotó la memoria durante la decodificación del VAE. Reduzca el número de fotogramas o cambie a un nodo de decodificación por bloques. Cambiar el número de pasos no ayudará, porque la decodificación se ejecuta una sola vez, después de que ya se hayan completado todos los pasos.

Una salida completamente negra o muy desordenada suele indicar que el VAE no corresponde al modelo. Cargar un VAE de Wan 2.1 con un modelo de difusión de Wan 2.2 produce exactamente ese resultado, y no aparece ningún error en el registro.

Si el renderizado se ejecuta, pero tarda horas en una máquina que tiene una GPU, ComfyUI está usando la ruta de CPU. Compruebe la línea del dispositivo en el registro de inicio y vuelva a ejecutar la comprobación torch.cuda.is_available() anterior.

Si el proceso desaparece y aparece Killed en dmesg, sin un traceback de Python, se activó el terminador de procesos por falta de memoria del kernel. El problema está en la RAM del sistema, no en la VRAM. El offloading necesita que el modelo completo resida en la RAM del sistema. Por tanto, una máquina con 16 GB que haga offloading de un modelo de 5B se queda corta. Añada RAM o añada swap.

FAQ

¿Puedo generar vídeo con IA en un VPS sin GPU?

No, al menos no de una forma que vaya a usar dos veces. Un clip de cinco segundos a 720p que tarda nueve minutos en una GPU de 24 GB puede tardar muchas horas en una CPU, porque el modelo no dispone de hardware matricial y el ancho de banda de la RAM del sistema es un orden de magnitud inferior al de la memoria de la GPU. Un servidor con CPU puede alojar la interfaz de ComfyUI, almacenar los modelos y conservar los flujos de trabajo, pero el renderizado necesita una GPU.

¿Cuánta VRAM necesito para Wan 2.2?

Para el modelo TI2V-5B, 8 GB es el mínimo con la descarga nativa de ComfyUI, y 24 GB es la cantidad que recomienda Alibaba para alcanzar la velocidad publicada. Para los modelos de texto a vídeo y de imagen a vídeo A14B, la tarjeta del modelo exige al menos 80 GB de VRAM para la inferencia con una sola GPU, por lo que necesitan tarjetas de centro de datos.

¿Qué duración puede tener un clip autoalojado?

Unos cinco segundos a 720p es la unidad práctica en julio de 2026. El resultado más largo se obtiene generando segmentos y uniéndolos, usando el último fotograma de un segmento como el primero del siguiente. La calidad puede variar en las uniones, por lo que debe tratar un vídeo largo como un trabajo de edición y no como una sola generación.

¿Es más barato alquilar una GPU por horas que comprar una tarjeta?

Alquilar resulta más económico si renderiza menos de unas horas al día. Con la mediana de julio de 2026, de aproximadamente 0.36 dólares por hora para una tarjeta de 24 GB, puede alquilar durante mucho tiempo antes de igualar el precio de compra de esa tarjeta. Además, evita comprar hardware que resulte ser de una categoría incorrecta para el modelo que realmente quiere usar. Comprar sólo compensa cuando el equipo está ocupado la mayor parte del día, todos los días.