SSD Nodes Learn Hosting plans →
Guías Matt ConnorPor Matt Connor · Actualizado 2026-08-07

Generador de imágenes IA autohospedado: hardware real

Comprueba qué hardware exige Stable Diffusion: SDXL ocupa 6,94 GB, un VPS CPU tarda 10-20 minutos por imagen y ComfyUI incluye comandos de instalación.

Qué necesita realmente un generador de imágenes con IA autohospedado

Un generador de imágenes con IA autohospedado consta de una aplicación web y un archivo de modelo. La aplicación es ComfyUI y se ejecuta en cualquier servidor Linux. El modelo determina el hardware necesario. Un checkpoint de la clase SDXL ocupa 6.94 GB y necesita permanecer en la memoria de la GPU. Este único dato determina todo el presupuesto, así que lea la comparativa de hardware siguiente antes de alquilar nada.

El resumen es sencillo: un VPS que sólo use CPU puede instalar y servir el software, y generar imágenes de 512x512 con un modelo antiguo de Stable Diffusion 1.5 en uno o dos minutos por imagen. El mismo servidor, al ejecutar SDXL a 1024x1024, tarda entre diez y veinte minutos por imagen. No se trata de una configuración defectuosa. Es una cuestión de cálculo, y esta guía lo explica.

Por qué el tamaño del modelo determina la máquina

La generación de imágenes ejecuta un bucle de eliminación de ruido. Un renderizado de 30 pasos pasa el modelo completo sobre la imagen 30 veces, y cada paso lee todos los pesos. SDXL en precisión media ocupa aproximadamente 6.9 GB de pesos, por lo que un renderizado de 30 pasos mueve unos 200 GB a través de la memoria antes de mostrar una imagen.

Una GPU con 24 GB de memoria de vídeo (VRAM, la memoria soldada junto al chip gráfico) lee a cientos de gigabytes por segundo y puede mantener los 6.9 GB completos a la vez. Una VPS con CPU lee la RAM del sistema a decenas de gigabytes por segundo y no tiene hardware matricial para las convoluciones, por lo que el mismo bucle se ejecuta entre uno y dos órdenes de magnitud más lento. Este es el mismo argumento basado en el ancho de banda de memoria que determina el rendimiento de los modelos de texto, y conviene leerlo junto con cuándo merece realmente la pena pagar una VPS con GPU.

La generación de imágenes se diferencia de la generación de texto en un aspecto importante. Un modelo de chat transmite tokens, por lo que una máquina lenta sigue siendo utilizable porque las palabras aparecen mientras se leen. Una imagen sólo aparece cuando termina el último paso. Si es lento, tendrá que mirar una barra de progreso.

La escala de hardware, con cifras reales

El bloque siguiente contiene cifras habituales para una imagen SDXL de 1024x1024, con 30 pasos y el muestreador Euler, a fecha de julio de 2026. Tómalas como órdenes de magnitud. El muestreador, el número de pasos y la resolución pueden modificarlas.

ChartOne SDXL image, 1024x1024, 30 steps (typical, July 2026)
The data behind this chart
[
  {
    "label": "8 vCPU VPS, no GPU",
    "seconds_per_image": 780
  },
  {
    "label": "8GB VRAM GPU",
    "seconds_per_image": 32
  },
  {
    "label": "12GB VRAM GPU",
    "seconds_per_image": 18
  },
  {
    "label": "24GB VRAM GPU",
    "seconds_per_image": 9
  }
]

La fila de CPU indica 780 segundos, unos trece minutos. La tarjeta de 24 GB tarda 9 segundos. Esa es la diferencia que estás pagando.

Interpreta la escala de esta forma. Por debajo de 8 GB de VRAM, SDXL sigue funcionando porque ComfyUI descarga automáticamente capas en la RAM del sistema y puede utilizar una tarjeta con tan solo 1 GB. La descarga de capas añade tiempo en cada paso, por lo que una tarjeta de 6 GB tarda más cerca de un minuto por imagen que de treinta segundos. Con 8 GB cabe el modelo base y la generación funciona con comodidad. Con 12 GB puedes mantener un ControlNet o dos junto al checkpoint sin descargar capas. Con 24 GB puedes ejecutar SDXL, el refiner y el escalado en un mismo flujo de trabajo, y empezar a entrenar adaptadores LoRA, que necesitan mucha más memoria que la generación.

Qué puede hacer y qué no puede hacer un VPS con CPU

Puede hacer más de lo que mucha gente espera y menos de lo que da a entender el marketing. Es importante definir ese límite con precisión.

Un VPS con CPU puede instalar ComfyUI, servir la interfaz web, almacenar la biblioteca de modelos, ejecutar la cola y generar imágenes sin ninguna GPU. Con Stable Diffusion 1.5 a 512x512 y 20 pasos, espere entre 60 y 150 segundos por imagen en 8 vCPU modernas con 16 GB de RAM. Para un trabajo por lotes que se ejecute durante la noche o para un endpoint de imágenes de bajo volumen detrás de una cola, el rendimiento es suficiente.

Un VPS con CPU no permite trabajar de forma interactiva. Iterar sobre los prompts implica hacer veinte renderizados en una hora, pero a trece minutos por renderizado sólo obtendrá cuatro. Tampoco permite entrenar modelos. El ajuste fino de LoRA en CPU se mide en días, no en horas, por lo que debe considerarlo no disponible.

La regla de memoria para usar sólo CPU es distinta de la regla para GPU. Los pesos se cargan en la RAM del sistema, por lo que necesita el tamaño del modelo más el espacio de trabajo: unos 16 GB de RAM para SDXL y unos 8 GB para SD 1.5. Un servidor con 4 GB iniciará ComfyUI y después el out-of-memory killer lo terminará durante el primer renderizado. Esto se manifiesta como la desaparición del proceso con Killed en dmesg y sin un traceback de Python.

Instalar ComfyUI en un equipo con GPU

Estos son los comandos del proyecto original. Empiece con una instalación limpia de Ubuntu 24.04 y con el controlador NVIDIA ya instalado. Confirme primero el controlador, porque sin esta comprobación todos los errores posteriores parecen iguales.

nvidia-smi

Debe mostrar una tabla con su tarjeta y una versión de CUDA. command not found o NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver significa que falta el controlador o que el módulo del kernel no se cargó después de una actualización. Corrija esto antes de continuar, porque ComfyUI cambiará silenciosamente a la CPU y culpará al software.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

El entorno virtual no es una recomendación opcional. PyTorch instala un árbol grande de dependencias, y hacerlo de forma global en un equipo que ejecuta otros servicios es la forma de romperlos. Compruebe que PyTorch pueda detectar la tarjeta antes de continuar.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True y el nombre de su tarjeta significan que la pila funciona. False significa que el wheel instalado no coincide con el controlador, normalmente porque ya había un wheel de torch sólo para CPU en la caché. Reinstale con la URL del índice anterior.

Obtenga un modelo y planifique el almacenamiento

ComfyUI no incluye modelos. Los checkpoints van en models/checkpoints, los archivos VAE en models/vae y los adaptadores LoRA en models/loras.

cd ~/ComfyUI/models/checkpoints
wget https://huggingface.co/stabilityai/stable-diffusion-xl-base-1.0/resolve/main/sd_xl_base_1.0.safetensors

Prefiera siempre .safetensors frente a .ckpt. Un archivo .ckpt es un objeto Python serializado con pickle, y cargarlo ejecuta código del usuario que lo creó. El formato safetensors sólo contiene tensores, por lo que un archivo malicioso no puede ejecutar código.

El almacenamiento es un coste que suele olvidarse. Un checkpoint base de SDXL ocupa 6.94 GB. El refiner ocupa otros 6 GB. Un modelo ControlNet ocupa entre 1.4 y 2.5 GB, un upscaler entre 60 y 350 MB y un LoRA entre 20 y 400 MB. Quien usa esta herramienta con frecuencia descarga un segundo y un tercer modelo base durante la primera semana. Reserve 100 GB de disco para una instalación operativa y supervise también el directorio de salida: los archivos PNG de 1024x1024 ocupan entre 1 y 2 MB cada uno, y un lote sin supervisión puede llenar silenciosamente un disco pequeño. Coloque models/ y output/ en un volumen que pueda ampliar y haga copias de seguridad de los archivos JSON de los workflows con algo como copias de seguridad incrementales cifradas en almacenamiento de objetos. Los modelos se pueden volver a descargar. Los workflows que ajustó, no.

Ejecutarlo y acceder de forma segura

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI escucha en el puerto 8188. En un equipo que sólo tenga CPU, añada --cpu. Esta opción fuerza la ruta de ejecución de la CPU y evita que falle porque no hay un dispositivo CUDA disponible.

Vincúlelo a 127.0.0.1, no a 0.0.0.0. ComfyUI no tiene pantalla de inicio de sesión ni cuentas de usuario. Cualquier cliente que alcance el puerto puede poner trabajos en cola, leer todas las imágenes que haya generado e instalar nodos personalizados. Esto permite ejecutar código arbitrario en el servidor. Acceda mediante un túnel SSH desde su equipo portátil.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

Después, abra http://127.0.0.1:8188 localmente. Si necesita acceso real para varios usuarios, coloque un reverse proxy con autenticación delante y mantenga la aplicación vinculada a localhost. El mismo razonamiento se aplica a cualquier servicio autoalojado sin autenticación y es el patrón estándar en implementaciones de Docker Compose en un VPS.

Manténgalo en ejecución con systemd

Una cola de renderizado que muere al cerrar la sesión SSH no es un servicio. Escriba /etc/systemd/system/comfyui.service.

[Unit]
Description=ComfyUI
After=network-online.target

[Service]
User=comfy
WorkingDirectory=/home/comfy/ComfyUI
ExecStart=/home/comfy/ComfyUI/venv/bin/python main.py --listen 127.0.0.1 --port 8188
Restart=on-failure
RestartSec=5

[Install]
WantedBy=multi-user.target
sudo systemctl daemon-reload
sudo systemctl enable --now comfyui
systemctl status comfyui

active (running) y una línea de registro con To see the GUI go to: http://127.0.0.1:8188 indican que está activa. Tenga en cuenta que ExecStart especifica directamente el intérprete del entorno virtual, porque systemd no ejecuta el perfil de shell y activate nunca ocurre.

La recomendación práctica según el presupuesto

Si quiere probar la generación de imágenes y el coste importa más que la velocidad, elija un VPS con CPU y 16 GB de RAM, ejecute SD 1.5 a 512x512 y acepte esperar uno o dos minutos por imagen. Este es el punto de entrada realista y cuesta una fracción de cualquier opción con GPU. También es el lugar adecuado para alojar la biblioteca de modelos y los flujos de trabajo mientras toma una decisión.

Si itera sobre prompts a diario, alquile por horas una GPU con al menos 12 GB de VRAM en un proveedor de GPU cloud y apáguela cuando deje de usarla. La generación de imágenes es una carga de trabajo intermitente, y mantener una GPU inactiva con facturación mensual es la forma más habitual de gastar de más en este caso. Mantenga los checkpoints en un almacenamiento de bloques económico y móntelos.

Si ofrece el servicio a otras personas o entrena adaptadores LoRA, necesita 24 GB de VRAM y una máquina que mantenga encendida. En ese punto, el mismo equipo normalmente también resulta rentable para ejecutar un modelo de lenguaje local, que es la configuración descrita en alojar un LLM propio con Ollama.

Independientemente del nivel que elija, mida su propia máquina antes de confiar en cualquier cifra publicada. Ponga el mismo prompt en cola cinco veces y lea los segundos por iteración que ComfyUI muestra en su consola. Ese número indica su posición real en la escala.

FAQ

¿Puedo ejecutar Stable Diffusion sin una GPU?

Sí. ComfyUI se ejecuta con python main.py --cpu y genera imágenes reales sin una tarjeta gráfica. En Stable Diffusion 1.5 a 512x512, cada imagen tarda aproximadamente entre 60 y 150 segundos. En SDXL a 1024x1024, tarda entre diez y veinte minutos con 8 vCPU modernas. Esto sirve para lotes nocturnos y endpoints de bajo volumen. No sirve para iterar sobre prompts, y el entrenamiento queda completamente fuera de alcance.

¿Cuánta VRAM necesito para SDXL?

8 GB permiten ejecutar SDXL cómodamente a 1024x1024. Con menos VRAM, ComfyUI descarga automáticamente las capas a la RAM del sistema y sigue funcionando hasta con aproximadamente 1 GB de VRAM, pero cada paso descargado añade tiempo. 12 GB permiten mantener un ControlNet junto al checkpoint. 24 GB permiten usar el modelo base, el refiner y el escalado en un único flujo de trabajo. También es el mínimo práctico para entrenar adaptadores LoRA.

¿Cuánto espacio en disco necesitan los modelos?

El checkpoint base de SDXL ocupa 6.94 GB por sí solo, y el refiner añade aproximadamente 6 GB. Los modelos ControlNet ocupan entre 1.4 y 2.5 GB cada uno. Los adaptadores LoRA ocupan entre 20 y 400 MB. Los modelos de escalado ocupan hasta 350 MB. Reserve 100 GB para una instalación operativa con varios modelos base. Supervise el directorio de salida por separado, porque los archivos PNG de 1024x1024 ocupan entre 1 y 2 MB cada uno.

¿Es seguro exponer ComfyUI en Internet público?

No. ComfyUI no incluye ningún tipo de autenticación. Además, su sistema de nodos personalizados instala y ejecuta código Python desde la interfaz. Por tanto, un puerto abierto permite la ejecución remota de código en el servidor. Enlace el servicio a 127.0.0.1, acceda mediante un túnel SSH con ssh -N -L 8188:127.0.0.1:8188 you@your-server y coloque delante un reverse proxy con autenticación si necesitan acceder varias personas.

¿Por qué se terminó mi render sin mostrar ningún mensaje de error?

Si el proceso desaparece con Killed en dmesg y no aparece ningún traceback de Python, la causa es el asesino de procesos por falta de memoria de Linux, no un error de ComfyUI. En un equipo que sólo usa CPU, los pesos se almacenan en la RAM del sistema. Por eso, SDXL necesita aproximadamente 16 GB y SD 1.5 aproximadamente 8 GB, además del espacio de trabajo. Añada RAM, añada swap o use un modelo más pequeño con una resolución menor.