SSD Nodes Learn Hosting plans →
Guide Matt ConnorDi Matt Connor · Aggiornato 2026-08-13

Generatore video AI self-hosted: cosa produce davvero

A luglio 2026, Wan 2.2 e HunyuanVideo richiedono GPU da 24 GB per 5 secondi a 720p; con 12 GB servono almeno 20 minuti. Costi GPU e API a confronto.

Che cosa può fare davvero un generatore video AI self-hosted

Un generatore video AI self-hosted funziona già oggi, ma è più lento e produce clip più brevi di quanto suggeriscano i video dimostrativi. A luglio 2026, i modelli open source che vale la pena eseguire sono Wan 2.2 di Alibaba e HunyuanVideo di Tencent, oltre a LTX-Video di Lightricks quando la velocità è più importante del realismo. Tutti possono essere eseguiti con ComfyUI su una macchina Linux dotata di GPU NVIDIA. Il risultato è una clip di circa cinque secondi a 720p. Non una scena completa. Non un minuto di video finito.

Ecco la risposta breve, prima dei dettagli. Una scheda da 24 GB genera una clip di cinque secondi a 720p in pochi minuti. Una scheda da 12 GB svolge lo stesso lavoro in almeno venti minuti, perché i pesi non entrano nella memoria video e il software continua a trasferire i layer tra la memoria video e la RAM di sistema. Un server senza GPU non può eseguire questo carico in modo realmente utile. Lo stesso calcolo che rende lenta la generazione di immagini su CPU rende priva di senso la generazione video su CPU.

Se hai già letto la progressione hardware per un generatore di immagini self-hosted, il video segue lo stesso ragionamento, ma con ogni valore spostato di una classe. La VRAM (video memory, la RAM saldata accanto al chip grafico) resta l'unica specifica che determina se l'esperienza sarà agevole o problematica.

Perché un video richiede molti più calcoli di un'immagine

Un modello di diffusione genera un'immagine rimuovendo il rumore in più passaggi. Ogni passaggio legge tutti i pesi del modello. Un modello video esegue la stessa operazione su un intero blocco di fotogrammi alla volta. Inoltre applica l'attenzione temporale, in modo che il fotogramma 80 tenga conto di ciò che mostrava il fotogramma 12. Cinque secondi a 24 fotogrammi al secondo corrispondono a 120 fotogrammi in un unico batch.

L'attenzione temporale spiega perché il consumo di risorse non cresce in modo lineare con la durata della clip. Raddoppiando il numero di fotogrammi, la memoria richiesta dal sampler aumenta di più del doppio. Di conseguenza, il problema non è un rendering più lento, ma l'interruzione del rendering per esaurimento della memoria.

Esiste un secondo picco di memoria che spesso non ci si aspetta. Al termine del sampling, il VAE (variational autoencoder, il componente che converte il latent compresso in pixel reali) decodifica l'intero video latente in una sola volta. Questa fase può richiedere più memoria del sampling. Il sintomo è un job che mostra una barra di avanzamento completata e poi stampa:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

La soluzione consiste nell'usare il tiled decoding oppure una clip più breve. Sapere quale fase ha esaurito la memoria evita di perdere un'ora regolando il parametro sbagliato.

Quanta VRAM serve per la generazione di video con l’AI

Due dati pubblicati definiscono l’intera decisione, ma sembrano contraddirsi. Alibaba dichiara che il modello Wan 2.2 TI2V-5B genera clip a 720p, a 24 fotogrammi al secondo e della durata di cinque secondi, in meno di nove minuti su una singola GPU consumer come una 4090, e raccomanda almeno 24 GB di VRAM. La documentazione di ComfyUI dichiara che lo stesso modello 5B «dovrebbe funzionare bene con 8 GB di VRAM usando il native offloading di ComfyUI».

Entrambe le affermazioni sono corrette perché misurano aspetti diversi. 8 GB è il minimo con cui il modello entra in memoria. 24 GB è la quantità con cui funziona senza penalizzazioni rilevanti. L’offloading mantiene la maggior parte del modello nella RAM di sistema e trasferisce i layer alla GPU a ogni passaggio, quindi la scheda passa il tempo ad aspettare il bus PCIe invece di eseguire calcoli. Questo costo si ripete a ogni passaggio del sampler, non una sola volta.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

Solo l’ultima riga riporta un dato del produttore. La scheda da 24 GB produce una clip in 9 minuti, il valore pubblicato da Alibaba per questo modello. Le altre righe descrivono l’effetto dell’offloading e indicano ordini di grandezza, non risultati di benchmark. Il punto è l’andamento: 40 minuti su una scheda da 8 GB descrivono una configurazione tecnicamente funzionante, ma nella pratica equivalente a un’elaborazione batch da lasciare in esecuzione durante la notte.

I modelli Wan 2.2 più grandi appartengono a una categoria diversa. Le varianti A14B per la generazione text-to-video e image-to-video richiedono almeno 80 GB di VRAM per l’inferenza su una singola GPU. Si tratta di hardware da data center, non di una scheda da installare in una workstation, ed è il punto in cui il self-hosting inizia a significare noleggiare a ore l’acceleratore di un altro operatore. Lo stesso calcolo diventa ancora più impegnativo sul versante testuale: eseguire in self-hosting un modello da 2,8 trilioni di parametri come Kimi K3 non è più una questione relativa a una singola scheda, ma al numero di schede da 80 GB che si possono permettere di collegare insieme.

Quanto costa una clip su una GPU a noleggio

Il noleggio è il modo più indicato per effettuare i primi test, perché acquistare una scheda è una scelta sbagliata se il modello che vuoi usare richiede 80 GB. Prezzi mediani on-demand sul mercato del noleggio GPU, a luglio 2026:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

La riga relativa alla 4090 esegue il modello 5B e costa circa 0.05 dollari per clip, a 0.36 dollari l'ora. Le righe relative alle GPU da 80 GB eseguono i modelli 14B. Per questo il costo per clip sale a 0.6 dollari, anche se l'hardware è molto più veloce. Un modello più grande richiede più calcolo per ogni secondo di video.

Cinque centesimi per clip sembrano irrilevanti, ma è proprio questo l'aspetto fuorviante. I primi cinque secondi utilizzabili non derivano mai da un'unica generazione. Usare un modello video è un processo di ricerca: per una ripresa con movimenti specifici, è normale generare da venti a quaranta risultati prima di trovarne uno valido. Una sessione di lavoro costa quindi dollari, non centesimi, e un pomeriggio di iterazioni su hardware a noleggio costa all'incirca quanto un pranzo.

Se trascuri due aspetti del noleggio, puoi sostenere costi significativi. La fatturazione continua mentre l'istanza scarica i pesi. I file di Wan 2.2, insieme al relativo text encoder e al VAE, occupano decine di gigabyte. Scegli quindi un provider con un volume persistente ed esegui il download una sola volta. La fatturazione continua anche quando l'istanza è inattiva ma la sessione SSH è ancora aperta. Arresta l'istanza invece di limitarti a chiudere il terminale.

Installare ComfyUI sul server GPU

Partire da Ubuntu 24.04 con il driver NVIDIA già installato. Verificare prima il driver, perché senza questo controllo tutti gli errori successivi sembrano identici.

nvidia-smi

Il comando deve stampare una tabella con la scheda e una versione di CUDA. Se stampa NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, il modulo del kernel non è caricato. Di solito accade dopo un aggiornamento del kernel senza riavviare il sistema. Correggere il problema ora. In caso contrario, ComfyUI utilizzerà il percorso CPU e si perderà un'ora cercando il problema nel modello.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

Verificare che PyTorch rilevi la scheda prima di scaricare anche un solo file dei pesi.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True insieme al nome della scheda indica che lo stack funziona correttamente. False indica che il wheel installato è la build solo CPU. Questo accade quando pip trova una versione di torch nella cache proveniente da un'installazione precedente. Reinstallare usando l'index URL riportato sopra.

Scaricare i file del modello Wan 2.2

ComfyUI non include i pesi e un modello video non è costituito da un solo file. È composto da un modello di diffusione, un codificatore di testo e un VAE; ciascun componente deve trovarsi nella propria directory. Se inserisci un file nella directory sbagliata, il nodo loader semplicemente non lo elenca e non mostra alcun errore che spieghi il motivo.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

Il modello 5B gestisce sia la generazione da testo a video sia quella da immagine a video, quindi è il punto di partenza più appropriato. Preferisci sempre .safetensors a .ckpt. Un file .ckpt è un oggetto Python serializzato con pickle; il caricamento esegue quindi il codice scritto da chi lo ha creato. Prevedi spazio sufficiente sul disco: un'installazione funzionante con una famiglia di modelli e i relativi output richiede 100 GB, e i file video sono molto più grandi delle immagini PNG prodotte da un workflow di generazione di immagini. Esegui il backup dei file JSON dei workflow, ad esempio con backup incrementali cifrati su object storage, perché i pesi possono essere scaricati di nuovo, mentre i workflow ottimizzati non possono esserlo.

Eseguilo e accedici in modo sicuro

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI non dispone di una schermata di accesso né di account utente. Chiunque possa raggiungere la porta 8188 può accodare processi, leggere ogni clip generata e installare custom node, con conseguente esecuzione arbitraria di codice sul server. Associalo a localhost e accedici tramite un tunnel SSH dal tuo computer.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

Apri quindi http://127.0.0.1:8188 nel browser. Carica il workflow del modello Wan 2.2 dal menu dei template di ComfyUI invece di collegare manualmente i nodi. I template ufficiali includono le impostazioni del sampler per cui il modello è stato ottimizzato, e un workflow video offre molti più punti in cui un valore può essere errato senza segnali evidenti rispetto a un workflow per immagini.

Quando la scelta corretta è usare un'API

L'hosting autonomo per la generazione di video è la scelta corretta quando il volume è elevato e costante, quando i fotogrammi non devono lasciare la tua infrastruttura oppure quando ti serve un modello specifico o un adapter personalizzato che nessun servizio gestito offre. È la scelta corretta anche quando la pipeline deve funzionare nello stesso modo tra un anno, perché un modello gestito può cambiare senza preavviso e senza una versione da bloccare.

Usa un'API gestita quando ti servono pochi clip al mese, quando l'output deve essere più lungo o avere una risoluzione maggiore di quella prodotta dai modelli open oppure quando hai una scadenza questa settimana. Calcola il punto di pareggio in modo realistico. Una scheda da 24 GB noleggiata 24 ore su 24 al prezzo mediano di luglio 2026 costa circa 260 dollari al mese, mentre acquistare la stessa scheda costa più di quella cifra in anticipo, prima di aver generato un solo fotogramma. Un server dedicato all'hosting autonomo ma inattivo è sempre meno conveniente del prezzo per clip di un'API. È lo stesso compromesso che determina come servire i modelli testuali, illustrato in Ollama e vLLM per il serving autonomo di LLM, e si basa sulla domanda più elementare affrontata in se una VPS con GPU valga davvero il costo.

Cosa controllare quando un render non riesce

Se un render si interrompe alla fine, dopo il completamento della barra del sampler, significa che la memoria è terminata durante la decodifica VAE. Ridurre il numero di frame o usare un nodo di decodifica tiled. Modificare il numero di step non serve, perché la decodifica viene eseguita una sola volta, dopo che tutti gli step sono già terminati.

Un output completamente nero o fortemente corrotto indica in genere che il VAE non corrisponde al modello. Caricare un VAE Wan 2.1 con un modello di diffusione Wan 2.2 produce esattamente questo risultato e nel log non compare alcun errore.

Se il render viene completato ma richiede ore su una macchina che dispone di una GPU, ComfyUI sta usando il percorso di esecuzione sulla CPU. Controllare nel log di avvio la riga relativa al dispositivo, quindi eseguire di nuovo il controllo torch.cuda.is_available() precedente.

Se il processo scompare con Killed in dmesg e non viene mostrato alcun traceback Python, si tratta dell'oom-killer del kernel. Il problema riguarda quindi la RAM di sistema, non la VRAM. L'offloading richiede che l'intero modello risieda nella RAM di sistema; per questo, su una macchina con 16 GB, l'offloading di un modello 5B non dispone di memoria sufficiente. Aggiungere RAM o configurare uno swap.

FAQ

È possibile generare video con l’AI su un VPS senza GPU?

No, non in modo pratico se prevedi di farlo più di una volta. Un clip di cinque secondi a 720p che richiede nove minuti su una GPU da 24 GB può richiedere molte ore su una CPU, perché il modello non dispone di hardware per le operazioni matriciali e la larghezza di banda della RAM di sistema è di un ordine di grandezza inferiore a quella della memoria GPU. Un server con CPU può ospitare l’interfaccia di ComfyUI, archiviare i modelli e conservare i workflow, ma il rendering richiede una GPU.

Quanta VRAM serve per Wan 2.2?

Per il modello TI2V-5B, 8 GB sono il minimo con l’offloading nativo di ComfyUI, mentre 24 GB sono la dotazione consigliata da Alibaba per raggiungere la velocità pubblicata. Per i modelli text-to-video e image-to-video A14B, la model card richiede almeno 80 GB di VRAM per l’inferenza su una singola GPU; sono quindi necessarie schede per data center.

Quanto può durare un clip self-hosted?

A luglio 2026, l’unità pratica è di circa cinque secondi a 720p. Un output più lungo si ottiene generando segmenti e unendoli, usando l’ultimo frame di un segmento come primo frame di quello successivo. La qualità può variare nei punti di giunzione; considera quindi un video lungo come un lavoro di montaggio, non come una singola generazione.

Noleggiare una GPU a ore costa meno che acquistare una scheda?

Il noleggio è conveniente se il rendering dura meno di alcune ore al giorno. Con il valore mediano di luglio 2026, pari a circa 0.36 dollari l’ora per una scheda da 24 GB, puoi noleggiare una GPU per molto tempo prima di raggiungere il prezzo di acquisto della scheda e non rischi di acquistare hardware di una classe inadatta al modello che vuoi utilizzare. L’acquisto conviene solo quando il server è occupato per gran parte della giornata, tutti i giorni.