Generatore video AI self-hosted: cosa funziona davvero
A luglio 2026 Wan 2.2, HunyuanVideo e LTX-Video generano clip 720p di circa 5 secondi: servono 12 o 24 GB di VRAM e una GPU in affitto può costare meno di un server.
Cosa può fare realmente un generatore di video AI self-hosted
Un generatore di video AI self-hosted funziona già oggi, ma è più lento e produce video più brevi di quanto suggeriscano i video dimostrativi. A luglio 2026, i modelli open source che vale la pena eseguire sono Wan 2.2 di Alibaba e HunyuanVideo di Tencent, oltre a LTX-Video di Lightricks quando la velocità è più importante del realismo. Tutti possono essere eseguiti con ComfyUI su una macchina Linux con una GPU NVIDIA. Il risultato è un filmato di circa cinque secondi a 720p. Non una scena completa. Non un minuto di filmato finito.
Ecco la risposta breve, prima dei dettagli. Una scheda da 24 GB genera un filmato di cinque secondi a 720p in pochi minuti. Una scheda da 12 GB esegue lo stesso lavoro in venti minuti o più, perché i pesi non entrano nella memoria video e il software continua a spostare i layer tra la memoria video e la RAM di sistema. Un server senza GPU non può eseguire questa attività in modo utile. I calcoli che rendono lenta la generazione di immagini sulla CPU rendono priva di senso la generazione di video sulla CPU.
Se hai già letto la suddivisione dell'hardware per un generatore di immagini self-hosted, il video ripropone lo stesso ragionamento, ma sposta ogni valore di una classe verso l'alto. La VRAM (la memoria video, cioè la RAM saldata accanto al chip grafico) resta l'unica specifica che determina se l'esperienza sarà agevole o problematica.
Perché un video costa molto più di un'immagine
Un modello di diffusione genera un'immagine rimuovendo il rumore in più passaggi. A ogni passaggio legge tutti i pesi del modello. Un modello video esegue la stessa operazione su un intero blocco di fotogrammi alla volta. Inoltre applica l'attenzione temporale, così il fotogramma 80 può usare le informazioni sul fotogramma 12. Cinque secondi a 24 fotogrammi al secondo corrispondono a 120 fotogrammi in un singolo batch.
L'attenzione temporale spiega perché il costo non cresce in modo proporzionale alla durata del clip. Raddoppiando il numero di fotogrammi, la memoria richiesta dal sampler aumenta di oltre il doppio. Il problema quindi non è un rendering più lento. Il rendering si interrompe.
Esiste un secondo picco di memoria che spesso non ci si aspetta. Al termine del sampler, il VAE (variational autoencoder, il componente che converte il latent compresso in pixel reali) decodifica l'intero video latent in una sola volta. Questa decodifica può richiedere più memoria del sampling. Il sintomo è un job che mostra una barra di avanzamento completata e poi visualizza:
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiBLa soluzione consiste nell'usare la decodifica a tile oppure un clip più breve. Sapere quale fase ha esaurito la memoria evita di modificare il parametro sbagliato per un'ora.
Quanta VRAM serve per la generazione di video con l'IA
Due dati pubblicati definiscono l'intera scelta, ma sembrano contraddirsi. Alibaba dichiara che il modello Wan 2.2 TI2V-5B genera clip a 720p, 24 fotogrammi al secondo e della durata di cinque secondi in meno di nove minuti su una singola GPU consumer come la 4090, e raccomanda almeno 24 GB di VRAM. La documentazione di ComfyUI dichiara che lo stesso modello 5B «dovrebbe funzionare bene con 8 GB di VRAM usando il native offloading di ComfyUI».
Entrambe le affermazioni sono corrette perché misurano aspetti diversi. 8 GB sono sufficienti per farlo funzionare. 24 GB consentono di usarlo senza vincoli rilevanti. L'offloading mantiene la maggior parte del modello nella RAM di sistema e trasferisce i layer nella GPU a ogni passaggio. Di conseguenza, la scheda passa il tempo ad aspettare il bus PCIe invece di eseguire calcoli. Questo costo viene pagato a ogni passaggio del sampler, non una sola volta.
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]Solo l'ultima riga è un dato del produttore. La scheda da 24 GB completa una clip in 9 minuti, il valore pubblicato da Alibaba per questo modello. Gli altri valori mostrano l'effetto dell'offloading e indicano un ordine di grandezza, non risultati di benchmark. Il dato importante è l'andamento: 40 minuti su una scheda da 8 GB rappresentano una configurazione che funziona tecnicamente, ma che in pratica richiede di lasciare in esecuzione un processo batch per tutta la notte.
I modelli Wan 2.2 più grandi appartengono a una categoria diversa. Le varianti A14B per la generazione da testo a video e da immagine a video richiedono almeno 80 GB di VRAM per l'inferenza su una singola GPU. Si tratta di hardware da data center, non di una scheda da installare in una workstation, ed è il punto in cui l'hosting autonomo inizia a significare noleggiare a ore l'acceleratore di qualcun altro.
Quanto costa una clip su una GPU a noleggio
Il noleggio è il modo più adatto per testare il modello, perché una scheda acquistata è l'hardware sbagliato se il modello che alla fine vuoi usare richiede 80 GB. Prezzi mediani on-demand nel mercato del noleggio GPU, a luglio 2026:
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]La riga relativa alla 4090 esegue il modello 5B e costa circa 0.05 dollari per clip, a 0.36 dollari l'ora. Le righe relative alle schede da 80 GB eseguono i modelli 14B. Per questo il costo per clip sale a 0.6 dollari, anche se l'hardware è molto più veloce. Un modello più grande richiede più calcolo per ogni secondo di video.
Cinque centesimi per clip sembrano irrilevanti, ma è proprio questo l'aspetto fuorviante. I primi cinque secondi utilizzabili non sono mai il risultato di un'unica generazione. Creare prompt per un modello video è un processo di ricerca, e per una ripresa con movimenti specifici sono normali da venti a quaranta generazioni prima di ottenere un risultato valido. Una sessione di lavoro costa quindi dollari, non centesimi; un pomeriggio di iterazioni su hardware a noleggio costa all'incirca quanto un pranzo.
Se li trascuri, due dettagli del noleggio possono costare denaro reale. La fatturazione continua mentre la macchina scarica i pesi del modello, e i file di Wan 2.2, insieme al relativo text encoder e VAE, occupano decine di gigabyte. Scegli quindi un provider con un volume persistente ed esegui il download una sola volta. La fatturazione continua anche mentre la macchina resta inattiva con la sessione SSH aperta. Arresta l'istanza invece di limitarti a chiudere il terminale.
Installare ComfyUI sul server GPU
Partire da Ubuntu 24.04 con il driver NVIDIA già installato. Verificare prima il driver, perché senza questo controllo tutti gli errori successivi sembrano identici.
nvidia-smiIl comando deve visualizzare una tabella con la scheda e una versione di CUDA. Se visualizza NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, il modulo del kernel non è caricato. Questo accade in genere dopo un aggiornamento del kernel senza riavvio. Risolvere il problema in questa fase. In caso contrario, ComfyUI userà il percorso della CPU e si perderà tempo a cercare il problema nel modello.
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txtVerificare che PyTorch rilevi la scheda prima di scaricare anche un solo file dei pesi.
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"True insieme al nome della scheda indica che lo stack funziona correttamente. False indica che il wheel installato è la build solo CPU. Questo accade quando pip trova una versione di torch memorizzata nella cache da un'installazione precedente. Reinstallare usando l'URL dell'indice riportato sopra.
Scaricare i file del modello Wan 2.2
ComfyUI non include i pesi e un modello video non è costituito da un solo file. Comprende un modello di diffusione, un encoder del testo e una VAE. Ognuno deve trovarsi nella propria directory. Se inserisci un file nella cartella sbagliata, il nodo loader semplicemente non lo elenca e non mostra alcun errore che spieghi il motivo.
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensorsIl modello 5B gestisce sia la generazione da testo a video sia quella da immagine a video. Per questo è il punto di partenza più indicato. Preferisci sempre .safetensors a .ckpt. Un file .ckpt è un oggetto Python sottoposto a pickling; il caricamento esegue quindi codice scritto da chi lo ha creato. Prevedi spazio su disco sufficiente: un'installazione funzionante con una famiglia di modelli e i relativi output richiede 100 GB. I file video sono molto più grandi delle immagini PNG prodotte da un workflow per immagini. Esegui il backup dei file JSON dei workflow, ad esempio con backup incrementali crittografati in object storage, perché i pesi possono essere scaricati di nuovo, mentre i workflow ottimizzati non possono esserlo.
Avvialo e raggiungilo in sicurezza
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188ComfyUI non dispone di una schermata di accesso né di account utente. Qualsiasi dispositivo che può raggiungere la porta 8188 può accodare processi, leggere ogni clip generata e installare nodi personalizzati, eseguendo così codice arbitrario sul server. Associalo a localhost e raggiungilo tramite un tunnel SSH dal tuo computer.
ssh -N -L 8188:127.0.0.1:8188 you@your-serverApri quindi http://127.0.0.1:8188 nel browser. Carica il workflow modello Wan 2.2 dal menu dei template di ComfyUI invece di collegare manualmente i nodi. I template ufficiali includono le impostazioni del sampler per cui il modello è stato ottimizzato, e un workflow video offre molte più possibilità di impostare involontariamente un valore errato rispetto a un workflow per immagini.
Quando la risposta corretta è usare un'API
L'hosting autonomo della generazione video è la scelta corretta quando il volume è elevato e costante, quando i fotogrammi non devono lasciare la tua infrastruttura o quando ti serve un modello specifico o un adattatore personalizzato che nessun servizio ospitato offre. È indicato anche quando la pipeline deve funzionare allo stesso modo tra un anno, perché un modello ospitato può cambiare senza che tu possa fissarne la versione.
Usa un'API ospitata quando ti servono pochi clip al mese, quando ti serve un output più lungo o di dimensioni maggiori rispetto a quello prodotto dai modelli open oppure quando hai una scadenza questa settimana. Calcola il punto di pareggio in modo realistico. Una scheda da 24 GB noleggiata 24 ore su 24 al prezzo mediano di luglio 2026 costa circa 260 dollari al mese, mentre acquistare la stessa scheda costa più di questa cifra in anticipo, prima di aver generato un solo fotogramma. Un server autogestito inattivo è sempre meno conveniente del prezzo per clip di un'API. È lo stesso compromesso che determina come gestire i modelli di testo, descritto in Ollama contro vLLM per la gestione autonoma dei modelli LLM, e si aggiunge alla domanda più basilare trattata in se una VPS con una GPU valga davvero il costo.
Cosa verificare quando un rendering non riesce
Se il rendering si interrompe proprio alla fine, dopo il completamento della barra del sampler, il processo ha esaurito la memoria durante la decodifica VAE. Riduci il numero di fotogrammi oppure passa a un nodo di decodifica a blocchi. Modificare il numero di step non serve, perché la decodifica viene eseguita una sola volta, dopo il completamento di tutti gli step.
Un output completamente nero o fortemente corrotto indica in genere che il VAE non corrisponde al modello. Il caricamento di un VAE Wan 2.1 con un modello di diffusione Wan 2.2 produce esattamente questo risultato e nel log non viene visualizzato alcun errore.
Se il rendering viene eseguito ma richiede ore su una macchina che dispone sicuramente di una GPU, ComfyUI sta utilizzando il percorso CPU. Controlla nel log di avvio la riga relativa al dispositivo, quindi esegui nuovamente il controllo torch.cuda.is_available() precedente.
Se il processo scompare con Killed in dmesg e non viene visualizzato alcun traceback Python, la causa è l'oom killer del kernel. In questo caso è la RAM di sistema a essere esaurita, non la VRAM. L'offloading richiede che l'intero modello risieda nella RAM di sistema; quindi, su una macchina con 16 GB, l'offloading di un modello da 5B non dispone di memoria sufficiente. Aggiungi RAM oppure configura lo swap.
FAQ
Posso generare video con l'AI su un VPS senza GPU?
No, non in modo pratico per un uso ripetuto. Una clip di cinque secondi a 720p che richiede nove minuti su una GPU da 24 GB può richiedere molte ore su una CPU, perché il modello non dispone di hardware per le operazioni matriciali e la larghezza di banda della RAM di sistema è un ordine di grandezza inferiore a quella della memoria GPU. Un server CPU può ospitare l'interfaccia di ComfyUI, archiviare i modelli e conservare i workflow, ma il rendering richiede una GPU.
Quanta VRAM serve per Wan 2.2?
Per il modello TI2V-5B, 8 GB sono il minimo con l'offloading nativo di ComfyUI, mentre 24 GB sono la quantità raccomandata da Alibaba per ottenere la velocità pubblicata. Per i modelli A14B text-to-video e image-to-video, la scheda del modello richiede almeno 80 GB di VRAM per l'inferenza su una singola GPU; sono quindi necessarie schede per data center.
Quanto può durare una clip self-hosted?
A luglio 2026, l'unità pratica è di circa cinque secondi a 720p. Un output più lungo si ottiene generando segmenti e unendoli, usando l'ultimo frame di un segmento come primo frame del successivo. La qualità varia nei punti di giunzione; considera quindi un video lungo come un lavoro di montaggio, non come una singola generazione.
Noleggiare una GPU a ore costa meno che acquistare una scheda?
Il noleggio è più conveniente se il rendering dura meno di alcune ore al giorno. Al valore mediano di luglio 2026, pari a circa 0.36 dollari all'ora per una scheda da 24 GB, puoi noleggiare una GPU a lungo prima di raggiungere il prezzo di acquisto della scheda. Inoltre, eviti di acquistare hardware che potrebbe rivelarsi di una classe inadatta al modello che vuoi realmente utilizzare. L'acquisto conviene solo quando il server è occupato per gran parte della giornata, tutti i giorni.