Générateur vidéo IA auto-hébergé : que vaut-il vraiment ?
En juillet 2026, comparez Wan 2.2, HunyuanVideo et LTX-Video : VRAM requise, coût d’un clip 720p de 5 secondes sur GPU loué et limites face à une API.
Ce qu’un générateur vidéo IA auto-hébergé peut réellement faire
Un générateur vidéo IA auto-hébergé fonctionne aujourd’hui, mais il est plus lent et plus limité que ne le laissent penser les vidéos de démonstration. En juillet 2026, les modèles open source qui méritent d’être exécutés sont Wan 2.2 d’Alibaba et HunyuanVideo de Tencent, ainsi que LTX-Video de Lightricks lorsque la vitesse compte davantage que le réalisme. Ils fonctionnent tous avec ComfyUI sur une machine Linux équipée d’un GPU NVIDIA. Le résultat est un clip d’environ cinq secondes en 720p. Pas une scène. Pas une minute de séquence finalisée.
Voici la réponse courte avant les détails. Une carte de 24 GB génère un clip de cinq secondes en 720p en quelques minutes. Une carte de 12 GB effectue le même travail en vingt minutes ou plus, car les poids ne tiennent pas dans la mémoire vidéo et le logiciel transfère constamment des couches entre la mémoire vidéo et la RAM système. Un serveur sans GPU ne peut pas effectuer cette tâche dans des conditions utiles. Les calculs qui rendaient la génération d’images sur CPU lente rendent la génération vidéo sur CPU inutile.
Si vous avez déjà lu la hiérarchie matérielle pour un générateur d’images auto-hébergé, la vidéo reprend le même raisonnement, avec chaque valeur déplacée d’une catégorie vers le haut. La VRAM (mémoire vidéo, la RAM soudée à côté de la puce graphique) reste la seule caractéristique qui détermine si l’expérience est agréable ou pénible.
Pourquoi une vidéo coûte beaucoup plus cher qu’une image
Un modèle de diffusion génère une image en la débruitant par étapes. À chaque étape, il lit tous les poids du modèle. Un modèle vidéo fait la même chose sur un bloc complet d’images à la fois. Il ajoute aussi une attention temporelle, afin que l’image 80 sache à quoi ressemblait l’image 12. Cinq secondes à 24 images par seconde représentent 120 images dans un seul batch.
Cette attention temporelle explique pourquoi le coût n’augmente pas proportionnellement à la durée du clip. Si vous doublez le nombre d’images, la mémoire nécessaire au sampler augmente de plus du double. Le problème n’est donc pas un rendu plus lent. Le rendu échoue.
Un deuxième pic de consommation mémoire est souvent inattendu. Une fois le sampler terminé, le VAE (variational autoencoder, le composant qui transforme le latent compressé en pixels réels) décode toute la vidéo latente en une seule fois. Ce décodage peut nécessiter plus de mémoire que le sampling. Le symptôme est un job qui affiche une barre de progression terminée, puis affiche ceci :
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiBLa solution consiste à utiliser le tiled decoding ou à réduire la durée du clip. En sachant à quelle étape la mémoire est épuisée, vous évitez de régler le mauvais paramètre pendant une heure.
De quelle quantité de VRAM avez-vous besoin pour générer des vidéos avec l'IA
Deux chiffres publiés encadrent toute la décision, mais semblent se contredire. Alibaba indique que le modèle Wan 2.2 TI2V-5B produit des clips en 720p à 24 images par seconde, d'une durée de cinq secondes, en moins de neuf minutes sur un seul GPU grand public comme une 4090, et recommande au moins 24 GB de VRAM. La documentation de ComfyUI indique que le même modèle 5B « devrait tenir correctement sur 8GB de VRAM avec le native offloading de ComfyUI ».
Les deux chiffres sont exacts, car ils ne mesurent pas la même chose. 8 GB est la quantité nécessaire pour le faire tenir. 24 GB est la quantité nécessaire pour l'utiliser confortablement. L'offloading consiste à conserver la majeure partie du modèle dans la RAM système et à transférer les layers vers le GPU à chaque étape. La carte passe alors son temps à attendre le bus PCIe au lieu d'effectuer des calculs. Ce coût est payé à chaque étape du sampler, et non une seule fois.
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]Seule la dernière ligne correspond à un chiffre fourni par le constructeur. La carte de 24 GB produit un clip en 9 minutes, ce qui correspond au chiffre publié par Alibaba pour ce modèle. Les autres lignes montrent l'effet de l'offloading. Il s'agit d'ordres de grandeur, et non de résultats de benchmark. L'essentiel est la tendance : 40 minutes sur une carte de 8 GB constituent une configuration qui fonctionne techniquement, mais qui revient en pratique à lancer un traitement par lots à laisser tourner toute la nuit.
Les modèles Wan 2.2 plus volumineux appartiennent à une autre catégorie. Les variantes A14B de text-to-video et d'image-to-video nécessitent au moins 80 GB de VRAM pour une inférence sur un seul GPU. Il s'agit de matériel de data center, et non d'une carte installée dans une machine de bureau. À ce stade, l'auto-hébergement signifie généralement louer l'accélérateur de quelqu'un d'autre à l'heure.
Combien coûte un clip sur un GPU loué
La location est la meilleure option pour la plupart des utilisateurs qui veulent tester ce système. Une carte que vous achetez peut ne pas convenir si le modèle que vous choisissez finalement nécessite 80 GB. Prix médians à la demande sur le marché de la location de GPU, en juillet 2026 :
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]La ligne 4090 exécute le modèle 5B et coûte environ 0.05 dollars par clip, à 0.36 dollars de l’heure. Les lignes 80 GB exécutent les modèles 14B. C’est pourquoi leur coût par clip atteint 0.6 dollars, même si leur matériel est beaucoup plus rapide. Un modèle plus grand nécessite davantage de calcul par seconde de vidéo.
Cinq cents par clip peuvent sembler négligeables. C’est là que l’estimation devient trompeuse. Vos cinq premières secondes utilisables ne proviennent jamais d’un seul rendu. Le prompting d’un modèle vidéo est une recherche. Pour un plan avec un mouvement précis, il est normal de produire vingt à quarante rendus avant d’en obtenir un exploitable. Une session de travail coûte donc des dollars plutôt que des centimes. Une après-midi d’itérations sur du matériel loué coûte environ le prix d’un déjeuner.
Deux détails liés à la location peuvent vous coûter cher si vous les oubliez. La facturation continue pendant le téléchargement des poids du modèle. Les fichiers de Wan 2.2, avec leur text encoder et leur VAE, occupent plusieurs dizaines de gigaoctets. Choisissez donc un fournisseur proposant un volume persistant et ne téléchargez les fichiers qu’une seule fois. La facturation continue également lorsque la machine reste inactive avec votre session SSH ouverte. Arrêtez l’instance au lieu de fermer simplement le terminal.
Installer ComfyUI sur le serveur GPU
Partez d’Ubuntu 24.04 avec le pilote NVIDIA déjà installé. Vérifiez d’abord le pilote, car sans ce contrôle, toutes les erreurs suivantes se ressemblent.
nvidia-smiCette commande doit afficher un tableau contenant votre carte et une version de CUDA. Si elle affiche NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, le module du noyau n’est pas chargé. Cela se produit généralement après une mise à niveau du noyau sans redémarrage. Corrigez le problème à ce stade. Sinon, ComfyUI utilisera le chemin CPU et vous perdrez une heure à accuser le modèle.
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txtVérifiez que PyTorch détecte la carte avant de télécharger le moindre fichier de poids.
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"True suivi du nom de votre carte indique que la pile fonctionne correctement. False signifie que le wheel installé est la version CPU uniquement. Cela se produit lorsque pip trouve un torch en cache provenant d’une installation précédente. Réinstallez-le avec l’URL d’index ci-dessus.
Télécharger les fichiers du modèle Wan 2.2
ComfyUI ne fournit aucun poids, et un modèle vidéo ne tient pas dans un seul fichier. Il comprend un modèle de diffusion, un encodeur de texte et un VAE. Chacun doit être placé dans son propre répertoire. Si vous placez un fichier dans le mauvais dossier, le nœud de chargement ne l’affiche tout simplement pas, sans fournir d’erreur pour expliquer pourquoi.
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensorsLe modèle 5B prend en charge la génération de texte vers vidéo et d’image vers vidéo. C’est pourquoi il constitue le meilleur point de départ. Préférez toujours .safetensors à .ckpt. Un fichier .ckpt est un objet Python sérialisé avec pickle. Son chargement exécute donc du code écrit par la personne qui l’a créé. Prévoyez suffisamment d’espace disque : une installation fonctionnelle avec une famille de modèles et ses sorties nécessite 100 GB. Les fichiers vidéo sont beaucoup plus volumineux que les images PNG produites par un workflow d’image. Sauvegardez vos fichiers JSON de workflow avec, par exemple, des sauvegardes incrémentielles chiffrées vers un stockage objet, car les poids peuvent être téléchargés à nouveau, contrairement à vos workflows configurés.
Exécutez-le et accédez-y en toute sécurité
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188ComfyUI n’a ni écran de connexion ni comptes utilisateur. Toute machine capable d’accéder au port 8188 peut mettre des tâches en file d’attente, lire tous les clips que vous avez générés et installer des custom nodes, ce qui permet l’exécution de code arbitraire sur votre serveur. Liez-le à localhost et accédez-y via un tunnel SSH depuis votre propre machine.
ssh -N -L 8188:127.0.0.1:8188 you@your-serverOuvrez ensuite http://127.0.0.1:8188 dans votre navigateur. Chargez le workflow modèle Wan 2.2 depuis le menu des modèles de ComfyUI au lieu de relier les nodes manuellement. Les modèles officiels contiennent les paramètres du sampler pour lesquels le modèle a été réglé. Un workflow vidéo offre beaucoup plus de possibilités de définir silencieusement une valeur incorrecte qu’un workflow d’image.
Quand la réponse honnête consiste à utiliser une API
L’auto-hébergement de la génération vidéo est le bon choix lorsque le volume est élevé et régulier, lorsque vos frames ne doivent pas quitter votre propre infrastructure, ou lorsque vous avez besoin d’un modèle précis ou d’un adapter personnalisé qu’aucun service hébergé ne propose. C’est également le bon choix lorsque le pipeline doit fonctionner de la même manière dans un an, car un modèle hébergé peut évoluer sans que vous puissiez en verrouiller la version.
Utilisez une API hébergée lorsque vous avez besoin de quelques clips par mois, lorsque vous avez besoin d’une sortie plus longue ou plus grande que celle produite par les modèles open source, ou lorsque vous avez une échéance cette semaine. Calculez honnêtement le seuil de rentabilité. Une carte de 24 GB louée 24 heures sur 24 au tarif médian de juillet 2026 coûte environ 260 dollars par mois, tandis que l’achat de la même carte coûte davantage à l’avance, avant même d’avoir généré une seule frame. Une machine auto-hébergée inactive est toujours moins avantageuse que la tarification par clip d’une API. C’est le même compromis que celui qui détermine la manière dont vous servez les modèles de texte, expliqué dans Ollama contre vLLM pour servir des LLM auto-hébergés, et il s’ajoute à la question plus fondamentale de savoir si un VPS avec un GPU vaut réellement son coût.
Vérifications à effectuer lorsqu’un rendu échoue
Un rendu qui s’arrête tout à la fin, après la fin de la barre du sampler, a épuisé la mémoire pendant le décodage du VAE. Réduisez le nombre d’images ou utilisez un nœud de décodage par tuiles. Modifier le nombre d’étapes ne changera rien, car le décodage est effectué une seule fois, après l’exécution de toutes les étapes.
Une sortie entièrement noire ou fortement brouillée indique généralement que le VAE ne correspond pas au modèle. Charger un VAE Wan 2.1 avec un modèle de diffusion Wan 2.2 produit exactement ce résultat, sans qu’aucune erreur n’apparaisse dans le log.
Un rendu qui s’exécute, mais prend des heures sur une machine dont vous savez qu’elle possède un GPU, indique que ComfyUI utilise le chemin CPU. Vérifiez la ligne du périphérique dans le log de démarrage, puis exécutez à nouveau le contrôle torch.cuda.is_available() ci-dessus.
La disparition du processus avec Killed dans dmesg et sans traceback Python est due au kernel out-of-memory killer. Il s’agit donc de la RAM système, et non de la VRAM. L’offloading nécessite que le modèle complet soit présent en RAM système. Une machine de 16 GB qui effectue l’offloading d’un modèle 5B manque donc de mémoire. Ajoutez de la RAM ou du swap.
FAQ
Puis-je générer des vidéos avec l’IA sur un VPS sans GPU ?
Non, pas dans des conditions utilisables régulièrement. Un clip de cinq secondes en 720p qui demande neuf minutes sur un GPU de 24 GB prend plusieurs heures sur un CPU. Le modèle ne dispose d’aucun matériel matriciel pour exécuter les calculs, et la bande passante de la RAM système est inférieure d’un ordre de grandeur à celle de la mémoire GPU. Un serveur CPU peut héberger l’interface ComfyUI, stocker vos modèles et conserver vos workflows. En revanche, le rendu lui-même nécessite un GPU.
De combien de VRAM ai-je besoin pour Wan 2.2 ?
Pour le modèle TI2V-5B, 8 GB est le minimum avec l’offloading natif de ComfyUI. 24 GB est la capacité recommandée par Alibaba pour atteindre la vitesse publiée. Pour les modèles text-to-video et image-to-video A14B, la fiche du modèle demande au moins 80 GB de VRAM pour l’inférence sur un seul GPU. Ces modèles nécessitent donc des cartes destinées aux data centers.
Quelle peut être la durée d’un clip auto-hébergé ?
En juillet 2026, l’unité pratique est d’environ cinq secondes en 720p. Pour obtenir une sortie plus longue, générez plusieurs segments et assemblez-les. Utilisez la dernière image d’un segment comme première image du suivant. La qualité peut varier au niveau des raccords. Considérez donc une longue vidéo comme un travail de montage plutôt que comme une seule génération.
Louer un GPU à l’heure coûte-t-il moins cher que d’acheter une carte ?
La location est plus avantageuse si le rendu dure moins de quelques heures par jour. Au tarif médian de juillet 2026, d’environ 0.36 dollar par heure pour une carte de 24 GB, vous pouvez louer longtemps avant d’atteindre le prix d’achat de cette carte. Vous évitez aussi d’acheter un matériel qui s’avère inadapté à la catégorie du modèle que vous souhaitez réellement utiliser. L’achat devient avantageux uniquement lorsque la machine est utilisée presque toute la journée, tous les jours.