SSD Nodes Learn Hosting plans →
Guides Matt ConnorPar Matt Connor · Mis à jour le 2026-08-13

Générateur vidéo IA auto-hébergé : que vaut-il vraiment ?

En juillet 2026, comparez Wan 2.2, HunyuanVideo et LTX-Video : VRAM requise, durée réelle pour un clip 720p de 5 secondes et coût sur GPU loué.

Ce qu’un générateur vidéo IA auto-hébergé peut réellement faire

Un générateur vidéo IA auto-hébergé fonctionne aujourd’hui, mais il est plus lent et plus limité que ne le suggèrent les vidéos de démonstration. En juillet 2026, les modèles open source qui méritent d’être exécutés sont Wan 2.2 d’Alibaba et HunyuanVideo de Tencent, ainsi que LTX-Video de Lightricks lorsque la vitesse compte davantage que le réalisme. Ils fonctionnent tous avec ComfyUI sur une machine Linux équipée d’un GPU NVIDIA. Le résultat est un clip d’environ cinq secondes en 720p. Pas une scène complète. Pas une minute de vidéo finalisée.

Voici la réponse courte avant les détails. Une carte de 24 GB génère un clip de cinq secondes en 720p en quelques minutes. Une carte de 12 GB effectue la même opération en vingt minutes ou plus, car les poids ne tiennent pas dans la mémoire vidéo et le logiciel transfère constamment des couches entre celle-ci et la RAM système. Un serveur sans GPU ne peut pas faire cela dans des conditions réellement utiles. Les calculs qui rendaient la génération d’images sur CPU lente rendent la génération vidéo sur CPU inutile.

Si vous avez déjà lu la configuration matérielle d’un générateur d’images auto-hébergé, la vidéo reprend le même raisonnement, avec chaque valeur déplacée d’une catégorie vers le haut. La VRAM (mémoire vidéo, la RAM soudée à côté de la puce graphique) reste la seule caractéristique qui détermine si l’expérience sera agréable ou pénible.

Pourquoi une vidéo coûte beaucoup plus cher qu’une image

Un modèle de diffusion génère une image en la débruitant par étapes. À chaque étape, il lit tous les poids du modèle. Un modèle vidéo fait la même chose sur un bloc complet d’images à la fois. Il ajoute aussi une attention temporelle, afin que l’image 80 sache à quoi ressemblait l’image 12. Cinq secondes à 24 images par seconde représentent 120 images dans un seul batch.

Cette attention temporelle explique pourquoi le coût n’augmente pas simplement avec la durée du clip. Doubler le nombre d’images fait plus que doubler la mémoire nécessaire au sampler. Le problème n’est donc pas un rendu plus lent. Le rendu s’arrête.

Il y a un deuxième pic de consommation mémoire auquel on ne s’attend pas toujours. Une fois le sampler terminé, le VAE (variational autoencoder, le composant qui transforme le latent compressé en pixels réels) décode toute la vidéo latente en une seule fois. Ce décodage peut nécessiter plus de mémoire que le sampling. Le symptôme est un job qui affiche une barre de progression terminée, puis ce message :

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

La solution consiste à utiliser un décodage par tuiles ou un clip plus court. Savoir à quelle étape la mémoire est épuisée vous évite de régler le mauvais paramètre pendant une heure.

Quelle quantité de VRAM faut-il pour générer des vidéos avec l’IA

Deux chiffres publiés permettent de cadrer toute la décision, mais ils semblent se contredire. Alibaba indique que le modèle Wan 2.2 TI2V-5B produit des clips en 720p à 24 images par seconde, d’une durée de cinq secondes, en moins de neuf minutes sur un seul GPU grand public comme une 4090. Alibaba recommande au moins 24 GB de VRAM. La documentation de ComfyUI indique que le même modèle 5B « devrait fonctionner correctement avec 8GB de VRAM grâce à l’offloading natif de ComfyUI ».

Ces deux affirmations sont exactes, car elles mesurent des choses différentes. 8 GB suffisent pour le faire fonctionner. 24 GB offrent une exécution confortable. L’offloading consiste à conserver la majeure partie du modèle dans la RAM système et à transférer les layers vers le GPU à chaque étape. La carte passe alors son temps à attendre le bus PCIe au lieu d’effectuer les calculs. Ce coût s’applique à chaque étape du sampler, et pas une seule fois.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

Seule la dernière ligne correspond à une donnée du fournisseur. La carte de 24 GB produit un clip en 9 minutes, soit la valeur publiée par Alibaba pour ce modèle. Les autres lignes montrent l’effet de l’offloading. Il s’agit d’ordres de grandeur, et non de résultats de benchmark. L’évolution est le point important : 40 minutes sur une carte de 8 GB constituent une configuration qui fonctionne techniquement, mais qui revient en pratique à lancer un batch pendant la nuit.

Les modèles Wan 2.2 plus volumineux appartiennent à une autre catégorie. Les variantes A14B de text-to-video et d’image-to-video nécessitent au moins 80 GB de VRAM pour l’inférence sur un seul GPU. Il s’agit de matériel de data center, pas d’une carte que vous installez dans une machine de bureau. C’est aussi le point où l’auto-hébergement commence à signifier que vous louez l’accélérateur de quelqu’un d’autre à l’heure. Le même calcul va encore plus loin pour le texte : auto-héberger un modèle de 2,8 billions de paramètres comme Kimi K3 n’est plus une question de carte unique, mais de nombre de cartes de 80 GB que vous pouvez vous permettre de relier.

Ce que coûte un clip sur un GPU loué

La location est la meilleure façon de tester ce type de modèle pour la plupart des utilisateurs, car une carte achetée peut ne pas convenir si le modèle retenu nécessite 80 GB. Prix médians à la demande sur le marché de la location de GPU, en juillet 2026 :

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

La ligne correspondant à la 4090 exécute le modèle 5B et coûte environ 0.05 dollars par clip, au tarif de 0.36 dollars par heure. Les lignes avec 80 GB exécutent les modèles 14B. C’est pourquoi leur coût par clip atteint 0.6 dollars, même si le matériel est beaucoup plus rapide. Un modèle plus grand nécessite davantage de calcul pour chaque seconde de vidéo.

Cinq centimes par clip semblent négligeables. C’est justement ce qui peut induire en erreur. Vos cinq premières secondes utilisables ne proviennent jamais d’un seul rendu. Le prompting d’un modèle vidéo consiste à explorer plusieurs résultats. Pour un plan avec un mouvement précis, il est normal de produire vingt à quarante rendus avant d’en retenir un. Une session de travail coûte donc des dollars plutôt que des centimes. Un après-midi d’itérations sur du matériel loué coûte à peu près le prix d’un déjeuner.

Deux détails liés à la location peuvent entraîner des frais importants si vous les oubliez. La facturation continue pendant le téléchargement des weights. Les fichiers Wan 2.2, avec leur text encoder et leur VAE, occupent plusieurs dizaines de gigaoctets. Choisissez donc un fournisseur proposant un persistent volume et ne téléchargez les fichiers qu’une seule fois. La facturation continue également lorsque la machine reste inactive avec votre session SSH ouverte. Arrêtez l’instance au lieu de simplement fermer le terminal.

Installer ComfyUI sur le serveur GPU

Partez d’Ubuntu 24.04 avec le pilote NVIDIA déjà installé. Vérifiez d’abord le pilote, car toutes les erreurs suivantes se ressemblent sans ce contrôle.

nvidia-smi

Cette commande doit afficher un tableau contenant votre carte et une version de CUDA. Si elle affiche NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, le module du noyau n’est pas chargé. Cela se produit généralement après une mise à niveau du noyau sans redémarrage. Corrigez le problème maintenant. Sinon, ComfyUI basculera sur le traitement par le CPU et vous passerez une heure à accuser le modèle.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

Vérifiez que PyTorch détecte la carte avant de télécharger le moindre fichier de poids.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True suivi du nom de votre carte signifie que la pile fonctionne correctement. False signifie que le wheel installé est la version CPU-only. Cela se produit lorsque pip trouve une version de torch en cache provenant d’une installation précédente. Réinstallez-la avec l’URL d’index ci-dessus.

Télécharger les fichiers du modèle Wan 2.2

ComfyUI ne fournit aucun poids, et un modèle vidéo ne tient pas dans un seul fichier. Il comprend un modèle de diffusion, un encodeur de texte et un VAE. Chacun va dans son propre répertoire. Si vous placez un fichier dans le mauvais dossier, le nœud loader ne l’affichera tout simplement pas, sans indiquer la raison de cette absence.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

Le modèle 5B gère à la fois la génération de texte vers vidéo et d’image vers vidéo. C’est pourquoi il constitue le meilleur point de départ. Préférez toujours .safetensors à .ckpt. Un fichier .ckpt contient un objet Python sérialisé avec pickle. Son chargement exécute donc du code écrit par la personne qui l’a créé. Prévoyez suffisamment d’espace disque : une installation fonctionnelle avec une famille de modèles et ses sorties nécessite 100 GB. Les fichiers vidéo sont beaucoup plus volumineux que les images PNG générées par un workflow d’image. Sauvegardez vos fichiers JSON de workflow avec, par exemple, des sauvegardes incrémentielles chiffrées vers un stockage objet, car les poids peuvent être téléchargés à nouveau, contrairement à vos workflows configurés.

Lancer le service et y accéder en toute sécurité

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI n’a ni écran de connexion ni comptes utilisateur. Toute personne pouvant atteindre le port 8188 peut mettre des tâches en file d’attente, lire tous les clips que vous avez générés et installer des custom nodes, ce qui permet l’exécution de code arbitraire sur votre serveur. Liez le service à localhost et accédez-y depuis votre propre machine via un tunnel SSH.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

Ouvrez ensuite http://127.0.0.1:8188 dans votre navigateur. Chargez le workflow modèle Wan 2.2 depuis le menu des templates de ComfyUI au lieu de relier les nodes manuellement. Les templates officiels contiennent les paramètres du sampler pour lesquels le modèle a été réglé, et un workflow vidéo offre beaucoup plus de possibilités de définir une valeur incorrecte sans s’en rendre compte qu’un workflow d’image.

Quand la réponse honnête est d’utiliser une API

L’auto-hébergement de la génération vidéo est le bon choix lorsque le volume est élevé et régulier, lorsque vos frames ne doivent pas quitter votre propre infrastructure, ou lorsque vous avez besoin d’un modèle précis ou d’un adapter personnalisé qu’aucun service hébergé ne propose. C’est également le bon choix lorsque le pipeline doit fonctionner de la même manière dans un an, car un modèle hébergé peut changer sans vous laisser de version à figer.

Utilisez une API hébergée lorsque vous avez besoin de quelques clips par mois, lorsque vous avez besoin d’une sortie plus longue ou de meilleure résolution que celle produite par les modèles open source, ou lorsque vous avez une échéance cette semaine. Calculez honnêtement le seuil de rentabilité. Une carte de 24 GB louée 24 h/24 au tarif médian de juillet 2026 coûte environ 260 dollars par mois, et l’achat de la même carte coûte davantage dès le départ, avant même d’avoir généré une seule frame. Une machine auto-hébergée inactive est toujours moins avantageuse que la facturation à l’API par clip. C’est le même compromis que celui qui détermine la manière de servir les modèles de texte, présenté dans Ollama contre vLLM pour servir des LLM auto-hébergés, et cela vient après la question plus fondamentale de savoir si un VPS avec un GPU vaut réellement son prix.

Que vérifier lorsqu’un rendu échoue

Un rendu qui s’arrête tout à la fin, après la fin de la barre du sampler, a épuisé la mémoire pendant le décodage du VAE. Réduisez le nombre d’images ou utilisez un nœud de décodage par tuiles. Modifier le nombre d’étapes ne changera rien, car le décodage n’a lieu qu’une seule fois, après l’exécution de toutes les étapes.

Une sortie entièrement noire ou fortement brouillée indique généralement que le VAE ne correspond pas au modèle. Charger un VAE Wan 2.1 avec un modèle de diffusion Wan 2.2 produit exactement ce résultat, sans qu’aucune erreur n’apparaisse dans le log.

Un rendu qui s’exécute, mais prend plusieurs heures sur une machine dont vous savez qu’elle possède un GPU, indique que ComfyUI utilise le chemin CPU. Vérifiez la ligne du périphérique dans le log de démarrage, puis relancez la vérification torch.cuda.is_available() ci-dessus.

La disparition du processus avec Killed dans dmesg, sans traceback Python, indique que le kernel a déclenché l’oom killer. Il s’agit donc de la RAM système, pas de la VRAM. L’offloading nécessite que le modèle complet soit chargé en RAM système. Une machine de 16 GB qui effectue l’offloading d’un modèle 5B manque donc de mémoire. Ajoutez de la RAM ou du swap.

FAQ

Est-il possible de générer des vidéos avec une IA sur un VPS sans GPU ?

Non, pas dans des conditions que vous accepteriez d’utiliser plus d’une fois. Un clip 720p de cinq secondes qui prend neuf minutes sur un GPU de 24 GB peut nécessiter plusieurs heures sur un CPU. Le modèle ne dispose d’aucun matériel matriciel pour s’exécuter, et la bande passante de la RAM système est d’un ordre de grandeur inférieure à celle de la mémoire du GPU. Un serveur CPU peut héberger l’interface ComfyUI, stocker vos modèles et conserver vos workflows, mais le rendu lui-même nécessite un GPU.

De combien de VRAM ai-je besoin pour Wan 2.2 ?

Pour le modèle TI2V-5B, 8 GB est le minimum avec l’offloading natif de ComfyUI, et 24 GB est la capacité recommandée par Alibaba pour atteindre la vitesse publiée. Pour les modèles texte-vers-vidéo et image-vers-vidéo A14B, la fiche du modèle demande au moins 80 GB de VRAM pour l’inférence sur un seul GPU. Ces modèles nécessitent donc des cartes de data center.

Quelle peut être la durée d’un clip auto-hébergé ?

En juillet 2026, environ cinq secondes en 720p constituent l’unité pratique. Pour produire une sortie plus longue, générez plusieurs segments et assemblez-les en utilisant la dernière image d’un segment comme première image du suivant. La qualité dérive au niveau des raccords. Considérez donc une longue vidéo comme un travail de montage plutôt que comme une seule génération.

Louer un GPU à l’heure coûte-t-il moins cher qu’acheter une carte ?

La location est plus avantageuse si vous effectuez moins de quelques heures de rendu par jour. Avec un tarif médian, en juillet 2026, d’environ 0.36 dollar par heure pour une carte de 24 GB, vous pouvez louer pendant longtemps avant d’atteindre le prix d’achat de cette carte. Vous évitez aussi d’acheter un matériel qui s’avère ensuite inadapté à la catégorie du modèle que vous souhaitez réellement utiliser. L’achat devient avantageux uniquement lorsque la machine est utilisée presque toute la journée, tous les jours.