SSD Nodes Learn 8GB RAM — $66/jaar
Gidsen Matt ConnorDoor Matt Connor · Bijgewerkt 2026-08-02

Zelfgehoste AI-videogenerator: wat werkt echt?

Ontdek wat Wan 2.2, HunyuanVideo en LTX-Video in juli 2026 produceren, hoeveel VRAM ze nodig hebben, wat 5 seconden op een GPU kost en wanneer een API beter past.

Wat een zelfgehoste AI-videogenerator daadwerkelijk kan

Een zelfgehoste AI-videogenerator werkt tegenwoordig, maar is trager en beperkter dan demovideo's suggereren. In juli 2026 zijn Wan 2.2 van Alibaba en HunyuanVideo van Tencent de open modellen die de moeite waard zijn om zelf te draaien. LTX-Video van Lightricks is een alternatief wanneer snelheid belangrijker is dan realisme. Ze draaien allemaal onder ComfyUI op een Linux-machine met een NVIDIA GPU. Het resultaat is een clip van ongeveer vijf seconden in 720p. Geen scène. Geen afgewerkte video van een minuut.

Hier volgt eerst het korte antwoord. Een kaart van 24 GB rendert een clip van vijf seconden in 720p binnen enkele minuten. Een kaart van 12 GB doet hetzelfde in twintig minuten of langer, omdat de gewichten niet in het videogeheugen passen en de software lagen voortdurend heen en weer verplaatst naar het systeem-RAM. Een server zonder GPU kan dit niet op een bruikbare manier uitvoeren. De berekeningen die CPU-gebaseerde beeldgeneratie traag maakten, maken CPU-gebaseerde videogeneratie zinloos.

Als u de hardwareladder voor een zelfgehoste beeldgenerator al hebt gelezen, dan is video hetzelfde argument, maar met elk getal één klasse hoger. VRAM (videogeheugen, het RAM dat naast de grafische chip op de kaart is gesoldeerd) is nog steeds de enige specificatie die bepaalt of dit prettig of frustrerend is.

Waarom één video zoveel meer kost dan één afbeelding

Een diffusiemodel genereert een afbeelding door deze stapsgewijs te ontruisen. Bij elke stap leest het model elk gewicht. Een videomodel doet hetzelfde met een heel blok frames tegelijk. Daarnaast gebruikt het aandacht over de tijd, zodat frame 80 weet hoe frame 12 eruitzag. Vijf seconden met 24 frames per seconde zijn 120 frames in één batch.

Die temporele aandacht zorgt ervoor dat de kosten niet evenredig met de clipduur toenemen. Als u het aantal frames verdubbelt, neemt het benodigde geheugen van de sampler met meer dan een factor 2 toe. Het probleem is dus niet dat het renderen langzamer wordt. De render mislukt.

Er ontstaat nog een tweede geheugentoename die vaak onverwacht is. Nadat de sampler klaar is, decodeert de VAE (variational autoencoder, het onderdeel dat de gecomprimeerde latent omzet in echte pixels) de volledige latent video in één keer. Voor dat decoderen kan meer geheugen nodig zijn dan voor het samplen. Het kenmerk is een taak die een voltooide voortgangsbalk toont en daarna dit afdrukt:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

De oplossing is tiled decoding of een kortere clip. Als u weet in welke fase het geheugen opraakte, voorkomt u dat u een uur lang de verkeerde instelling aanpast.

Hoeveel VRAM hebt u nodig voor AI-videogeneratie

Twee gepubliceerde cijfers bepalen de hele keuze, maar lijken elkaar tegen te spreken. Alibaba stelt dat het model Wan 2.2 TI2V-5B clips in 720p met 24 frames per seconde en een duur van vijf seconden in minder dan negen minuten genereert op één consumenten-GPU, zoals een 4090. Alibaba adviseert minimaal 24 GB VRAM. In de ComfyUI-documentatie staat dat hetzelfde 5B-model "should fit well on 8GB vram with the ComfyUI native offloading".

Beide cijfers kloppen, omdat ze verschillende zaken meten. 8 GB is voldoende om het model te laden. Met 24 GB werkt het comfortabel. Bij offloading blijft het grootste deel van het model in het systeem-RAM staan. De lagen worden voor elke stap naar de GPU gestreamd. Daardoor wacht de videokaart op de PCIe-bus in plaats van berekeningen uit te voeren. U betaalt die vertraging bij elke sampler-stap, niet slechts één keer.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

Alleen de laatste rij is een cijfer van de leverancier. De kaart met 24 GB verwerkt een clip in 9 minuten. Dat is het gepubliceerde cijfer van Alibaba voor dit model. De andere rijen tonen wat offloading daarmee doet. Het gaat om een orde-van-grootte en niet om benchmarkresultaten. Het belangrijkste is het patroon: 40 minuten op een kaart met 8 GB is technisch een werkende configuratie, maar praktisch een batchtaak die u 's nachts laat uitvoeren.

De grotere Wan 2.2-modellen vormen een heel andere categorie. Voor de A14B-varianten voor text-to-video en image-to-video is voor inferentie op één GPU minimaal 80 GB VRAM nodig. Dat is hardware voor datacenters en geen kaart die u in een desktop plaatst. Op dit punt betekent self-hosted in de praktijk dat u per uur de accelerator van iemand anders huurt.

Wat een clip kost op een gehuurde GPU

Huren is voor de meeste mensen de juiste manier om dit te testen. Een kaart die u koopt, is de verkeerde hardware als het model dat u uiteindelijk wilt gebruiken 80 GB nodig heeft. Mediane on-demandprijzen op de markt voor GPU-verhuur, vanaf juli 2026:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

De 4090-regel voert het 5B-model uit en kost ongeveer 0.05 dollar per clip bij 0.36 dollar per uur. De regels voor 80 GB voeren de 14B-modellen uit. Daarom stijgen de kosten per clip naar 0.6 dollar, ook al is de hardware zelf veel sneller. Een groter model vereist meer rekenkracht per seconde video.

Vijf cent per clip klinkt als weinig. Dat is juist het misleidende deel. Uw eerste bruikbare vijf seconden zijn nooit het resultaat van één render. Werken met een videomodel is een zoekproces. Twintig tot veertig renders voordat u een bruikbaar resultaat hebt, is normaal voor een shot met specifieke bewegingen. Een werksessie kost daarom dollars in plaats van centen. Een middag itereren op gehuurde hardware kost ongeveer evenveel als een lunch.

Twee details van verhuur kunnen u veel geld kosten als u ze mist. U betaalt terwijl de machine de gewichten downloadt. De bestanden van Wan 2.2, inclusief de tekstencoder en VAE, zijn samen tientallen gigabytes groot. Kies daarom een provider met een persistent volume en download de bestanden slechts één keer. U betaalt ook terwijl de machine niets doet en uw SSH-sessie openstaat. Stop de instance in plaats van alleen de terminal te sluiten.

ComfyUI installeren op de GPU-server

Begin met Ubuntu 24.04 en een reeds geïnstalleerd NVIDIA-stuurprogramma. Controleer eerst het stuurprogramma, omdat elke latere fout zonder deze controle hetzelfde lijkt.

nvidia-smi

Dit moet een tabel met uw kaart en een CUDA-versie weergeven. Als NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver wordt weergegeven, is de kernelmodule niet geladen. Dit gebeurt meestal na een kernelupgrade zonder herstart. Los dit hier op. ComfyUI valt anders terug op het CPU-pad, waardoor u ten onrechte het model de schuld geeft.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

Controleer of PyTorch de kaart ziet voordat u ook maar één gewichtsbestand downloadt.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True plus de naam van uw kaart betekent dat de stack correct werkt. False betekent dat de geïnstalleerde wheel een CPU-only-build is. Dit gebeurt wanneer pip een gecachte torch-versie van een eerdere installatie vindt. Installeer opnieuw met de bovenstaande index-URL.

De Wan 2.2-modelbestanden downloaden

ComfyUI wordt zonder gewichten geleverd, en een videomodel bestaat niet uit één bestand. Het bestaat uit een diffusiemodel, een tekstencoder en een VAE. Elk onderdeel hoort in een eigen map. Als u een bestand in de verkeerde map plaatst, vermeldt de loader-node het eenvoudigweg niet. Er verschijnt geen foutmelding die de oorzaak verklaart.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

Het 5B-model ondersteunt zowel text-to-video als image-to-video. Daarom is dit een logisch startpunt. Geef altijd de voorkeur aan .safetensors boven .ckpt. Een .ckpt-bestand is een gepickled Python-object. Bij het laden ervan wordt dus code uitgevoerd die is geschreven door degene die het bestand heeft gemaakt. Reserveer voldoende schijfruimte. Een werkende installatie met één modelfamilie en de uitvoer ervan vereist 100 GB. Videobestanden zijn veel groter dan de PNG-afbeeldingen die een image-workflow achterlaat. Maak back-ups van uw workflow-JSON-bestanden met bijvoorbeeld versleutelde incrementele back-ups naar objectopslag, omdat u de gewichten opnieuw kunt downloaden, maar uw aangepaste workflows niet.

Voer het uit en krijg er veilig toegang toe

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI heeft geen aanmeldscherm en geen gebruikersaccounts. Alles wat toegang heeft tot poort 8188 kan taken in de wachtrij plaatsen, elke clip lezen die u hebt gegenereerd en aangepaste nodes installeren. Daarmee kan willekeurige code op uw server worden uitgevoerd. Laat ComfyUI aan localhost binden en gebruik een SSH-tunnel vanaf uw eigen machine om er toegang toe te krijgen.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

Open vervolgens http://127.0.0.1:8188 in uw browser. Laad de Wan 2.2-templateworkflow via het menu met ComfyUI-templates, in plaats van de nodes handmatig te verbinden. De officiële templates bevatten de samplerinstellingen waarvoor het model is afgestemd. Een videoworkflow bevat bovendien veel meer plekken waar ongemerkt een verkeerde waarde kan worden ingesteld dan een imageworkflow.

Wanneer het juiste antwoord is om een API te gebruiken

Video's zelf hosten is de juiste keuze wanneer het volume hoog en constant is, wanneer uw frames uw eigen infrastructuur niet mogen verlaten, of wanneer u een specifiek model of een aangepaste adapter nodig hebt die geen enkele gehoste service aanbiedt. Het is ook de juiste keuze wanneer de pipeline over een jaar nog op dezelfde manier moet werken, omdat een gehost model zonder versie die u kunt vastzetten kan veranderen.

Gebruik een gehoste API wanneer u enkele clips per maand nodig hebt, wanneer u uitvoer nodig hebt die langer of groter is dan wat open modellen produceren, of wanneer u deze week een deadline hebt. Bereken het omslagpunt eerlijk. Een 24 GB-kaart die u 24 uur per dag huurt tegen de mediaanprijs van juli 2026 kost ongeveer 260 dollar per maand. Dezelfde kaart kopen kost vooraf meer dan dat, voordat u ook maar één frame hebt gegenereerd. Een inactieve zelfgehoste machine is qua kosten per clip altijd duurder dan een API. Dit is dezelfde afweging die bepaalt hoe u tekstmodellen aanbiedt, zoals beschreven in Ollama tegenover vLLM voor het aanbieden van zelfgehoste LLM's, en deze afweging volgt op de fundamentelere vraag in of een VPS met een GPU het geld überhaupt waard is.

Wat u moet controleren als een render mislukt

Een render die helemaal aan het einde stopt, nadat de sampler-balk is voltooid, heeft tijdens het decoderen in de VAE onvoldoende geheugen. Verlaag het aantal frames of schakel over naar een node voor tiled decoding. Het aanpassen van het aantal stappen helpt niet, omdat het decoderen één keer plaatsvindt nadat alle stappen al zijn uitgevoerd.

Uitvoer die volledig zwart of sterk vervormd is, betekent meestal dat de VAE niet overeenkomt met het model. Een Wan 2.1 VAE die tegen een Wan 2.2 diffusion model wordt geladen, veroorzaakt precies dit. In het logboek verschijnt daarbij geen foutmelding.

Een render die wel wordt uitgevoerd maar uren duurt op een machine waarvan u weet dat deze een GPU heeft, betekent dat ComfyUI het CPU-pad gebruikt. Controleer de apparaatregel in het opstartlogboek en voer daarna de bovenstaande controle torch.cuda.is_available() opnieuw uit.

Als het proces verdwijnt met Killed in dmesg en er geen Python-traceback verschijnt, is dit de out-of-memory-killer van de kernel. Het probleem betreft dan het systeemgeheugen en niet het VRAM. Bij offloading moet het volledige model in het systeemgeheugen passen. Een systeem met 16 GB dat een model van 5B offloadt, heeft daarom onvoldoende geheugen. Voeg RAM toe of voeg swap toe.

FAQ

Kan ik AI-video genereren op een VPS zonder GPU?

Nee, niet op een manier die u vaker dan twee keer zou gebruiken. Een clip van vijf seconden in 720p waarvoor een GPU van 24 GB negen minuten nodig heeft, duurt op een CPU vele uren. Dat komt doordat het model geen matrixhardware heeft waarop het kan worden uitgevoerd en de bandbreedte van het systeemgeheugen een orde van grootte lager ligt dan de geheugenbandbreedte van een GPU. Een CPU-server kan de ComfyUI-interface hosten, uw modellen opslaan en uw workflows bevatten, maar voor het renderen zelf is een GPU nodig.

Hoeveel VRAM heb ik nodig voor Wan 2.2?

Voor het TI2V-5B-model is 8 GB het minimum met native offloading in ComfyUI. Voor de gepubliceerde snelheid raadt Alibaba 24 GB aan. Voor de A14B-modellen voor text-to-video en image-to-video vermeldt de modelkaart minimaal 80 GB VRAM voor inferentie op één GPU. Daarvoor zijn dus datacenterkaarten nodig.

Hoe lang kan een zelf gehoste clip zijn?

Ongeveer vijf seconden in 720p is in juli 2026 de praktische eenheid. Een langere uitvoer maakt u door segmenten te genereren en samen te voegen. Daarbij gebruikt u het laatste frame van het ene segment als het eerste frame van het volgende segment. De kwaliteit verandert bij de overgangen. Beschouw een lange video daarom als een montageopdracht en niet als één generatie.

Is een GPU per uur huren goedkoper dan een kaart kopen?

Huren is voordeliger als u minder dan enkele uren per dag rendert. Bij de mediaan van ongeveer 0.36 dollar per uur voor een kaart van 24 GB in juli 2026 kunt u lange tijd huren voordat de huurprijs gelijk is aan de aanschafprijs van die kaart. Bovendien voorkomt u dat u hardware koopt die niet geschikt blijkt voor de modelklasse die u daadwerkelijk wilt gebruiken. Kopen is alleen voordeliger als de machine elke dag vrijwel de hele dag wordt gebruikt.

#ai-video#comfyui#gpu#self-hosting#wan#vram