SSD Nodes Learn Hosting plans →
Gidsen Matt ConnorDoor Matt Connor · Bijgewerkt 2026-08-13

Self-hosted AI videogenerator: wat is de realiteit?

Ontdek wat open modellen zoals Wan 2.2 en HunyuanVideo in 2026 echt presteren. Wij vergelijken VRAM-eisen, de kosten per 5 seconden op een GPU en wanneer een API beter is.

Wat een self-hosted AI-videogenerator daadwerkelijk kan

Een self-hosted AI-videogenerator werkt vandaag de dag, al is deze trager en beperkter dan de demonstratievideo's doen vermoeden. Sinds juli 2026 zijn de open modellen die het draaien waard zijn Wan 2.2 van Alibaba en HunyuanVideo van Tencent, aangevuld met LTX-Video van Lightricks wanneer snelheid belangrijker is dan realisme. Ze draaien allemaal onder ComfyUI op een Linux-machine met een NVIDIA GPU. Het resultaat is een clip van ongeveer vijf seconden op 720p. Geen scène. Geen minuut aan afgewerkt beeldmateriaal.

Hier is het korte antwoord voorafgaand aan de details. Een kaart met 24 GB VRAM rendert een clip van vijf seconden op 720p in enkele minuten. Een kaart met 12 GB doet over dezelfde taak twintig minuten of langer, omdat de gewichten niet in het videogeheugen passen en de software voortdurend lagen verplaatst tussen het videogeheugen en het systeem-RAM. Een server zonder GPU kan dit niet op een zinvolle manier uitvoeren. De rekenkracht die CPU-gebaseerde beeldgeneratie traag maakte, maakt CPU-gebaseerde videogeneratie zinloos.

Als u de hardwareladder voor een self-hosted beeldgenerator al heeft gelezen: voor video geldt hetzelfde argument, waarbij elke specificatie één klasse hoger moet worden ingeschaald. VRAM (videogeheugen, het RAM dat naast de grafische chip is gesoldeerd) is nog steeds de enige specificatie die bepaalt of dit proces plezierig of frustrerend is.

Waarom één video zoveel meer kost dan één afbeelding

Een diffusiemodel genereert een afbeelding door deze in stappen te ontdoen van ruis, waarbij elke stap elk gewicht in het model leest. Een videomodel doet hetzelfde voor een heel blok frames tegelijk en voegt aandacht (attention) over de tijd toe, zodat frame 80 weet hoe frame 12 eruitzag. Vijf seconden bij 24 frames per seconde is 120 frames in één batch.

Die temporele aandacht is de reden waarom de kosten niet lineair schalen met de lengte van de clip. Het verdubbelen van het aantal frames zorgt voor meer dan een verdubbeling van het geheugen dat de sampler nodig heeft; het faalscenario is dus niet dat het renderen trager verloopt. Het is het renderen dat volledig stopt.

Er is een tweede geheugenpiek waar men vaak geen rekening mee houdt. Nadat de sampler klaar is, decodeert de VAE (variational autoencoder, het onderdeel dat de gecomprimeerde latent omzet in echte pixels) de volledige latente video in één keer. Dat decoderen kan meer geheugen vereisen dan het samplen zelf. Het symptoom is een taak die een voltooide voortgangsbalk toont en vervolgens dit afdrukt:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

De oplossing is tiled decoding of een kortere clip. Weten welke fase onvoldoende geheugen had, bespaart u een uur aan het afstellen van de verkeerde instellingen.

Hoeveel VRAM heeft u nodig voor AI-videogeneratie

Twee gepubliceerde cijfers vormen de basis voor deze beslissing, en ze lijken elkaar tegen te spreken. Alibaba stelt dat het Wan 2.2 TI2V-5B model 720p-clips van vijf seconden lang genereert met 24 frames per seconde in minder dan negen minuten op een enkele consumenten-GPU zoals een 4090, en zij adviseren minimaal 24 GB VRAM. De documentatie van ComfyUI stelt dat hetzelfde 5B model "goed zou moeten passen op 8 GB VRAM met de native offloading van ComfyUI".

Beide beweringen zijn waar omdat ze verschillende zaken meten. 8 GB is de capaciteit waarop het past. 24 GB is de capaciteit waarop het comfortabel werkt. Offloading werkt door het grootste deel van het model in het systeem-RAM te houden en voor elke stap lagen naar de GPU te streamen, waardoor de kaart tijd besteedt aan wachten op de PCIe-bus in plaats van aan rekenwerk. U betaalt die prijs bij elke sampler-stap, niet slechts één keer.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

Alleen de laatste rij is een cijfer van de fabrikant. De kaart met 24 GB komt uit op 9 minuten per clip, wat het door Alibaba gepubliceerde getal voor dit model is. De andere rijen tonen het effect van offloading; dit zijn eerder indicaties van de orde van grootte dan benchmarkresultaten. De trend is het punt: 40 minuten op een 8 GB kaart is technisch gezien een werkende configuratie, maar in de praktijk een batch-taak die u 's nachts laat draaien.

De grotere Wan 2.2 modellen vormen een andere wereld. De A14B text-to-video en image-to-video varianten vereisen minimaal 80 GB VRAM voor single-GPU inferentie. Dat is hardware voor datacenters, geen kaart die u in een desktopcomputer plaatst, en het is het punt waarop self-hosting betekent dat u per uur de accelerator van iemand anders huurt. Dezelfde rekensom gaat veel verder aan de tekstkant, waar het zelf hosten van een model met 2,8 biljoen parameters zoals Kimi K3 ophoudt een vraag over één kaart te zijn en een vraag wordt over hoeveel 80 GB kaarten u kunt betalen om met elkaar te verbinden.

Wat een clip kost op een gehuurde GPU

Huren is de manier waarop de meeste mensen dit zouden moeten testen, omdat een kaart die u koopt de verkeerde hardware is als het model dat u uiteindelijk wilt gebruiken 80 GB vereist. Mediaanprijzen voor on-demand gebruik op de GPU-verhuurmarkt, per juli 2026:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

De 4090-rij draait het 5B-model en kost ongeveer 0.05 dollar per clip bij 0.36 dollar per uur. De 80 GB-rijen draaien de 14B-modellen; daarom stijgen de kosten per clip naar 0.6 dollar, ook al is de hardware zelf veel sneller. Een groter model betekent meer rekenkracht per seconde video.

Vijf cent per clip klinkt als niets, en dat is het misleidende deel. Uw eerste bruikbare vijf seconden zijn nooit één render. Het aansturen van een videomodel is een zoekproces, en twintig tot veertig renders voordat u een bruikbaar resultaat heeft, is normaal voor een opname met specifieke bewegingen. Een werksessie kost daarom eerder dollars dan centen, en een middag itereren op gehuurde hardware kost ongeveer evenveel als een lunch.

Twee details bij het huren kosten echt geld als u ze over het hoofd ziet. U betaalt terwijl de server de gewichten downloadt, en de Wan 2.2-bestanden met hun tekst-encoder en VAE beslaan tientallen gigabytes. Kies daarom een aanbieder met een persistent volume en download ze slechts één keer. U betaalt ook terwijl de server inactief is met uw SSH-sessie open. Stop de instantie in plaats van alleen de terminal te sluiten.

ComfyUI installeren op de GPU-server

Begin met Ubuntu 24.04 waarop de NVIDIA-driver al is geïnstalleerd. Controleer eerst de driver, omdat elke latere foutmelding er zonder deze controle identiek uitziet.

nvidia-smi

Dit moet een tabel weergeven met uw kaart en een CUDA-versie. Als de uitvoer NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver is, is de kernelmodule niet geladen; dit gebeurt meestal na een kernel-upgrade zonder herstart. Los dit hier op. ComfyUI zal anders terugvallen op de CPU-modus en u zult onnodig tijd besteden aan het debuggen van het model.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

Bevestig dat PyTorch de kaart ziet voordat u ook maar één weight-bestand downloadt.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True in combinatie met uw kaartnaam betekent dat de stack correct functioneert. False betekent dat de geïnstalleerde wheel de CPU-only build is; dit gebeurt wanneer pip een gecachte versie van torch vindt van een eerdere installatie. Installeer opnieuw met de bovenstaande index URL.

De Wan 2.2 modelbestanden downloaden

ComfyUI wordt geleverd zonder gewichten en een videomodel bestaat niet uit één enkel bestand. Het is een combinatie van een diffusiemodel, een tekst-encoder en een VAE, waarbij elk onderdeel in een eigen map moet worden geplaatst. Als u een bestand in de verkeerde map plaatst, zal het loader-node dit simpelweg niet weergeven, zonder foutmelding die verklaart waarom.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

Het 5B-model ondersteunt zowel text-to-video als image-to-video, wat het een logisch startpunt maakt. Geef altijd de voorkeur aan .safetensors boven .ckpt. Een .ckpt-bestand is een gepickled Python-object; het laden hiervan voert code uit die is geschreven door de maker van het bestand. Reserveer voldoende schijfruimte: een werkende installatie met één modelfamilie en de bijbehorende output vereist 100 GB, en videobestanden zijn aanzienlijk groter dan de PNG-afbeeldingen die een workflow voor afbeeldingen achterlaat. Maak back-ups van uw workflow JSON-bestanden met bijvoorbeeld versleutelde incrementele back-ups naar object storage, aangezien de gewichten opnieuw kunnen worden gedownload, maar uw afgestelde workflows niet.

Start het programma en benader het veilig

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI bevat geen inlogscherm of gebruikersaccounts. Iedereen die poort 8188 kan bereiken, kan taken in de wachtrij plaatsen, al uw gegenereerde clips inzien en custom nodes installeren; dit laatste staat gelijk aan het uitvoeren van willekeurige code op uw server. Koppel de service aan localhost en benader deze via een SSH-tunnel vanaf uw eigen machine.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

Open vervolgens http://127.0.0.1:8188 in uw browser. Laad de Wan 2.2 template workflow vanuit het ComfyUI-menu met sjablonen in plaats van de nodes handmatig te verbinden. De officiële sjablonen bevatten de sampler-instellingen waarop het model is afgesteld; een video-workflow heeft aanzienlijk meer punten waar een waarde ongemerkt onjuist kan zijn dan een workflow voor afbeeldingen.

Wanneer het eerlijke antwoord is om een API te gebruiken

Zelf-hosting van videogeneratie is de juiste keuze wanneer het volume hoog en constant is, wanneer uw frames uw eigen infrastructuur niet mogen verlaten, of wanneer u een specifiek model of een aangepaste adapter nodig heeft die geen enkele gehoste dienst aanbiedt. Het is ook de juiste keuze wanneer de pipeline over een jaar nog steeds op dezelfde manier moet werken, omdat een gehost model zonder waarschuwing kan veranderen zonder dat u een versie kunt vastzetten.

Gebruik een gehoste API wanneer u een handvol clips per maand nodig heeft, wanneer u output nodig heeft die langer of groter is dan wat de open modellen produceren, of wanneer u deze week een deadline heeft. Maak de break-even-berekening eerlijk. Een 24 GB kaart die de klok rond wordt gehuurd tegen de mediaanprijs van juli 2026 kost ongeveer 260 dollar per maand, en het kopen van dezelfde kaart kost meer dan dat vooraf, nog voordat u één frame heeft gegenereerd. Een inactieve zelf-gehoste machine verliest het altijd van de prijsstelling per clip van een API. Dit is dezelfde afweging die bepaalt hoe u tekstmodellen serveert, zoals behandeld in Ollama versus vLLM voor zelf-gehoste LLM-serving, en het is gebaseerd op de meer fundamentele vraag in of een VPS met een GPU überhaupt het geld waard is.

Wat te controleren wanneer een render mislukt

Een render die aan het einde stopt, nadat de sampler-balk is voltooid, heeft onvoldoende geheugen tijdens de VAE-decode. Verlaag het aantal frames of schakel over naar een tiled decode-node. Het wijzigen van het aantal stappen helpt niet, omdat de decode slechts één keer plaatsvindt, nadat alle stappen al zijn uitgevoerd.

Output die volledig zwart is of ernstig vervormd, betekent meestal dat de VAE niet overeenkomt met het model. Een Wan 2.1 VAE die wordt geladen bij een Wan 2.2 diffusion-model produceert precies dit resultaat, zonder dat er ergens in de log een foutmelding verschijnt.

Een render die wel draait maar uren duurt op een machine waarvan u weet dat deze een GPU heeft, betekent dat ComfyUI het CPU-pad gebruikt. Controleer de opstartlog op de device-regel en voer daarna de torch.cuda.is_available()-controle hierboven opnieuw uit.

Wanneer het proces verdwijnt met Killed in dmesg zonder Python-traceback, is de kernel out-of-memory killer actief; dit betreft het systeem-RAM, niet het VRAM. Offloading vereist dat het volledige model in het systeem-RAM aanwezig is, wat betekent dat een systeem met 16 GB RAM tekortschiet voor het offloaden van een 5B-model. Voeg RAM toe of vergroot de swap.

FAQ

Kan ik AI-video genereren op een VPS zonder GPU?

Nee, niet op een manier die voor herhaaldelijk gebruik geschikt is. Een clip van vijf seconden in 720p die negen minuten duurt op een 24 GB GPU, duurt vele uren op een CPU. Dit komt doordat het model geen matrix-hardware heeft om op te draaien en de bandbreedte van het systeem-RAM een orde van grootte lager ligt dan die van het GPU-geheugen. Een CPU-server kan de ComfyUI-interface hosten, uw modellen opslaan en uw workflows beheren, maar het renderen zelf vereist een GPU.

Hoeveel VRAM heb ik nodig voor Wan 2.2?

Voor het TI2V-5B-model is 8 GB het absolute minimum met ComfyUI native offloading, en 24 GB is wat Alibaba aanbeveelt om de gepubliceerde snelheid te behalen. Voor de A14B text-to-video en image-to-video modellen vraagt de modelkaart om ten minste 80 GB VRAM voor inference op een enkele GPU; deze vereisen dus datacentrum-kaarten.

Hoe lang kan een zelfgehoste clip zijn?

Ongeveer vijf seconden op 720p is de praktische standaard per juli 2026. Langere output wordt geproduceerd door segmenten te genereren en deze samen te voegen, waarbij het laatste frame van het ene segment als het eerste frame van het volgende wordt gebruikt. De kwaliteit verloopt bij de overgangen, dus beschouw een lange video als een montageklus in plaats van als één generatie.

Is het huren van een GPU per uur goedkoper dan het kopen van een kaart?

Huren is voordeliger voor alles wat minder dan een paar uur renderen per dag vereist. Bij de mediaanprijs van ongeveer 0,36 dollar per uur voor een 24 GB kaart in juli 2026, kunt u zeer lang huren voordat u de aanschafprijs van die kaart bereikt. Bovendien voorkomt u dat u hardware koopt die uiteindelijk niet geschikt blijkt voor het model dat u daadwerkelijk wilt gebruiken. Kopen is alleen voordeliger als de machine het grootste deel van de dag, elke dag, in gebruik is.