SSD Nodes Learn RAM 8GB — $66/mwaka
Mwongozo Matt ConnorNa Matt Connor · Imeboreshwa 2026-08-01

Jenereta ya Video ya AI ya Kujipangisha: Ukweli

Gundua Wan 2.2, HunyuanVideo na LTX-Video huzalisha nini Julai 2026, zinahitaji VRAM kiasi gani, gharama ya klipu ya sekunde 5, na API itumike lini.

Kile ambacho jenereta ya video ya AI inayojipangisha inaweza kufanya kwa kweli

Jenereta ya video ya AI inayojipangisha inafanya kazi leo, lakini ni ya polepole na ndogo kuliko video za maonyesho zinavyoashiria. Kufikia Julai 2026, miundo huria inayofaa kuendesha ni Wan 2.2 kutoka Alibaba na HunyuanVideo kutoka Tencent, pamoja na LTX-Video kutoka Lightricks wakati kasi ni muhimu kuliko uhalisia. Yote huendeshwa chini ya ComfyUI kwenye mashine ya Linux yenye GPU ya NVIDIA. Unachopata ni klipu ya takriban sekunde tano yenye 720p. Si tukio. Si video iliyokamilika ya dakika moja.

Hapa kuna jibu fupi kabla ya maelezo. Kadi ya 24 GB hutoa klipu ya sekunde tano yenye 720p ndani ya dakika chache. Kadi ya 12 GB hufanya kazi hiyo hiyo ndani ya dakika 20 au zaidi, kwa sababu weights hazitoshei kwenye video memory na programu huendelea kuhamisha layers kwenda na kutoka system RAM. Server isiyo na GPU haiwezi kufanya kazi hii kwa njia yenye manufaa. Hesabu inayofanya utengenezaji wa picha kwa CPU uwe wa polepole hufanya utengenezaji wa video kwa CPU usiwe na maana.

Ikiwa tayari umesoma ngazi ya hardware ya jenereta ya picha inayojipangisha, video ni hoja hiyo hiyo, lakini kila namba imepanda daraja moja. VRAM (video memory, RAM iliyounganishwa karibu na graphics chip) bado ndiyo sifa pekee inayoamua ikiwa kazi hii itakuwa rahisi au yenye usumbufu.

Kwa nini video moja hugharimu zaidi sana kuliko picha moja

Muundo wa diffusion hutengeneza picha kwa kuiondoa kelele hatua kwa hatua, na kila hatua husoma kila uzito katika muundo. Muundo wa video hufanya jambo hilo kwa kundi zima la fremu kwa wakati mmoja. Pia huongeza attention katika mfululizo wa muda, ili fremu ya 80 ijue fremu ya 12 ilivyokuwa. Sekunde 5 kwa fremu 24 kwa sekunde ni fremu 120 katika kundi moja.

Attention hiyo ya muda ndiyo sababu gharama haiongezeki kwa uwiano rahisi kadiri urefu wa klipu unavyoongezeka. Kuongeza idadi ya fremu mara mbili huongeza kumbukumbu inayohitajika na sampler kwa zaidi ya mara mbili. Kwa hiyo, hali ya kushindwa si uonyeshaji kuwa wa polepole. Ni uonyeshaji kusitishwa.

Kuna ongezeko la pili la matumizi ya kumbukumbu ambalo watu hawatarajii. Baada ya sampler kumaliza, VAE (variational autoencoder, sehemu inayobadilisha latent iliyobanwa kuwa pikseli halisi) hufasiri video nzima ya latent kwa wakati mmoja. Hatua hiyo ya ufasiri inaweza kuhitaji kumbukumbu zaidi kuliko hatua ya sampling. Dalili ni kazi inayoonyesha upau wa maendeleo uliokamilika, kisha kuchapisha ujumbe huu:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

Suluhisho ni kutumia ufasiri wa vipande au klipu fupi. Kujua ni hatua gani iliyoishiwa kumbukumbu hukuepusha na kurekebisha mpangilio usio sahihi kwa saa moja.

Unahitaji VRAM kiasi gani kwa ajili ya kuzalisha video kwa AI

Takwimu mbili zilizochapishwa zinaonyesha msingi wa uamuzi huu wote, lakini zinaonekana kupingana. Alibaba inasema kuwa modeli ya Wan 2.2 TI2V-5B huzalisha klipu za 720p zenye fremu 24 kwa sekunde, zenye urefu wa sekunde tano, ndani ya dakika tisa kwenye GPU moja ya watumiaji, kama 4090, na inapendekeza angalau GB 24 za VRAM. Nyaraka za ComfyUI zinasema kuwa modeli hiyo hiyo ya 5B “inapaswa kutoshea vizuri kwenye vram ya GB 8 kwa kutumia native offloading ya ComfyUI”.

Kauli zote mbili ni sahihi kwa sababu zinapima vitu tofauti. GB 8 ndiyo kiwango ambacho modeli inatoshea. GB 24 ndiyo kiwango ambacho modeli hufanya kazi bila kubanwa. Offloading hufanya kazi kwa kuweka sehemu kubwa ya modeli kwenye RAM ya mfumo na kutuma tabaka kwenye GPU kwa kila hatua. Kwa hiyo, kadi hutumia muda wake kusubiri basi la PCIe badala ya kufanya hesabu. Gharama hiyo hulipwa katika kila hatua ya sampler, si mara moja tu.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

Safu ya mwisho pekee ndiyo takwimu ya mtengenezaji. Kadi ya GB 24 hufikisha muda wa 9 dakika kwa kila klipu. Hii ndiyo namba iliyochapishwa na Alibaba kwa modeli hii. Safu nyingine zinaonyesha athari ya offloading, nazo ni makadirio ya ukubwa wa tofauti, si matokeo ya ulinganishaji wa utendaji. Jambo muhimu ni mwelekeo huu: 40 dakika kwenye kadi ya GB 8 ni usanidi unaofanya kazi kitaalamu, lakini kwa matumizi halisi ni kazi ya kundi unayoiacha ikiendelea usiku kucha.

Modeli kubwa zaidi za Wan 2.2 ziko katika kiwango tofauti. Lahaja za A14B za text-to-video na image-to-video zinahitaji angalau GB 80 za VRAM kwa inference kwenye GPU moja. Hii ni hardware ya kituo cha data, si kadi unayoweka kwenye kompyuta ya mezani. Hapo ndipo self-hosted huanza kumaanisha kukodisha accelerator ya mtu mwingine kwa saa.

Gharama ya klipu kwenye GPU iliyokodishwa

Kukodisha ndiyo njia inayofaa kwa watu wengi kujaribu hili, kwa sababu GPU unayonunua inaweza isiwe chaguo sahihi ikiwa modeli utakayohitaji inahitaji 80 GB. Bei za wastani za matumizi ya GPU unapohitaji, katika soko la ukodishaji wa GPU, kufikia Julai 2026:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

Safu ya 4090 inaendesha modeli ya 5B na hugharimu takriban 0.05 dola kwa kila klipu, kwa bei ya 0.36 dola kwa saa. Safu za 80 GB zinaendesha modeli za 14B. Ndiyo sababu gharama kwa kila klipu hupanda hadi 0.6 dola, ingawa hardware yenyewe ni yenye kasi zaidi. Modeli kubwa inahitaji ukokotoaji zaidi kwa kila sekunde ya video.

Senti tano kwa klipu zinaweza kuonekana kuwa kidogo sana, lakini hapo ndipo makadirio yanapoweza kupotosha. Sekunde tano za kwanza zinazoweza kutumika kwa kawaida hazitokani na render moja. Kutengeneza prompt ya modeli ya video ni mchakato wa kutafuta chaguo bora. Kwa shot yenye mwendo maalum, ni kawaida kufanya render ishirini hadi arobaini kabla ya kupata inayofaa. Kwa hiyo, session ya kazi hugharimu dola badala ya senti. Mchana mmoja wa kujaribu na kuboresha kwenye hardware iliyokodishwa hugharimu karibu sawa na chakula cha mchana.

Mambo mawili ya ukodishaji yanaweza kuongeza gharama ikiwa hutayazingatia. Unatozwa wakati box inapopakua weights. Faili za Wan 2.2 pamoja na text encoder na VAE yake zina ukubwa wa makumi ya gigabaiti. Kwa hiyo, chagua provider mwenye persistent volume na upakue mara moja. Pia unatozwa wakati box ikiwa idle huku SSH session yako ikiwa wazi. Simamisha instance badala ya kufunga terminal tu.

Sakinisha ComfyUI kwenye kompyuta yenye GPU

Anza na Ubuntu 24.04 huku kiendeshi cha NVIDIA kikiwa tayari kimesakinishwa. Kagua kiendeshi kwanza, kwa sababu bila ukaguzi huu kila hitilafu inayofuata itaonekana kuwa ileile.

nvidia-smi

Hii lazima ichapishe jedwali lenye kadi yako na toleo la CUDA. Ikiichapisha NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, moduli ya kernel haijapakiwa. Hali hii hutokea mara nyingi baada ya kuboresha kernel bila kuwasha upya mfumo. Rekebisha tatizo hapa. Vinginevyo, ComfyUI itatumia njia ya CPU, na utapoteza saa moja ukilaumu modeli.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

Thibitisha kuwa PyTorch inaiona kadi kabla ya kupakua faili hata moja ya uzani.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True pamoja na jina la kadi yako humaanisha kuwa stack iko salama. False humaanisha kuwa wheel iliyosakinishwa ni toleo la CPU pekee. Hii hutokea wakati pip inapopata torch iliyohifadhiwa kwenye akiba kutoka usakinishaji wa awali. Sakinisha upya ukitumia index URL iliyo hapo juu.

Pakua faili za modeli ya Wan 2.2

ComfyUI haisafirishi faili za weights, na modeli ya video si faili moja. Ni modeli ya diffusion, text encoder na VAE, na kila kimoja huwekwa katika saraka yake. Ukiweka faili katika folda isiyo sahihi, nodi ya loader haitaorodhesha faili hilo, bila kutoa hitilafu inayoeleza sababu.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

Modeli ya 5B hushughulikia text-to-video na image-to-video, ndiyo sababu ni mwanzo unaofaa. Kila mara pendelea .safetensors badala ya .ckpt. Faili ya .ckpt ni kitu cha Python kilichopakiwa kwa pickle, kwa hiyo kuipakia huendesha msimbo ulioandikwa na aliyeiunda. Tenga nafasi ya kutosha ya diski: usakinishaji unaofanya kazi wenye familia moja ya modeli na matokeo yake huhitaji 100 GB, na faili za video ni kubwa zaidi kuliko picha za PNG zinazoachwa na workflow ya picha. Hifadhi nakala za faili zako za workflow za JSON kwa kutumia kitu kama nakala rudufu za ziada zilizosimbwa kwa njia fiche kwenye hifadhi ya object, kwa sababu weights zinaweza kupakuliwa tena, lakini workflows ulizorekebisha haziwezi.

Iendeshe, na uifikie kwa usalama

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI haina skrini ya kuingia wala akaunti za watumiaji. Kifaa chochote kinachoweza kufikia port 8188 kinaweza kupanga kazi, kusoma klipu zote ulizozalisha, na kusakinisha nodes maalum. Hii inaruhusu kutekeleza msimbo wowote kwenye server yako. Ifunge kwenye localhost, kisha uifikie kupitia SSH tunnel kutoka kwenye mashine yako mwenyewe.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

Kisha fungua http://127.0.0.1:8188 kwenye browser yako. Pakia workflow ya template ya Wan 2.2 kutoka kwenye menyu ya templates ya ComfyUI badala ya kuunganisha nodes wewe mwenyewe. Templates rasmi zina mipangilio ya sampler ambayo model ilifanyiwa tuning nayo. Workflow ya video ina sehemu nyingi zaidi ambazo thamani inaweza kuwekwa kimakosa bila kutambuliwa kuliko workflow ya picha.

Wakati jibu la kweli ni kutumia API

Kujihudumia mwenyewe kwa ajili ya utengenezaji wa video ni chaguo sahihi wakati kiwango cha matumizi ni kikubwa na thabiti, wakati fremu zako hazipaswi kuondoka kwenye miundombinu yako mwenyewe, au wakati unahitaji modeli mahususi au adapta maalum ambayo hakuna huduma ya mwenyeji inayotoa. Pia ni chaguo sahihi wakati mchakato lazima ufanye kazi kwa njia ileile baada ya mwaka mmoja, kwa sababu modeli inayotolewa na huduma ya mwenyeji inaweza kubadilishwa bila kukupa toleo la kulifunga.

Tumia API ya mwenyeji unapohitaji klipu chache kwa mwezi, unapohitaji matokeo marefu au makubwa kuliko yale yanayotolewa na modeli huria, au unapokuwa na tarehe ya mwisho wiki hii. Fanya hesabu ya hatua ya kusawazisha gharama kwa uaminifu. Kadi ya 24 GB iliyokodishwa saa nzima kwa bei ya wastani ya Julai 2026 hugharimu takribani dola 260 kwa mwezi, na kununua kadi hiyo hiyo hugharimu zaidi ya kiasi hicho mwanzoni, kabla hujatengeneza fremu hata moja. Kompyuta ya kujihostia ambayo haitumiki huwa na gharama kubwa kuliko bei ya API kwa kila klipu kila wakati. Hii ni biashara hiyo hiyo ya kuchagua namna ya kutoa huduma za modeli za maandishi, iliyofafanuliwa katika Ollama dhidi ya vLLM kwa kutoa huduma za LLM zinazojihostia, na inategemea swali la msingi zaidi katika ikiwa VPS yenye GPU ina thamani ya gharama yake kabisa.

Nini cha kuangalia render inaposhindwa

Render inayokatika mwishoni kabisa, baada ya upau wa sampler kukamilika, imeishiwa kumbukumbu wakati wa VAE decode. Punguza idadi ya fremu au tumia node ya tiled decode. Kubadilisha idadi ya steps hakutasaidia, kwa sababu decode hufanyika mara moja baada ya steps zote kuendeshwa.

Output iliyo nyeusi kabisa au iliyochanganyika sana kwa kawaida inaonyesha kuwa VAE hailingani na model. Wan 2.1 VAE iliyopakiwa dhidi ya Wan 2.2 diffusion model hutoa hali hiyo hasa, na hakuna hitilafu inayoonekana popote kwenye log.

Render inayotekelezwa lakini inachukua saa nyingi kwenye mashine unayojua ina GPU inaonyesha kuwa ComfyUI inatumia njia ya CPU. Angalia log ya kuanzisha kwa mstari wa kifaa, kisha endesha tena ukaguzi wa torch.cuda.is_available() hapo juu.

Mchakato unaotoweka pamoja na Killed katika dmesg bila Python traceback unasababishwa na kernel out-of-memory killer. Hivyo, tatizo liko kwenye RAM ya mfumo, si VRAM. Offloading inahitaji model nzima iwe kwenye RAM ya mfumo, kwa hiyo mashine yenye 16 GB inayofanya offloading ya model ya 5B haina RAM ya kutosha. Ongeza RAM au ongeza swap.

FAQ

Je, ninaweza kutengeneza video kwa AI kwenye VPS isiyo na GPU?

Hapana, si kwa njia ambayo utaitumia zaidi ya mara moja. Klipu ya sekunde tano yenye ubora wa 720p inayochukua dakika tisa kwenye GPU ya 24 GB inaweza kuchukua saa nyingi kwenye CPU, kwa sababu modeli haina maunzi ya matriki ya kuendeshea, na kipimo data cha RAM ya mfumo ni chini kwa mpangilio wa ukubwa mmoja ikilinganishwa na kipimo data cha kumbukumbu ya GPU. Seva ya CPU inaweza kuendesha kiolesura cha ComfyUI, kuhifadhi modeli zako na kuhifadhi workflows zako, lakini uonyeshaji wenyewe unahitaji GPU.

Ninahitaji VRAM kiasi gani kwa Wan 2.2?

Kwa modeli ya TI2V-5B, 8 GB ndiyo kiwango cha chini unapotumia native offloading ya ComfyUI, na 24 GB ndiyo Alibaba inapendekeza ili kupata kasi iliyochapishwa. Kwa modeli za A14B za text-to-video na image-to-video, model card inahitaji angalau 80 GB za VRAM kwa inference kwenye GPU moja. Hivyo, modeli hizo zinahitaji kadi za data center.

Klipu inayojihifadhi kwenye seva inaweza kuwa ndefu kiasi gani?

Takriban sekunde tano kwa 720p ndiyo urefu unaotekelezeka kwa vitendo kufikia July 2026. Tokeo refu hutengenezwa kwa kutengeneza segmenti na kuziunganisha, huku frame ya mwisho ya segmenti moja ikitumika kama frame ya kwanza ya inayofuata. Ubora hubadilika kwenye sehemu za kuunganisha. Kwa hiyo, chukulia video ndefu kama kazi ya uhariri badala ya utengenezaji mmoja.

Je, kukodisha GPU kwa saa ni nafuu kuliko kununua kadi?

Kukodisha ni nafuu ikiwa unatoa video kwa muda usiozidi saa chache kwa siku. Kwa wastani wa July 2026 wa takriban dola 0.36 kwa saa kwa kadi ya 24 GB, unaweza kukodisha kwa muda mrefu kabla gharama haijafikia bei ya kununua kadi hiyo. Pia huepuka kununua maunzi ambayo baadaye yanaonekana kuwa ya aina isiyofaa kwa modeli unayotaka kutumia. Kununua kuna faida tu ikiwa mashine inatumika muda mwingi wa siku, kila siku.

#ai-video#comfyui#gpu#self-hosting#wan#vram