Self-hosted AI video generator की असली क्षमता
July 2026 में Wan 2.2, HunyuanVideo और LTX-Video की वास्तविक output, 12 GB बनाम 24 GB VRAM की गति, rented GPU की 5 सेकंड clip लागत और API चुनने का समय जानें।
स्व-होस्ट किए गए AI वीडियो जनरेटर की वास्तविक क्षमताएँ
स्व-होस्ट किया गया AI वीडियो जनरेटर आज काम करता है, लेकिन demo reels में दिखाए गए परिणामों की तुलना में यह धीमा है और छोटे क्लिप बनाता है। July 2026 तक चलाने योग्य open models में Alibaba का Wan 2.2 और Tencent का HunyuanVideo शामिल हैं। जब realism से अधिक speed महत्वपूर्ण हो, तब Lightricks का LTX-Video भी उपयोगी है। ये सभी Linux मशीन पर NVIDIA GPU के साथ ComfyUI में चलाए जा सकते हैं। इससे आपको लगभग पांच सेकंड का 720p क्लिप मिलता है। पूरा scene नहीं। तैयार footage का एक मिनट भी नहीं।
विस्तार से पहले संक्षिप्त उत्तर यह है। 24 GB का card पांच सेकंड का 720p क्लिप कुछ ही मिनटों में render करता है। 12 GB का card यही काम बीस मिनट या उससे अधिक समय में करता है, क्योंकि weights video memory में पूरी तरह fit नहीं होते और software layers को system RAM में बार-बार स्थानांतरित करता रहता है। बिना GPU वाला server इसे किसी उपयोगी अर्थ में नहीं चला सकता। CPU पर image generation को धीमा बनाने वाली गणना CPU पर video generation को व्यावहारिक रूप से निरर्थक बना देती है।
यदि आप स्व-होस्ट किए गए image generator के hardware ladder को पहले ही पढ़ चुके हैं, तो video में यही तर्क लागू होता है, लेकिन हर संख्या एक class ऊपर चली जाती है। VRAM (video memory, graphics chip के पास solder की गई RAM) अब भी वह एकमात्र spec है जो तय करती है कि यह काम आसान होगा या कठिन।
एक वीडियो की लागत एक छवि से इतनी अधिक क्यों होती है
Diffusion model किसी image को चरणों में denoise करके बनाता है। प्रत्येक चरण model के सभी weights को पढ़ता है। Video model यही काम एक साथ frames के पूरे block पर करता है। इसके अलावा, यह समय के across attention जोड़ता है, ताकि frame 80 को पता रहे कि frame 12 कैसा दिखता था। 24 frames per second की दर से 5 seconds का video एक batch में 120 frames रखता है।
यही temporal attention कारण है कि clip की लंबाई बढ़ने पर लागत समान अनुपात में नहीं बढ़ती। Frame count को दोगुना करने पर sampler को आवश्यक memory दोगुने से अधिक बढ़ जाती है। इसलिए समस्या केवल rendering के धीमे होने की नहीं होती। Render विफल हो जाता है।
एक दूसरी memory spike भी आती है, जिसकी लोग अपेक्षा नहीं करते। Sampler का काम पूरा होने के बाद VAE (variational autoencoder, जो compressed latent को वास्तविक pixels में बदलता है) पूरे latent video को एक साथ decode करता है। इस decode के लिए sampling से अधिक memory की आवश्यकता हो सकती है। इसका संकेत ऐसा job है जिसमें progress bar पूरा दिखता है और फिर यह संदेश print होता है:
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiBइसका समाधान tiled decoding या छोटा clip है। यह जानने से कि memory किस stage पर समाप्त हुई, आप एक घंटे तक गलत setting को tune करने से बच सकते हैं।
AI वीडियो जनरेशन के लिए आपको कितनी VRAM चाहिए
दो प्रकाशित आंकड़े पूरे निर्णय का आधार बनते हैं, लेकिन वे एक-दूसरे के विरोधाभासी लगते हैं। Alibaba के अनुसार Wan 2.2 TI2V-5B मॉडल 4090 जैसी एक उपभोक्ता GPU पर 24 frames per second की दर से 720p क्लिप, जो पांच सेकंड लंबी हो, नौ मिनट से कम समय में बनाता है। वह कम से कम 24 GB VRAM की अनुशंसा करता है। ComfyUI documentation के अनुसार यही 5B मॉडल "ComfyUI native offloading" के साथ 8GB vram में अच्छी तरह चलना चाहिए।
दोनों बातें सही हैं, क्योंकि वे अलग-अलग चीजों को मापती हैं। 8 GB वह सीमा है जिसमें मॉडल चल जाता है। 24 GB वह क्षमता है जिसमें यह आराम से चलता है। Offloading अधिकांश मॉडल को system RAM में रखता है और हर step के लिए layers को GPU में stream करता है। इसलिए card गणना करने के बजाय PCIe bus से डेटा आने की प्रतीक्षा करता है। यह लागत केवल एक बार नहीं, बल्कि हर sampler step पर लगती है।
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]केवल अंतिम row vendor का आंकड़ा है। 24 GB card पर प्रति clip समय 9 मिनट है। यह इस मॉडल के लिए Alibaba का प्रकाशित आंकड़ा है। अन्य rows offloading के प्रभाव को दर्शाती हैं। वे benchmark results नहीं, बल्कि order of magnitude के अनुमान हैं। मुख्य बात यह है: 8 GB card पर 40 मिनट लगते हैं। यह setup तकनीकी रूप से काम करता है, लेकिन व्यावहारिक रूप से ऐसा batch job है जिसे आप रात भर चलने के लिए छोड़ते हैं।
बड़े Wan 2.2 मॉडल अलग श्रेणी में आते हैं। A14B text-to-video और image-to-video variants को single-GPU inference के लिए कम से कम 80 GB VRAM चाहिए। यह data-center hardware है, न कि desk machine में लगाने वाला card। इस स्तर पर self-hosted का अर्थ अक्सर किसी अन्य व्यक्ति का accelerator प्रति घंटे किराये पर लेना होता है।
किराए के GPU पर एक क्लिप की लागत
अधिकांश लोगों को इसका परीक्षण किराए के GPU पर करना चाहिए। आपके द्वारा खरीदा गया कार्ड गलत hardware हो सकता है, यदि अंत में आपको ऐसे model की आवश्यकता हो जिसे 80 GB चाहिए। जुलाई 2026 तक GPU rental market में on-demand कीमतों का median:
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]4090 वाली पंक्ति 5B model चलाती है और प्रति घंटे 0.36 dollars की दर पर प्रति clip लगभग 0.05 dollars खर्च करती है। 80 GB वाली पंक्तियाँ 14B models चलाती हैं। इसलिए उनका प्रति clip खर्च 0.6 dollars तक बढ़ जाता है, भले ही hardware स्वयं बहुत तेज हो। बड़ा model, video के प्रति second अधिक computation।
प्रति clip पांच cents बहुत कम लगते हैं। यही भ्रामक हिस्सा है। आपके पहले उपयोगी पांच seconds के लिए कभी केवल एक render पर्याप्त नहीं होता। Video model के साथ prompting एक search प्रक्रिया है। किसी shot में विशिष्ट motion चाहिए हो तो keeper मिलने से पहले 20 से 40 renders सामान्य हैं। इसलिए एक working session की लागत cents के बजाय dollars में होती है। किराए के hardware पर एक दोपहर तक iteration करने का खर्च लगभग lunch जितना होता है।
यदि आप दो rental विवरणों पर ध्यान नहीं देते हैं, तो उनकी वास्तविक लागत होती है। Box weights download करते समय भी billing होती है। Text encoder और VAE सहित Wan 2.2 files का आकार tens of gigabytes तक होता है। इसलिए persistent volume वाला provider चुनें और files केवल एक बार download करें। SSH session खुला रहने पर box idle हो, तब भी billing जारी रहती है। केवल terminal बंद करने के बजाय instance को stop करें।
GPU box पर ComfyUI इंस्टॉल करें
Ubuntu 24.04 से शुरू करें, जिसमें NVIDIA driver पहले से इंस्टॉल हो। पहले driver की जाँच करें, क्योंकि इस जाँच के बिना बाद की हर विफलता एक जैसी दिखाई देगी।
nvidia-smiइससे आपके card और CUDA version वाली table दिखनी चाहिए। यदि NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver दिखाई देता है, तो kernel module लोड नहीं हुआ है। ऐसा आमतौर पर reboot किए बिना kernel upgrade करने के बाद होता है। यहीं इसे ठीक करें। अन्यथा ComfyUI CPU path पर चला जाएगा और आप एक घंटे तक model को दोष देते रहेंगे।
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txtएक भी weight file download करने से पहले पुष्टि करें कि PyTorch card को पहचान रहा है।
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"True और आपके card का नाम दिखाई देने का अर्थ है कि stack सही है। False का अर्थ है कि इंस्टॉल किया गया wheel CPU-only build है। ऐसा तब होता है जब pip को पिछले install से cached torch मिल जाता है। ऊपर दिए गए index URL से फिर से install करें।
Wan 2.2 मॉडल फ़ाइलें डाउनलोड करें
ComfyUI में कोई weights शामिल नहीं होते, और video model एक फ़ाइल नहीं होता। इसमें diffusion model, text encoder और VAE होते हैं, और प्रत्येक को अपनी अलग directory में रखना होता है। किसी फ़ाइल को गलत folder में रखने पर loader node उसे सूचीबद्ध नहीं करेगा। इसका कारण बताने वाली कोई error भी नहीं मिलेगी।
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors5B model text-to-video और image-to-video दोनों को संभालता है। इसलिए शुरुआत के लिए यही उपयुक्त है। हमेशा .safetensors को .ckpt पर प्राथमिकता दें। .ckpt फ़ाइल pickled Python object होती है। इसे load करने पर उस व्यक्ति द्वारा लिखा गया code चलता है जिसने इसे बनाया है। Disk space के लिए पर्याप्त बजट रखें। एक model family और उसके output वाले working install के लिए 100 GB चाहिए। Video files, image workflow से बनने वाली PNG images की तुलना में बहुत बड़ी होती हैं। अपने workflow JSON files का backup object storage में encrypted incremental backups जैसे विकल्प से रखें, क्योंकि weights को दोबारा download किया जा सकता है, लेकिन आपके tuned workflows को नहीं।
इसे चलाएँ और सुरक्षित रूप से पहुँचें
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188ComfyUI में लॉगिन स्क्रीन और उपयोगकर्ता खाते नहीं हैं। Port 8188 तक पहुँच रखने वाला कोई भी व्यक्ति jobs को queue कर सकता है, आपके द्वारा generate की गई हर clip पढ़ सकता है और custom nodes install कर सकता है। इससे आपके server पर arbitrary code execution हो सकता है। इसे localhost से bind करें और अपनी मशीन से SSH tunnel के माध्यम से पहुँचें।
ssh -N -L 8188:127.0.0.1:8188 you@your-serverइसके बाद अपने browser में http://127.0.0.1:8188 खोलें। Nodes को manually wire करने के बजाय ComfyUI templates menu से Wan 2.2 template workflow load करें। Official templates में वे sampler settings शामिल होती हैं जिनके लिए model को tune किया गया था। Video workflow में image workflow की तुलना में ऐसी कई अधिक जगहें होती हैं जहाँ कोई value चुपचाप गलत हो सकती है।
API का उपयोग करना ही ईमानदार उत्तर कब होता है
वीडियो जनरेशन को self-host करना तब सही विकल्प है, जब वॉल्यूम अधिक और स्थिर हो, जब आपके frames को आपकी अपनी infrastructure से बाहर नहीं जाना चाहिए, या जब आपको किसी specific model या custom adapter की आवश्यकता हो, जिसे कोई hosted service उपलब्ध नहीं कराती। यह तब भी सही विकल्प है, जब pipeline को एक वर्ष बाद भी उसी तरह काम करना हो, क्योंकि hosted model आपके नियंत्रण के बिना बदल सकता है और उसे pin करने के लिए कोई version उपलब्ध नहीं हो सकता।
Hosted API का उपयोग तब करें, जब आपको महीने में केवल कुछ clips चाहिए, जब आपको open models से मिलने वाले output से अधिक लंबा या बड़ा output चाहिए, या जब आपकी deadline इसी सप्ताह हो। Break-even की गणना ईमानदारी से करें। July 2026 के median मूल्य पर 24 GB card को चौबीसों घंटे किराए पर लेना लगभग 260 dollars प्रति माह पड़ता है, और वही card खरीदने पर पहले ही इससे अधिक खर्च होता है, जबकि आपने एक भी frame generate नहीं किया है। निष्क्रिय self-hosted box हर बार per-clip API pricing से महंगा पड़ता है। यही trade तय करता है कि आप text models को कैसे serve करते हैं; इसका विवरण self-hosted LLM serving के लिए Ollama बनाम vLLM में है। यह उस अधिक बुनियादी प्रश्न पर भी निर्भर करता है कि क्या GPU वाला VPS लेना वास्तव में लाभदायक है।
रेंडर विफल होने पर क्या जाँचें
यदि sampler bar पूरा होने के बाद रेंडर बिल्कुल अंत में बंद हो जाता है, तो VAE decode के दौरान memory समाप्त हो गई है। फ़्रेम की संख्या कम करें या tiled decode node पर स्विच करें। step count बदलने से समस्या हल नहीं होगी, क्योंकि decode केवल एक बार होता है और तब तक सभी steps चल चुके होते हैं।
यदि output पूरी तरह काला या बुरी तरह बिगड़ा हुआ है, तो सामान्यतः इसका अर्थ है कि VAE और model एक-दूसरे से मेल नहीं खाते। Wan 2.1 VAE को Wan 2.2 diffusion model के साथ load करने पर ठीक यही स्थिति उत्पन्न होती है, और log में कहीं भी error दिखाई नहीं देता।
यदि render चलता है, लेकिन ऐसे system पर कई घंटे लेता है जिसके बारे में आपको पता है कि उसमें GPU है, तो इसका अर्थ है कि ComfyUI CPU path पर चल रहा है। startup log में device line जाँचें, फिर ऊपर दिया गया torch.cuda.is_available() check दोबारा चलाएँ।
यदि process dmesg में Killed के साथ गायब हो जाता है और कोई Python traceback नहीं दिखता, तो यह kernel का out-of-memory killer है। इसलिए समस्या system RAM की है, VRAM की नहीं। Offloading के लिए पूरे model का system RAM में resident होना आवश्यक है। इसका अर्थ है कि 16 GB system पर 5B model को offload करने के लिए RAM कम पड़ती है। RAM बढ़ाएँ या swap जोड़ें।
FAQ
क्या मैं बिना GPU वाले VPS पर AI वीडियो बना सकता हूँ?
नहीं, कम-से-कम उस तरीके से नहीं जिसे आप दोबारा इस्तेमाल करना चाहें। 24 GB GPU पर 720p की पांच सेकंड की क्लिप बनाने में नौ मिनट लगते हैं, जबकि CPU पर इसमें कई घंटे लग सकते हैं। इसका कारण यह है कि मॉडल को चलाने के लिए CPU में matrix hardware नहीं होता और system RAM की bandwidth, GPU memory bandwidth से एक order of magnitude कम होती है। CPU server ComfyUI interface को host कर सकता है, आपके models store कर सकता है और आपके workflows रख सकता है। लेकिन rendering के लिए GPU आवश्यक है।
Wan 2.2 के लिए मुझे कितनी VRAM चाहिए?
TI2V-5B model के लिए ComfyUI native offloading के साथ 8 GB न्यूनतम आवश्यकता है। प्रकाशित speed प्राप्त करने के लिए Alibaba 24 GB की अनुशंसा करता है। A14B text-to-video और image-to-video models के लिए model card single-GPU inference हेतु कम-से-कम 80 GB VRAM मांगता है। इसलिए इनके लिए data-center cards आवश्यक हैं।
self-hosted clip कितनी लंबी हो सकती है?
July 2026 तक 720p पर लगभग पांच सेकंड का clip व्यावहारिक इकाई है। लंबा output segments बनाकर और उन्हें जोड़कर तैयार किया जाता है। इसमें एक segment के last frame को अगले segment के first frame के रूप में इस्तेमाल किया जाता है। जोड़ वाले स्थानों पर quality में बदलाव आ सकता है। इसलिए लंबे video को एक generation के बजाय editing job मानें।
क्या GPU को प्रति घंटे किराये पर लेना card खरीदने से सस्ता है?
यदि आप प्रतिदिन कुछ घंटों से कम rendering करते हैं, तो किराये पर लेना बेहतर है। July 2026 में 24 GB card का median किराया लगभग 0.36 dollars प्रति घंटे था। इस दर पर आप उस card की खरीद कीमत तक पहुंचने से पहले लंबे समय तक किराये पर ले सकते हैं। साथ ही, आपको ऐसा hardware खरीदने से बचाव मिलता है जो आपके इच्छित model के लिए गलत class का साबित हो सकता है। खरीदना तभी बेहतर है जब box हर दिन अधिकांश समय व्यस्त रहता हो।