SSD Nodes Learn Hosting plans →
गाइड Matt Connorलेखक: Matt Connor · अपडेट किया गया: 2026-08-13

Self-hosted AI video generator: क्या यह वास्तव में काम

जुलाई 2026 में open video models की वास्तविकता जानें। Wan 2.2 और HunyuanVideo के लिए आवश्यक VRAM, रेंडरिंग समय और रेंटेड GPU पर 5 सेकंड की क्लिप की लागत का सटीक विवरण देखें।

एक self-hosted AI video generator वास्तव में क्या कर सकता है

एक self-hosted AI video generator आज काम करता है, लेकिन यह demo reels की तुलना में धीमा और छोटा है। जुलाई 2026 तक, चलाने योग्य open models में Alibaba का Wan 2.2 और Tencent का HunyuanVideo शामिल हैं, साथ ही जब यथार्थवाद (realism) से अधिक गति महत्वपूर्ण हो, तो Lightricks का LTX-Video भी उपलब्ध है। ये सभी NVIDIA GPU वाले Linux मशीन पर ComfyUI के अंतर्गत चलते हैं। आपको जो आउटपुट मिलता है, वह लगभग पांच सेकंड की 720p क्लिप होती है। कोई पूरा दृश्य नहीं। न ही एक मिनट की तैयार फुटेज।

विवरण से पहले यहाँ संक्षिप्त उत्तर दिया गया है। एक 24 GB का कार्ड पांच सेकंड की 720p क्लिप को कुछ ही मिनटों में रेंडर कर देता है। एक 12 GB का कार्ड यही काम बीस मिनट या उससे अधिक समय में करता है, क्योंकि weights वीडियो मेमोरी में फिट नहीं होते हैं और सॉफ्टवेयर लगातार layers को सिस्टम RAM में लाता-ले जाता रहता है। बिना GPU वाला सर्वर इसे किसी भी उपयोगी तरीके से नहीं कर सकता। जिस गणित ने CPU image generation को धीमा बनाया था, वही CPU video generation को व्यर्थ बनाता है।

यदि आपने पहले ही self-hosted image generator के लिए हार्डवेयर लैडर पढ़ लिया है, तो वीडियो के लिए भी वही तर्क लागू होता है, बस हर संख्या एक श्रेणी ऊपर चली जाती है। VRAM (वीडियो मेमोरी, जो ग्राफिक्स चिप के बगल में सोल्डर की गई RAM होती है) ही एकमात्र ऐसी विशिष्टता है जो यह तय करती है कि यह अनुभव मजेदार होगा या कष्टदायक।

एक वीडियो की लागत एक इमेज से इतनी अधिक क्यों होती है

एक diffusion model इमेज को स्टेप्स में denoising करके जनरेट करता है, और प्रत्येक स्टेप मॉडल के हर weight को पढ़ता है। एक वीडियो मॉडल फ्रेम के पूरे ब्लॉक के साथ एक ही बार में यही प्रक्रिया करता है, और यह समय के साथ attention जोड़ता है ताकि फ्रेम 80 को पता रहे कि फ्रेम 12 कैसा दिखता था। 24 frames per second पर पांच सेकंड का मतलब एक बैच में 120 फ्रेम्स होता है।

वह temporal attention ही कारण है कि लागत क्लिप की लंबाई के साथ सामान्य रूप से नहीं बढ़ती है। फ्रेम काउंट को दोगुना करने से sampler को आवश्यक मेमोरी दोगुने से भी अधिक हो जाती है, इसलिए विफलता का कारण धीमी रेंडरिंग नहीं होती है। बल्कि रेंडरिंग का पूरी तरह रुक जाना होता है।

मेमोरी का एक दूसरा स्पाइक भी होता है जिसकी उम्मीद लोग नहीं करते। Sampler के पूरा होने के बाद, VAE (variational autoencoder, वह हिस्सा जो compressed latent को वास्तविक pixels में बदलता है) पूरे latent वीडियो को एक साथ डिकोड करता है। उस डिकोडिंग में सैंपलिंग से भी अधिक मेमोरी की आवश्यकता हो सकती है। इसका लक्षण यह है कि जॉब प्रोग्रेस बार पूरा दिखाती है और फिर यह प्रिंट करती है:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

इसका समाधान tiled decoding या छोटी क्लिप है। यह जानना कि किस चरण में मेमोरी खत्म हुई, आपको गलत चीज को ठीक करने में घंटों बर्बाद करने से बचाता है।

AI वीडियो जनरेशन के लिए आपको कितनी VRAM की आवश्यकता है

दो प्रकाशित आंकड़े पूरे निर्णय को निर्धारित करते हैं, और वे एक-दूसरे के विपरीत प्रतीत होते हैं। Alibaba का कहना है कि Wan 2.2 TI2V-5B मॉडल 4090 जैसे सिंगल कंज्यूमर GPU पर नौ मिनट से कम समय में 24 फ्रेम प्रति सेकंड पर पांच सेकंड लंबी 720p क्लिप तैयार करता है, और यह कम से कम 24 GB VRAM की सिफारिश करता है। ComfyUI का डॉक्यूमेंटेशन बताता है कि वही 5B मॉडल "ComfyUI नेटिव ऑफलोडिंग के साथ 8 GB VRAM पर अच्छी तरह फिट हो जाना चाहिए"।

दोनों बातें सच हैं क्योंकि वे अलग-अलग चीजों को मापते हैं। 8 GB वह सीमा है जहाँ यह फिट हो जाता है। 24 GB वह क्षमता है जहाँ यह सुचारू रूप से चलता है। ऑफलोडिंग इस तरह काम करती है कि मॉडल का अधिकांश हिस्सा सिस्टम RAM में रहता है और हर स्टेप के लिए लेयर्स को GPU में स्ट्रीम किया जाता है, इसलिए कार्ड गणितीय गणना करने के बजाय PCIe बस पर प्रतीक्षा करने में अपना समय व्यतीत करता है। आप यह कीमत हर सैंपलर स्टेप पर चुकाते हैं, न कि केवल एक बार।

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

केवल अंतिम पंक्ति वेंडर का आंकड़ा है। 24 GB वाला कार्ड 9 मिनट प्रति क्लिप पर आता है, जो इस मॉडल के लिए Alibaba द्वारा प्रकाशित संख्या है। अन्य पंक्तियाँ यह दर्शाती हैं कि ऑफलोडिंग इसके साथ क्या करती है, और वे बेंचमार्क परिणामों के बजाय परिमाण के क्रम (order of magnitude) को दर्शाती हैं। मुख्य बात यह है: 8 GB कार्ड पर 40 मिनट तकनीकी रूप से एक कार्यशील सेटअप है, लेकिन व्यावहारिक रूप से यह एक ऐसा बैच जॉब है जिसे आप रात भर चलने के लिए छोड़ देते हैं।

बड़े Wan 2.2 मॉडल एक अलग दुनिया हैं। A14B टेक्स्ट-टू-वीडियो और इमेज-टू-वीडियो वेरिएंट सिंगल-GPU इन्फरेंस के लिए कम से कम 80 GB VRAM की मांग करते हैं। यह डेटा-सेंटर हार्डवेयर है, न कि वह कार्ड जिसे आप डेस्क मशीन में लगाते हैं, और यह वह बिंदु है जहाँ सेल्फ-होस्टिंग का अर्थ किसी और के एक्सेलेरेटर को प्रति घंटे के हिसाब से किराए पर लेना हो जाता है। यही गणित टेक्स्ट साइड पर और आगे तक जाता है, जहाँ Kimi K3 जैसे 2.8 ट्रिलियन पैरामीटर मॉडल को सेल्फ-होस्ट करना एक कार्ड के बारे में सवाल नहीं रह जाता, बल्कि यह सवाल बन जाता है कि आप कितने 80 GB कार्ड एक साथ जोड़ने का खर्च उठा सकते हैं।

रेंटेड GPU पर एक क्लिप की लागत

ज्यादातर लोगों को इसे टेस्ट करने के लिए रेंटिंग का विकल्प चुनना चाहिए, क्योंकि यदि अंत में आप जिस मॉडल का उपयोग करना चाहते हैं उसे 80 GB की आवश्यकता है, तो आपके द्वारा खरीदा गया कार्ड गलत हार्डवेयर साबित हो सकता है। जुलाई 2026 तक GPU रेंटल मार्केट में ऑन-डिमांड कीमतों का औसत इस प्रकार है:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

4090 वाली पंक्ति 5B मॉडल चलाती है और इसकी लागत 0.05 डॉलर प्रति क्लिप है, जिसकी दर 0.36 डॉलर प्रति घंटा है। 80 GB वाली पंक्तियाँ 14B मॉडल चलाती हैं, यही कारण है कि उनकी प्रति-क्लिप लागत बढ़कर 0.6 डॉलर हो जाती है, भले ही हार्डवेयर स्वयं बहुत तेज हो। मॉडल जितना बड़ा होगा, वीडियो के प्रति सेकंड के लिए उतनी ही अधिक कंप्यूटिंग की आवश्यकता होगी।

पाँच सेंट प्रति क्लिप सुनने में बहुत कम लगता है, और यही भ्रामक हिस्सा है। आपके द्वारा उपयोग किए जाने वाले पहले पाँच सेकंड कभी भी एक रेंडर में तैयार नहीं होते। वीडियो मॉडल को प्रॉम्प्ट करना एक खोज की प्रक्रिया है, और विशिष्ट गति वाले शॉट के लिए अंतिम परिणाम मिलने से पहले बीस से चालीस रेंडर करना सामान्य बात है। इसलिए, एक वर्किंग सेशन की लागत सेंट में नहीं बल्कि डॉलर में होती है, और रेंटेड हार्डवेयर पर दोपहर भर काम करने का खर्च लगभग दोपहर के भोजन के बराबर होता है।

रेंटल के दो विवरण ऐसे हैं जो अनदेखा करने पर काफी महंगे पड़ सकते हैं। जब बॉक्स वेट्स (weights) डाउनलोड कर रहा होता है, तब भी आपसे शुल्क लिया जाता है। Wan 2.2 फाइलें अपने टेक्स्ट एनकोडर और VAE के साथ कई दसियों गीगाबाइट की होती हैं, इसलिए ऐसा प्रदाता चुनें जिसके पास persistent volume हो और एक बार डाउनलोड करें। जब आपका SSH सेशन खुला रहता है और बॉक्स खाली (idle) बैठा रहता है, तब भी आपसे शुल्क लिया जाता है। टर्मिनल बंद करने के बजाय instance को stop करें।

GPU box पर ComfyUI इंस्टॉल करें

Ubuntu 24.04 से शुरुआत करें जिसमें NVIDIA driver पहले से इंस्टॉल हो। सबसे पहले driver की जाँच करें, क्योंकि इसके बिना बाद में आने वाली हर विफलता एक जैसी ही दिखती है।

nvidia-smi

यह आपके कार्ड और CUDA version के साथ एक table print करेगा। यदि यह NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver print करता है, तो kernel module load नहीं हुआ है, जो आमतौर पर बिना reboot किए kernel upgrade करने के बाद होता है। इसे यहीं ठीक करें। अन्यथा ComfyUI CPU path पर वापस चला जाएगा और आप मॉडल को दोष देने में एक घंटा बर्बाद कर देंगे।

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

कोई भी weight file डाउनलोड करने से पहले पुष्टि करें कि PyTorch कार्ड को देख पा रहा है।

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True और आपके कार्ड का नाम यह दर्शाता है कि stack सही है। False का अर्थ है कि इंस्टॉल किया गया wheel केवल CPU-only build है, जो तब होता है जब pip को पुराने इंस्टॉलेशन से cached torch मिलता है। ऊपर दिए गए index URL के साथ इसे फिर से इंस्टॉल करें।

Wan 2.2 मॉडल फाइलें डाउनलोड करें

ComfyUI के साथ कोई weights नहीं आते हैं, और एक वीडियो मॉडल केवल एक फाइल नहीं होता है। यह एक diffusion मॉडल, एक text encoder और एक VAE है, और प्रत्येक को अपनी निर्देशिका (directory) में रखा जाना चाहिए। यदि आप किसी फाइल को गलत फोल्डर में रखते हैं, तो loader node उसे सूची में नहीं दिखाएगा, और इसका कारण बताने के लिए कोई त्रुटि (error) भी नहीं आएगी।

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

5B मॉडल text-to-video और image-to-video दोनों को संभालता है, इसीलिए यह शुरुआत करने के लिए एक उचित विकल्प है। हमेशा .ckpt के बजाय .safetensors को प्राथमिकता दें। एक .ckpt फाइल एक pickled Python object होती है, इसलिए इसे लोड करने पर उसे बनाने वाले द्वारा लिखा गया कोड रन होता है। डिस्क स्पेस का उदारतापूर्वक बजट रखें: एक मॉडल फैमिली और उसके आउटपुट के साथ एक कार्यशील इंस्टॉलेशन के लिए 100 GB की आवश्यकता होती है, और वीडियो फाइलें उन PNG छवियों से कहीं अधिक बड़ी होती हैं जो एक इमेज वर्कफ़्लो पीछे छोड़ता है। अपनी वर्कफ़्लो JSON फाइलों का ऑब्जेक्ट स्टोरेज पर एन्क्रिप्टेड इंक्रीमेंटल बैकअप जैसे किसी माध्यम से बैकअप लें, क्योंकि weights को दोबारा डाउनलोड किया जा सकता है, लेकिन आपके द्वारा ट्यून किए गए वर्कफ़्लो को नहीं।

इसे चलाएं और सुरक्षित रूप से एक्सेस करें

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI में कोई लॉगिन स्क्रीन या यूजर अकाउंट नहीं होता है। जो कोई भी port 8188 तक पहुँच सकता है, वह जॉब्स को कतार में लगा सकता है, आपके द्वारा जनरेट की गई हर क्लिप को देख सकता है, और कस्टम नोड्स इंस्टॉल कर सकता है, जो आपके सर्वर पर arbitrary code execution के समान है। इसे localhost पर bind करें और अपनी मशीन से SSH tunnel के माध्यम से इसे एक्सेस करें।

ssh -N -L 8188:127.0.0.1:8188 you@your-server

इसके बाद अपने ब्राउज़र में http://127.0.0.1:8188 खोलें। नोड्स को मैन्युअल रूप से जोड़ने के बजाय ComfyUI टेम्पलेट्स मेनू से Wan 2.2 टेम्पलेट वर्कफ़्लो लोड करें। आधिकारिक टेम्पलेट्स में वे सैंपलर सेटिंग्स होती हैं जिनके लिए मॉडल को ट्यून किया गया है, और एक वीडियो वर्कफ़्लो में इमेज वर्कफ़्लो की तुलना में ऐसी कई जगहें होती हैं जहाँ वैल्यू गलत होने की संभावना अधिक रहती है।

जब API का उपयोग करना ही सही निर्णय हो

वीडियो जनरेशन को self-host करना तब सही विकल्प होता है जब वॉल्यूम अधिक और स्थिर हो, जब frames को आपके अपने infrastructure से बाहर नहीं जाना चाहिए, या जब आपको किसी ऐसे विशिष्ट model या custom adapter की आवश्यकता हो जो कोई भी hosted service प्रदान नहीं करती। यह तब भी सही है जब pipeline को एक साल बाद भी उसी तरह काम करना हो, क्योंकि hosted model बिना किसी version को pin किए बदल सकता है।

जब आपको महीने में केवल कुछ ही clips की आवश्यकता हो, जब आपको open models द्वारा उत्पादित output से अधिक लंबा या बड़ा output चाहिए हो, या जब आपकी deadline इसी सप्ताह हो, तब hosted API का उपयोग करें। break-even का ईमानदारी से आकलन करें। July 2026 के median मूल्य पर 24 GB card को चौबीसों घंटे किराए पर लेने का खर्च लगभग 260 dollars प्रति माह है, और उसी card को खरीदने की शुरुआती लागत एक भी frame generate करने से पहले ही इससे अधिक हो जाती है। एक idle self-hosted box हर बार per-clip API pricing से हार जाता है। यह वही trade-off है जो यह तय करता है कि आप text models को कैसे serve करते हैं, जिसे Ollama against vLLM for self-hosted LLM serving में कवर किया गया है, और यह whether a VPS with a GPU is worth the money at all में दिए गए अधिक बुनियादी प्रश्न पर आधारित है।

रेंडर विफल होने पर क्या जाँचें

यदि रेंडर sampler bar पूरा होने के बाद अंत में बंद हो जाता है, तो इसका अर्थ है कि VAE decode के दौरान memory समाप्त हो गई है। frame count को कम करें या tiled decode node का उपयोग करें। step count बदलने से कोई लाभ नहीं होगा, क्योंकि decode प्रक्रिया सभी steps पूरे होने के बाद केवल एक बार होती है।

यदि आउटपुट पूरी तरह काला या खराब तरीके से scrambled है, तो इसका सामान्य अर्थ यह है कि VAE मॉडल के साथ मेल नहीं खाता है। यदि Wan 2.1 VAE को Wan 2.2 diffusion मॉडल के साथ load किया जाता है, तो ठीक यही परिणाम मिलता है और log में कोई error दिखाई नहीं देता है।

यदि रेंडर चल रहा है लेकिन ऐसी मशीन पर घंटों का समय ले रहा है जिसमें GPU मौजूद है, तो इसका अर्थ है कि ComfyUI CPU path का उपयोग कर रहा है। startup log में device line की जाँच करें, फिर ऊपर दिए गए torch.cuda.is_available() check को दोबारा चलाएँ।

यदि प्रक्रिया बिना किसी Python traceback के dmesg में Killed के साथ गायब हो जाती है, तो यह kernel out-of-memory killer है। यह system RAM की समस्या है, VRAM की नहीं। offloading के लिए पूरे मॉडल का system RAM में load होना आवश्यक है, जिसका अर्थ है कि 16 GB वाली मशीन पर 5B मॉडल को offload करना अपर्याप्त है। RAM बढ़ाएँ या swap जोड़ें।

FAQ

क्या मैं बिना GPU वाले VPS पर AI वीडियो बना सकता हूँ?

नहीं, इस तरह से नहीं कि आप इसे दोबारा इस्तेमाल करना चाहें। एक 5 सेकंड की 720p क्लिप, जिसे 24 GB GPU पर बनाने में 9 मिनट लगते हैं, CPU पर उसे बनाने में कई घंटे लग सकते हैं। इसका कारण यह है कि मॉडल को चलाने के लिए CPU में matrix hardware नहीं होता और system RAM की bandwidth, GPU memory bandwidth की तुलना में बहुत कम होती है। एक CPU सर्वर ComfyUI interface को host कर सकता है, आपके models को store कर सकता है और workflows को संभाल सकता है, लेकिन rendering के लिए GPU की आवश्यकता होती है।

Wan 2.2 के लिए मुझे कितनी VRAM चाहिए?

TI2V-5B मॉडल के लिए, ComfyUI native offloading के साथ 8 GB न्यूनतम आवश्यकता है, और Alibaba द्वारा बताई गई गति प्राप्त करने के लिए 24 GB की सिफारिश की जाती है। A14B text-to-video और image-to-video मॉडल के लिए, model card में single-GPU inference हेतु कम से कम 80 GB VRAM की मांग की गई है, इसलिए इनके लिए data-center cards की आवश्यकता होती है।

self-hosted क्लिप कितनी लंबी हो सकती है?

जुलाई 2026 तक, 720p पर लगभग 5 सेकंड की क्लिप एक व्यावहारिक इकाई है। लंबी आउटपुट बनाने के लिए segments तैयार किए जाते हैं और उन्हें आपस में जोड़ा जाता है, जिसमें एक segment के अंतिम frame को अगले segment के पहले frame के रूप में उपयोग किया जाता है। जोड़ (joins) पर गुणवत्ता में गिरावट आती है, इसलिए एक लंबे वीडियो को एक बार में generate करने के बजाय editing का काम समझें।

क्या प्रति घंटे के हिसाब से GPU किराए पर लेना कार्ड खरीदने से सस्ता है?

यदि आप प्रतिदिन कुछ घंटों से कम rendering करते हैं, तो किराए पर लेना बेहतर है। जुलाई 2026 में 24 GB कार्ड के लिए लगभग 0.36 डॉलर प्रति घंटे की औसत दर पर, आप कार्ड की खरीद कीमत तक पहुँचने से पहले बहुत लंबे समय तक उसे किराए पर ले सकते हैं। साथ ही, आप ऐसा hardware खरीदने से बच जाते हैं जो बाद में आपके द्वारा उपयोग किए जाने वाले मॉडल के लिए अनुपयुक्त साबित हो सकता है। खरीदना तभी फायदेमंद है जब सर्वर दिन भर, हर दिन व्यस्त रहता हो।