स्वतः होस्ट केलेला AI व्हिडिओ जनरेटर: वास्तव
July 2026 मध्ये Wan 2.2 आणि HunyuanVideo साठी 24 GB VRAM वर 5 सेकंदांची clip काही मिनिटांत, तर 12 GB वर 20 मिनिटांहून अधिक लागतात. API कधी वापरावी ते जाणून घ्या.
स्वतः होस्ट केलेला AI व्हिडिओ जनरेटर प्रत्यक्षात काय करू शकतो
स्वतः होस्ट केलेला AI व्हिडिओ जनरेटर आज वापरता येतो. मात्र demo reels मध्ये दाखवल्यापेक्षा तो धीमा आणि मर्यादित आहे. July 2026 पर्यंत चालवण्यास योग्य open models म्हणजे Alibaba चे Wan 2.2 आणि Tencent चे HunyuanVideo. वास्तववादापेक्षा वेग महत्त्वाचा असल्यास Lightricks चे LTX-Video देखील योग्य आहे. हे सर्व Linux मशीनवरील NVIDIA GPU वर ComfyUI अंतर्गत चालतात. त्यातून साधारण 720p गुणवत्तेची पाच सेकंदांची clip मिळते. पूर्ण scene नाही. पूर्ण तयार footage चा एक मिनिटाचा भागही नाही.
तपशीलापूर्वी थोडक्यात उत्तर असे आहे. 24 GB कार्डवर 720p गुणवत्तेची पाच सेकंदांची clip single-digit minutes मध्ये render होते. 12 GB कार्डवर त्याच कामाला वीस मिनिटे किंवा त्याहून अधिक वेळ लागतो. कारण weights video memory मध्ये बसत नाहीत आणि software layers सतत system RAM मध्ये पुढे-मागे हलवत राहते. GPU नसलेला server हे उपयुक्त अर्थाने करू शकत नाही. CPU image generation धीमे करणारेच गणित CPU video generation ला निरुपयोगी बनवते.
तुम्ही स्वतः होस्ट केलेल्या image generator साठीचे hardware स्तर आधीच वाचले असल्यास, video मध्ये तोच मुद्दा आहे; फक्त प्रत्येक संख्या एक class वर जाते. VRAM (video memory, graphics chip च्या शेजारी solder केलेली RAM) हेच अजूनही हे काम सुलभ आहे की त्रासदायक, हे ठरवणारे एकमेव specification आहे.
एका व्हिडिओची किंमत एका प्रतिमेपेक्षा इतकी जास्त का असते
Diffusion model प्रतिमा टप्प्याटप्प्याने denoise करून तयार करते. प्रत्येक टप्प्यात model मधील प्रत्येक weight वाचला जातो. Video model हेच काम एकाच वेळी frames च्या संपूर्ण block वर करते. तसेच ते वेळेनुसार attention लागू करते, त्यामुळे frame 80 ला frame 12 कसा दिसत होता हे समजते. 24 frames per second वेगाने 5 seconds म्हणजे एका batch मध्ये 120 frames.
याच temporal attention मुळे clip ची लांबी वाढल्यावर खर्च सरळ प्रमाणात वाढत नाही. Frame count दुप्पट केल्यास sampler ला लागणारी memory दुपटीपेक्षा अधिक वाढते. त्यामुळे समस्या rendering धीमे होणे ही नसते. Render अयशस्वी होतो.
लोकांच्या अपेक्षेपेक्षा memory मध्ये आणखी एक वाढ होते. Sampler पूर्ण झाल्यानंतर VAE (variational autoencoder; compressed latent चे वास्तविक pixels मध्ये रूपांतर करणारा भाग) संपूर्ण latent video एकाच वेळी decode करतो. या decode साठी sampling पेक्षा अधिक memory लागू शकते. याचे लक्षण म्हणजे progress bar पूर्ण झालेला दिसतो आणि त्यानंतर हे छापले जाते:
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiBयावर उपाय म्हणजे tiled decoding किंवा लहान clip वापरणे. Memory कोणत्या टप्प्यावर संपली हे समजल्यास चुकीची setting एका तासासाठी बदलत बसण्याचे टाळता येते.
AI व्हिडिओ निर्मितीसाठी किती VRAM आवश्यक आहे
दोन प्रकाशित आकडे संपूर्ण निर्णयाची चौकट स्पष्ट करतात. मात्र ते परस्परविरोधी वाटतात. Alibaba नुसार, Wan 2.2 TI2V-5B मॉडेल 4090 सारख्या एका consumer GPU वर 720p, 24 frames per second आणि पाच सेकंद लांबीच्या क्लिप 9 मिनिटांपेक्षा कमी वेळात तयार करते. त्यासाठी किमान 24 GB VRAM ची शिफारस केली आहे. ComfyUI documentation नुसार, हेच 5B मॉडेल “ComfyUI native offloading” वापरल्यास 8GB vram मध्ये सहज चालले पाहिजे.
दोन्ही विधाने बरोबर आहेत, कारण त्यात वेगवेगळ्या गोष्टी मोजल्या आहेत. 8 GB ही मॉडेल बसण्याची मर्यादा आहे. 24 GB मध्ये ते आरामात चालते. Offloading मध्ये मॉडेलचा बहुतांश भाग system RAM मध्ये ठेवला जातो आणि प्रत्येक step साठी layers GPU मध्ये पाठवले जातात. त्यामुळे GPU गणना करण्याऐवजी PCIe bus कडून डेटाची वाट पाहण्यात वेळ घालवतो. हा खर्च एकदाच होत नाही; तो प्रत्येक sampler step वर होतो.
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]शेवटची row हीच vendor figure आहे. 24 GB कार्डवर प्रत्येक clip तयार करण्यास 9 मिनिटे लागतात. हा या मॉडेलसाठी Alibaba ने प्रकाशित केलेला आकडा आहे. इतर rows मध्ये offloading मुळे होणारा परिणाम दाखवला आहे. ते benchmark results नसून order-of-magnitude अंदाज आहेत. मुख्य मुद्दा हा आहे: 8 GB कार्डवर 40 मिनिटे लागणे म्हणजे तांत्रिकदृष्ट्या कार्यरत setup आहे, पण प्रत्यक्षात तो रात्रभर चालू ठेवावा लागणारा batch job आहे.
मोठी Wan 2.2 मॉडेल्स वेगळ्याच स्तरावर आहेत. A14B text-to-video आणि image-to-video variants साठी single-GPU inference ला किमान 80 GB VRAM आवश्यक आहे. हे data-center hardware आहे. ते desk machine मध्ये बसवता येणारे कार्ड नाही. या टप्प्यावर self-hosted म्हणजे तासाच्या हिशोबाने दुसऱ्याचा accelerator भाड्याने घेणे असा अर्थ होतो. Text बाजूला हेच गणित आणखी मोठ्या प्रमाणावर लागू होते. Kimi K3 सारखे 2.8 trillion parameter मॉडेल self-host करणे हा एका कार्डाचा प्रश्न राहत नाही. त्यासाठी किती 80 GB कार्ड्स एकत्र जोडण्याचा खर्च परवडतो, हा प्रश्न बनतो.
भाड्याने घेतलेल्या GPU वर एका clip ची किंमत
बहुतेक लोकांनी हे प्रथम भाड्याने घेतलेल्या GPU वर तपासावे. कारण तुम्हाला शेवटी हवा असलेला model 80 GB मागत असेल, तर तुम्ही खरेदी केलेले card योग्य hardware ठरणार नाही. July 2026 पर्यंत GPU rental market मधील on-demand किमतींची median मूल्ये:
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]4090 row 5B model चालवते आणि प्रति clip सुमारे 0.05 dollars खर्च येतो. तिची किंमत प्रति तास 0.36 dollars आहे. 80 GB rows 14B models चालवतात. म्हणून hardware स्वतः बरेच वेगवान असूनही प्रति clip किंमत 0.6 dollars पर्यंत वाढते. मोठा model म्हणजे video च्या प्रत्येक second साठी अधिक computation.
एका clip साठी पाच cents ही किंमत नगण्य वाटते. पण याच ठिकाणी चुकीचा अंदाज होतो. वापरण्यायोग्य पहिली पाच seconds ची clip कधीही एका render मध्ये मिळत नाही. Video model ला prompt देणे ही search प्रक्रिया आहे. विशिष्ट motion असलेल्या shot साठी योग्य output मिळण्यापूर्वी वीस ते चाळीस renders करणे सामान्य आहे. त्यामुळे एका working session चा खर्च cents ऐवजी dollars मध्ये होतो. भाड्याने घेतलेल्या hardware वर दुपारभर iteration करण्याचा खर्च साधारण lunch इतका असतो.
भाड्याच्या सेवेशी संबंधित दोन गोष्टींकडे दुर्लक्ष केल्यास त्यांचा प्रत्यक्ष खर्च होतो. Box weights download करत असतानाही billing सुरू असते. Wan 2.2 files, त्यांचा text encoder आणि VAE मिळून tens of gigabytes जागा घेतात. त्यामुळे persistent volume असलेला provider निवडा आणि download एकदाच करा. SSH session उघडे असताना box idle राहिल्यासही billing सुरू असते. फक्त terminal बंद करू नका; instance stop करा.
GPU बॉक्सवर ComfyUI इंस्टॉल करा
NVIDIA driver आधीच इंस्टॉल केलेल्या Ubuntu 24.04 पासून सुरुवात करा. प्रथम driver तपासा, कारण ही पडताळणी न केल्यास पुढील प्रत्येक त्रुटी सारखीच दिसते.
nvidia-smiयामुळे तुमचे card आणि CUDA आवृत्ती असलेला table दिसला पाहिजे. जर NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver दिसत असेल, तर kernel module load केलेले नाही. हे सहसा kernel upgrade केल्यानंतर reboot न केल्यामुळे होते. ही समस्या याच टप्प्यावर दुरुस्त करा. अन्यथा ComfyUI CPU path वर fallback करेल आणि तुम्ही model ला दोष देत एक तास घालवाल.
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txtएकही weight file download करण्यापूर्वी PyTorch ला card दिसत आहे याची खात्री करा.
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"True आणि तुमच्या card चे नाव दिसत असल्यास stack योग्यरित्या कार्यरत आहे. False याचा अर्थ इंस्टॉल केलेले wheel हे CPU-only build आहे. pip ला आधीच्या install मधील cached torch सापडल्यास असे होते. वरील index URL वापरून पुन्हा install करा.
Wan 2.2 model फाइल्स डाउनलोड करा
ComfyUI कोणतेही weights सोबत देत नाही आणि video model ही एकच फाइल नसते. त्यात diffusion model, text encoder आणि VAE असतात. यापैकी प्रत्येकासाठी स्वतंत्र directory असते. फाइल चुकीच्या folder मध्ये ठेवल्यास loader node ती दाखवतच नाही. असे का झाले याचे कोणतेही error दिसत नाही.
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors5B model text-to-video आणि image-to-video दोन्ही हाताळतो. त्यामुळे सुरुवातीसाठी तो योग्य पर्याय आहे. नेहमी .safetensors ला .ckpt पेक्षा प्राधान्य द्या. .ckpt फाइल हा pickled Python object असतो. त्यामुळे ती load केल्यावर ती तयार करणाऱ्या व्यक्तीने लिहिलेला code चालतो. Disk space पुरेशा प्रमाणात ठेवा. एक model family आणि त्यातून तयार होणारे output यांसह कार्यरत installation साठी 100 GB आवश्यक असते. Video files या image workflow मुळे तयार होणाऱ्या PNG images पेक्षा खूप मोठ्या असतात. तुमच्या workflow JSON files चा object storage वर encrypted incremental backups सारख्या पद्धतीने backup घ्या, कारण weights पुन्हा download करता येतात; तुमचे tuned workflows पुन्हा मिळतीलच असे नाही.
ते चालवा आणि सुरक्षितपणे त्याच्यापर्यंत पोहोचा
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188ComfyUI मध्ये login screen किंवा user accounts नाहीत. Port 8188 पर्यंत पोहोचू शकणारा कोणीही jobs queue करू शकतो, तुम्ही तयार केलेली प्रत्येक clip वाचू शकतो आणि custom nodes install करू शकतो. यामुळे तुमच्या server वर arbitrary code execution होऊ शकते. ते localhost वर bind करा आणि तुमच्या स्वतःच्या machine वरून SSH tunnel द्वारे त्याच्यापर्यंत पोहोचा.
ssh -N -L 8188:127.0.0.1:8188 you@your-serverत्यानंतर तुमच्या browser मध्ये http://127.0.0.1:8188 उघडा. Nodes हाताने जोडण्याऐवजी ComfyUI templates menu मधून Wan 2.2 template workflow load करा. Official templates मध्ये model साठी tuned केलेली sampler settings असतात. Video workflow मध्ये image workflow पेक्षा एखादी value चुकून चुकीची ठेवली जाण्याची ठिकाणे खूप अधिक असतात.
API वापरणे योग्य उत्तर कधी असते
व्हिडिओ निर्मिती self-host करणे योग्य ठरते, जेव्हा वापराचे प्रमाण जास्त आणि स्थिर असते, जेव्हा तुमचे frames तुमच्या स्वतःच्या infrastructureच्या बाहेर जाऊ नयेत, किंवा जेव्हा hosted serviceमध्ये उपलब्ध नसलेले विशिष्ट model किंवा custom adapter आवश्यक असतो. Pipeline एका वर्षानंतरही त्याच पद्धतीने कार्यरत राहणे आवश्यक असेल, तरी हा पर्याय योग्य ठरतो. कारण hosted modelमध्ये तुमच्या नियंत्रणाशिवाय बदल होऊ शकतो आणि pin करण्यासाठी version उपलब्ध नसेल.
दर महिन्याला मोजके clips आवश्यक असतील, open modelsपेक्षा अधिक लांब किंवा मोठे output हवे असेल, किंवा या आठवड्यात deadline असेल, तर hosted API वापरा. Break-evenचा हिशेब वास्तववादी पद्धतीने करा. July 2026 मधील median दरानुसार 24 GB card चोवीस तास भाड्याने घेण्याचा खर्च दरमहा सुमारे 260 dollars येतो. तोच card खरेदी करण्यासाठी एक frame तयार करण्यापूर्वीच त्यापेक्षा जास्त प्रारंभिक खर्च येतो. वापरात नसलेला self-hosted box प्रत्येक वेळी per-clip API pricingपेक्षा तोट्याचा ठरतो. Text models serve करण्याची पद्धत ठरवतानाही हाच trade-off लागू होतो. त्याची चर्चा self-hosted LLM servingसाठी Ollama विरुद्ध vLLM मध्ये केली आहे. तसेच, GPU असलेला VPS मुळातच खर्चाच्या दृष्टीने योग्य आहे का, या अधिक मूलभूत प्रश्नावरही हे अवलंबून असते: GPU असलेला VPS मुळात खर्चाच्या दृष्टीने योग्य आहे का.
रेंडर अयशस्वी झाल्यावर काय तपासावे
sampler bar पूर्ण झाल्यानंतर अगदी शेवटी थांबणारा render VAE decode दरम्यान memory संपल्यामुळे अयशस्वी झाला. frame count कमी करा किंवा tiled decode node वापरा. step count बदलून उपयोग होणार नाही, कारण प्रत्येक step पूर्ण झाल्यानंतर decode एकदाच होते.
पूर्णपणे काळा किंवा मोठ्या प्रमाणात विस्कळीत output सहसा VAE model शी जुळत नसल्याचे दर्शवतो. Wan 2.2 diffusion model सोबत Wan 2.1 VAE load केल्यास नेमका हा परिणाम मिळतो आणि log मध्ये कुठेही error दिसत नाही.
GPU असलेल्या machine वर render सुरू राहतो, पण त्याला अनेक तास लागतात, याचा अर्थ ComfyUI CPU path वापरत आहे. startup log मधील device line तपासा आणि त्यानंतर वरील torch.cuda.is_available() check पुन्हा चालवा.
Python traceback नसताना dmesg मध्ये Killed सह process गायब होत असेल, तर kernel चा out-of-memory killer कार्यरत झाला आहे. त्यामुळे समस्या system RAM ची आहे, VRAM ची नाही. Offloading साठी संपूर्ण model system RAM मध्ये resident असणे आवश्यक असते. म्हणून 16 GB box वर 5B model offload करण्यासाठी RAM अपुरी पडते. RAM वाढवा किंवा swap जोडा.
FAQ
मी GPU नसलेल्या VPS वर AI video तयार करू शकतो का?
नाही. प्रत्यक्ष वापरासाठी ते व्यवहार्य ठरणार नाही. 24 GB GPU वर 720p ची पाच सेकंदांची clip तयार करण्यासाठी नऊ मिनिटे लागत असतील, तर CPU वर त्याला अनेक तास लागतील. याचे कारण म्हणजे model कडे गणनांसाठी matrix hardware उपलब्ध नसते आणि system RAM ची bandwidth ही GPU memory bandwidth पेक्षा एका order of magnitude ने कमी असते. CPU server वर ComfyUI interface host करता येतो, models साठवता येतात आणि workflows ठेवता येतात. मात्र rendering साठी GPU आवश्यक असतो.
Wan 2.2 साठी मला किती VRAM आवश्यक आहे?
TI2V-5B model साठी ComfyUI native offloading वापरल्यास 8 GB ही किमान मर्यादा आहे. प्रकाशित speed मिळवण्यासाठी Alibaba 24 GB ची शिफारस करते. A14B text-to-video आणि image-to-video models साठी single-GPU inference करताना किमान 80 GB VRAM आवश्यक असल्याचे model card मध्ये नमूद आहे. त्यामुळे त्यांच्यासाठी data-center cards आवश्यक आहेत.
self-hosted clip किती लांब असू शकते?
July 2026 पर्यंत 720p वर सुमारे पाच सेकंद हा व्यावहारिक एकक आहे. अधिक लांबीचा output segments तयार करून आणि ते जोडून निर्माण केला जातो. यासाठी एका segment ची शेवटची frame पुढील segment ची पहिली frame म्हणून वापरली जाते. जोडांच्या ठिकाणी quality मध्ये हळूहळू फरक पडतो. त्यामुळे long video कडे एकाच generation ऐवजी editing job म्हणून पाहा.
GPU card खरेदी करण्यापेक्षा तासानुसार GPU भाड्याने घेणे स्वस्त आहे का?
दररोज काही तासांपेक्षा कमी rendering होत असल्यास भाड्याने घेणे अधिक फायदेशीर ठरते. July 2026 मधील 24 GB card साठी सुमारे 0.36 dollars प्रति तास या median दरानुसार, त्या card ची खरेदी किंमत गाठण्यापूर्वी तुम्ही बराच काळ GPU भाड्याने घेऊ शकता. तसेच तुम्हाला प्रत्यक्षात आवश्यक असलेल्या model साठी चुकीच्या class चे hardware खरेदी करण्याचा धोका टाळता येतो. Box दररोज बहुतांश वेळ वापरात असेल, तेव्हाच खरेदी करणे फायदेशीर ठरते.