SSD Nodes Learn 8GB RAM — $66/वर्ष
मार्गदर्शक Matt Connorद्वारे Matt Connor · अपडेटेड 2026-08-01

स्वतः होस्ट केलेला AI video generator खरेच काय देतो?

July 2026 मधील Wan 2.2, HunyuanVideo आणि LTX-Video साठी VRAM गरज, rented GPU वरील पाच सेकंदांच्या clip ची किंमत आणि API कधी निवडावी हे जाणून घ्या.

स्वतः होस्ट केलेला AI व्हिडिओ जनरेटर प्रत्यक्षात काय करू शकतो

स्वतः होस्ट केलेला AI व्हिडिओ जनरेटर आज वापरता येतो. मात्र डेमो रील्समध्ये दाखवल्यापेक्षा तो अधिक संथ आणि मर्यादित आहे. July 2026 पर्यंत चालवण्यास योग्य असलेली मुक्त मॉडेल्स Alibaba चे Wan 2.2 आणि Tencent चे HunyuanVideo आहेत. वास्तववादापेक्षा वेग महत्त्वाचा असल्यास Lightricks चे LTX-Video देखील वापरता येते. ही सर्व मॉडेल्स NVIDIA GPU असलेल्या Linux मशीनवर ComfyUI अंतर्गत चालतात. त्यातून साधारण पाच सेकंदांची 720p क्लिप मिळते. पूर्ण दृश्य मिळत नाही. पूर्ण केलेले एक मिनिटाचे फुटेजही मिळत नाही.

तपशील पाहण्यापूर्वी थोडक्यात उत्तर असे आहे. 24 GB कार्डवर पाच सेकंदांची 720p क्लिप तयार होण्यासाठी काही मिनिटे लागतात. 12 GB कार्डवर तेच काम करण्यास 20 मिनिटे किंवा त्याहून अधिक वेळ लागतो, कारण मॉडेलचे weights video memory मध्ये मावत नाहीत आणि software चे layers system RAM मध्ये वारंवार हलवावे लागतात. GPU नसलेला server हे काम उपयुक्त पद्धतीने करू शकत नाही. CPU वर image generation संथ करणारी गणना CPU वर video generation ला व्यवहार्य ठरत नाही.

तुम्ही स्वतः होस्ट केलेल्या image generator साठीचे hardware स्तर आधीच वाचले असल्यास, video साठी तोच मुद्दा लागू होतो; फक्त प्रत्येक संख्या एक स्तराने वाढते. VRAM (video memory, graphics chip च्या शेजारी बसवलेली RAM) हेच अजूनही हे काम सोपे आहे की त्रासदायक, हे ठरवणारे एकमेव specification आहे.

एका प्रतिमेपेक्षा एका व्हिडिओची किंमत इतकी जास्त का असते

Diffusion model प्रतिमा टप्प्याटप्प्याने denoise करून तयार करतो. प्रत्येक टप्प्यात model मधील प्रत्येक weight वाचला जातो. Video model हेच काम एकाच वेळी frames च्या संपूर्ण block वर करतो. तसेच, तो वेळेनुसार attention जोडतो, त्यामुळे frame 80 ला frame 12 कसा दिसत होता हे समजू शकते. 24 frames per second या दराने 5 seconds म्हणजे एका batch मध्ये 120 frames.

Temporal attention मुळे clip ची लांबी वाढल्यावर cost प्रमाणानुसार वाढत नाही. Frame count दुप्पट केल्यावर sampler ला लागणारी memory दुप्पटपेक्षा अधिक वाढते. त्यामुळे समस्या rendering धीमे होण्यात नाही. Render अयशस्वी होतो.

आणखी एक memory spike अपेक्षित नसतो. Sampler पूर्ण झाल्यानंतर VAE (variational autoencoder, compressed latent चे वास्तविक pixels मध्ये रूपांतर करणारा भाग) संपूर्ण latent video एकाच वेळी decode करतो. या decode साठी sampling पेक्षा अधिक memory लागू शकते. याचे लक्षण म्हणजे progress bar पूर्ण झाल्याचे दिसते आणि त्यानंतर हे छापले जाते:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

यावर उपाय म्हणजे tiled decoding किंवा लहान clip वापरणे. कोणत्या टप्प्यात memory संपली हे समजल्यास चुकीच्या बाबीचे tuning करण्यात एक तास वाया जात नाही.

AI व्हिडिओ निर्मितीसाठी किती VRAM आवश्यक आहे

दोन प्रकाशित आकडे संपूर्ण निर्णयाची चौकट ठरवतात, पण ते परस्परविरोधी वाटतात. Alibaba नुसार Wan 2.2 TI2V-5B मॉडेल 4090 सारख्या एका ग्राहक GPU वर 720p क्लिप 24 frames per second या वेगाने आणि पाच सेकंदांच्या कालावधीसाठी नऊ मिनिटांपेक्षा कमी वेळात तयार करते. त्यासाठी किमान 24 GB VRAM ची शिफारस केली जाते. ComfyUI दस्तऐवजानुसार, तेच 5B मॉडेल "ComfyUI native offloading" वापरल्यास 8GB vram मध्ये सहज बसले पाहिजे.

दोन्ही विधाने बरोबर आहेत, कारण त्यात वेगवेगळ्या बाबी मोजल्या आहेत. 8 GB ही मॉडेल बसण्याची किमान क्षमता आहे. 24 GB मध्ये ते सुरळीतपणे चालते. Offloading मध्ये मॉडेलचा बहुतांश भाग system RAM मध्ये ठेवला जातो आणि प्रत्येक step साठी layers GPU मध्ये पाठवल्या जातात. त्यामुळे GPU card गणना करण्याऐवजी PCIe bus कडून डेटा येण्याची वाट पाहण्यात वेळ घालवते. हा खर्च एकदाच होत नाही; प्रत्येक sampler step वर होतो.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

शेवटची row हीच vendor figure आहे. 24 GB card वर प्रत्येक clip साठी 9 मिनिटे लागतात. या मॉडेलसाठी Alibaba ने प्रकाशित केलेला हाच आकडा आहे. इतर rows मध्ये offloading मुळे होणारा परिणाम दाखवला आहे. ते benchmark results नसून order-of-magnitude अंदाज आहेत. मुख्य मुद्दा हा आहे: 8 GB card वर 40 मिनिटे लागणे म्हणजे तांत्रिकदृष्ट्या कार्यरत setup, पण प्रत्यक्षात रात्रभर चालू ठेवावी लागणारी batch job.

मोठी Wan 2.2 मॉडेल्स वेगळ्या स्तरावर आहेत. A14B text-to-video आणि image-to-video variants साठी single-GPU inference करता किमान 80 GB VRAM आवश्यक आहे. हे data-center hardware आहे. ते desk machine मध्ये बसवता येणारे card नाही. या टप्प्यावर self-hosted म्हणजे प्रतितास भाड्याने घेतलेला दुसऱ्याचा accelerator वापरणे, असा अर्थ होतो.

भाड्याच्या GPU वर एका क्लिपचा खर्च

बहुतेक लोकांनी हे तपासण्यासाठी भाड्याने GPU घ्यावा. कारण तुम्ही खरेदी केलेले कार्ड चुकीच्या प्रकारचे हार्डवेअर ठरू शकते, जर तुम्हाला शेवटी 80 GB आवश्यक असलेले मॉडेल हवे असेल. July 2026 पर्यंत GPU भाडे बाजारातील मागणीनुसार मध्यम किंमती:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

4090 ओळीत 5B मॉडेल चालते आणि 0.05 डॉलर प्रति क्लिप, म्हणजे 0.36 डॉलर प्रति तास, खर्च येतो. 80 GB क्षमतेच्या ओळींमध्ये 14B मॉडेल चालतात. त्यामुळे हार्डवेअर स्वतः अधिक वेगवान असूनही प्रति क्लिप खर्च वाढून 0.6 डॉलर होतो. मॉडेल जितके मोठे, तितकी व्हिडिओच्या प्रत्येक सेकंदासाठी अधिक गणना आवश्यक.

एका क्लिपसाठी पाच सेंट हा नगण्य खर्च वाटतो. मात्र याच ठिकाणी दिशाभूल होते. वापरण्यायोग्य पहिली पाच सेकंदांची क्लिप मिळवण्यासाठी एकच render पुरेसा नसतो. व्हिडिओ मॉडेलला prompt देणे ही शोधप्रक्रिया आहे. विशिष्ट हालचाल असलेल्या shot साठी चांगला परिणाम मिळेपर्यंत 20 ते 40 renders करणे सामान्य आहे. त्यामुळे कार्यसत्राचा खर्च सेंटऐवजी डॉलरमध्ये होतो. भाड्याच्या हार्डवेअरवर दुपारभर iteration करण्याचा खर्च साधारणपणे दुपारच्या जेवणाइतका असतो.

भाड्याच्या सेवेशी संबंधित 2 बाबींकडे दुर्लक्ष केल्यास प्रत्यक्ष खर्च वाढतो. box weights डाउनलोड करत असताना तुमच्याकडून शुल्क आकारले जाते. Wan 2.2 फाइल्स, त्यांचा text encoder आणि VAE मिळून दहापट GB जागा घेतात. त्यामुळे persistent volume असलेला provider निवडा आणि डाउनलोड एकदाच करा. SSH session उघडे असताना box idle राहिल्यासही शुल्क आकारले जाते. फक्त terminal बंद करू नका; त्याऐवजी instance थांबवा.

GPU box वर ComfyUI स्थापित करा

NVIDIA driver आधीच स्थापित असलेल्या Ubuntu 24.04 पासून सुरुवात करा. प्रथम driver तपासा, कारण ही तपासणी न केल्यास नंतरच्या प्रत्येक त्रुटीसारखीच दिसते.

nvidia-smi

यामध्ये तुमचे card आणि CUDA आवृत्ती असलेला तक्ता दिसला पाहिजे. यामध्ये NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver दिसल्यास kernel module लोड केलेले नाही. हे सहसा reboot न करता kernel upgrade केल्यानंतर होते. हे याच ठिकाणी दुरुस्त करा. अन्यथा ComfyUI CPU मार्गावर fallback करेल आणि तुम्ही एक तास model ला दोष देत राहाल.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

एकही weight file download करण्यापूर्वी PyTorch ला card दिसत असल्याची खात्री करा.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True आणि तुमच्या card चे नाव दिसल्यास stack व्यवस्थित आहे. False दिसल्यास स्थापित wheel ही CPU-only build आहे. pip ला आधीच्या installation मधील cached torch सापडल्यावर असे होते. वरील index URL वापरून पुन्हा install करा.

Wan 2.2 मॉडेल फाइल्स डाउनलोड करा

ComfyUI मध्ये कोणतेही weights समाविष्ट नसतात आणि video model ही एकच फाइल नसते. त्यात diffusion model, text encoder आणि VAE असतात आणि प्रत्येक फाइल स्वतःच्या directory मध्ये ठेवावी लागते. फाइल चुकीच्या folder मध्ये ठेवल्यास loader node ती दाखवतच नाही. याचे कारण स्पष्ट करणारी कोणतीही error दिसत नाही.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

5B model text-to-video आणि image-to-video दोन्ही हाताळतो. त्यामुळे सुरुवातीसाठी तो योग्य पर्याय आहे. नेहमी .safetensors ला .ckpt पेक्षा प्राधान्य द्या. .ckpt फाइल हा pickled Python object असतो. त्यामुळे तो load केल्यावर तो तयार करणाऱ्या व्यक्तीने लिहिलेला code चालतो. Disk space पुरेसा ठेवा. एका model family आणि त्याच्या output सह कार्यरत install साठी 100 GB आवश्यक असते. Video files, image workflow मुळे तयार होणाऱ्या PNG images पेक्षा खूप मोठ्या असतात. तुमच्या workflow JSON files चा object storage मध्ये encrypted incremental backups सारख्या पद्धतीने backup घ्या. Weights पुन्हा download करता येतात, पण तुमचे सुधारित workflows पुन्हा मिळवता येत नाहीत.

ते चालवा आणि सुरक्षितपणे प्रवेश करा

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI मध्ये लॉगिन स्क्रीन किंवा वापरकर्ता खाती नाहीत. port 8188 पर्यंत पोहोचू शकणारा कोणताही घटक jobs रांगेत लावू शकतो, तुम्ही तयार केलेल्या सर्व clips वाचू शकतो आणि custom nodes install करू शकतो. यामुळे तुमच्या server वर arbitrary code execution होऊ शकते. ते localhost ला bind करा आणि तुमच्या स्वतःच्या machine वरून SSH tunnel द्वारे प्रवेश करा.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

त्यानंतर तुमच्या browser मध्ये http://127.0.0.1:8188 उघडा. Nodes हाताने जोडण्याऐवजी ComfyUI templates menu मधून Wan 2.2 template workflow load करा. Official templates मध्ये model साठी समायोजित केलेल्या sampler settings असतात. तसेच, image workflow च्या तुलनेत video workflow मध्ये एखादे value नकळत चुकीचे ठेवण्याची ठिकाणे अधिक असतात.

प्रामाणिक उत्तर API वापरणे असेल तेव्हा

जेव्हा वापराचे प्रमाण जास्त आणि सातत्यपूर्ण असते, जेव्हा तुमचे frames तुमच्या स्वतःच्या infrastructure बाहेर जाऊ नयेत, किंवा जेव्हा hosted service उपलब्ध करून देत नसलेले विशिष्ट model किंवा custom adapter आवश्यक असतो, तेव्हा video generation स्वतःच्या infrastructure वर host करणे योग्य ठरते. एका वर्षानंतरही pipeline त्याच प्रकारे कार्यरत राहणे आवश्यक असेल, तरीही हा पर्याय योग्य आहे. कारण hosted model मध्ये तुमच्या नियंत्रणाशिवाय बदल होऊ शकतो आणि pin करण्यासाठी कोणतीही version उपलब्ध नसेल.

जेव्हा महिन्याला काही मोजके clips आवश्यक असतात, जेव्हा open models तयार करतात त्यापेक्षा मोठा किंवा अधिक लांबीचा output आवश्यक असतो, किंवा या आठवड्यातच deadline असते, तेव्हा hosted API वापरा. Break-even गणना प्रामाणिकपणे करा. July 2026 मधील median दराने 24 GB card चोवीस तास भाड्याने घेतल्यास महिन्याला सुमारे 260 dollars खर्च येतो. तोच card खरेदी करण्यासाठी एकही frame generate करण्यापूर्वीच यापेक्षा जास्त आगाऊ खर्च येतो. निष्क्रिय self-hosted box प्रत्येक वेळी per-clip API pricing पेक्षा तोट्याचा ठरतो. Text models serve करण्याचा निर्णयही याच trade-off वर ठरतो. याची माहिती self-hosted LLM serving साठी Ollama विरुद्ध vLLM येथे दिली आहे. तसेच, GPU असलेला VPS मुळातच खर्चाच्या दृष्टीने योग्य आहे का, हा अधिक मूलभूत प्रश्न GPU असलेला VPS मुळातच खर्चाच्या दृष्टीने योग्य आहे का येथे मांडला आहे.

रेंडर अयशस्वी झाल्यावर काय तपासावे

सॅम्पलर बार पूर्ण झाल्यानंतर रेंडर अगदी शेवटी थांबला आणि memory संपली असल्यास, ही समस्या VAE decode दरम्यान झाली आहे. फ्रेमची संख्या कमी करा किंवा tiled decode node वापरा. step count बदलून ही समस्या सुटणार नाही, कारण प्रत्येक step पूर्ण झाल्यानंतर decode एकदाच होते.

आउटपुट पूर्णपणे काळे किंवा मोठ्या प्रमाणात विस्कळीत असल्यास, VAE आणि model एकमेकांशी जुळत नसण्याची शक्यता असते. Wan 2.1 VAE Wan 2.2 diffusion model सोबत load केल्यास नेमके असेच होते आणि log मध्ये कुठेही error दिसत नाही.

GPU असलेल्या मशीनवर render पूर्ण होण्यासाठी अनेक तास लागत असल्यास, ComfyUI CPU path वापरत आहे. startup log मधील device line तपासा आणि त्यानंतर वरील torch.cuda.is_available() check पुन्हा चालवा.

dmesg मध्ये Killed दिसल्यानंतर कोणताही Python traceback न देता process नाहीसा होत असल्यास, हे kernel out-of-memory killer मुळे झाले आहे. त्यामुळे समस्या VRAM मध्ये नसून system RAM मध्ये आहे. Offloading साठी संपूर्ण model system RAM मध्ये resident असणे आवश्यक असते. त्यामुळे 16 GB मशीनवर 5B model offload करण्यासाठी RAM अपुरी पडते. RAM वाढवा किंवा swap जोडा.

FAQ

GPU नसलेल्या VPS वर AI व्हिडिओ तयार करता येतो का?

नाही, किमान तो व्हिडिओ पुन्हा वापरण्याइतक्या कार्यक्षमतेने तयार करता येत नाही. 24 GB GPU वर तयार होण्यासाठी 9 मिनिटे लागणारी 5 सेकंदांची 720p क्लिप CPU वर तयार होण्यासाठी अनेक तास लागू शकतात. याचे कारण म्हणजे मॉडेलसाठी मॅट्रिक्स गणना करण्यासाठी आवश्यक हार्डवेअर CPU कडे नसते आणि system RAM ची बँडविड्थ GPU memory च्या बँडविड्थपेक्षा एका क्रमाने कमी असते. CPU server वर ComfyUI interface चालवता येतो, models साठवता येतात आणि workflows ठेवता येतात. मात्र rendering साठी GPU आवश्यक आहे.

Wan 2.2 साठी किती VRAM आवश्यक आहे?

TI2V-5B model साठी ComfyUI native offloading वापरल्यास 8 GB ही किमान आवश्यकता आहे. प्रकाशित वेग मिळवण्यासाठी Alibaba 24 GB ची शिफारस करते. A14B text-to-video आणि image-to-video models साठी model card मध्ये single-GPU inference साठी किमान 80 GB VRAM मागितले आहे. त्यामुळे त्यांच्यासाठी data-center cards आवश्यक आहेत.

self-hosted क्लिप किती लांब असू शकते?

July 2026 पर्यंत 720p मध्ये सुमारे 5 सेकंद हा व्यावहारिक कालावधी आहे. अधिक लांबीचे output segments तयार करून आणि ते जोडून बनवले जाते. यासाठी एका segment ची शेवटची frame पुढील segment ची पहिली frame म्हणून वापरली जाते. जोडांच्या ठिकाणी quality मध्ये हळूहळू फरक पडतो. त्यामुळे दीर्घ व्हिडिओला एकाच generation ऐवजी editing job समजा.

तासानुसार GPU भाड्याने घेणे card खरेदी करण्यापेक्षा स्वस्त आहे का?

दररोज काही तासांपेक्षा कमी rendering करायचे असल्यास भाड्याने घेणे अधिक फायदेशीर ठरते. July 2026 मधील 24 GB card साठी सुमारे 0.36 dollars प्रति तास या median दरानुसार, त्या card ची खरेदी किंमत गाठण्यापूर्वी तुम्ही बराच काळ GPU भाड्याने घेऊ शकता. तसेच, तुम्हाला प्रत्यक्षात आवश्यक असलेल्या model साठी चुकीच्या वर्गातील hardware खरेदी करण्याचा धोका टाळता येतो. Box दररोज जवळजवळ पूर्ण दिवस व्यस्त असेल तेव्हाच खरेदी करणे फायदेशीर ठरते.

#ai-video#comfyui#gpu#self-hosting#wan#vram