Self-hosted AI video generator বাস্তবে কী করতে পারে
July 2026-এ Wan 2.2, HunyuanVideo ও LTX-Video-এর বাস্তব output, প্রয়োজনীয় VRAM, rented GPU-তে 5 সেকেন্ডের clip-এর খরচ এবং API বেছে নেওয়ার সময় জানুন।
self-hosted AI video generator বাস্তবে কী করতে পারে
একটি self-hosted AI video generator এখন ব্যবহার করা যায়, তবে demo reel-এ যা দেখানো হয় তার তুলনায় এটি ধীর এবং সীমিত। July 2026 পর্যন্ত চালানোর মতো open model হলো Alibaba-এর Wan 2.2 এবং Tencent-এর HunyuanVideo। বাস্তবতার চেয়ে গতি বেশি গুরুত্বপূর্ণ হলে Lightricks-এর LTX-Video-ও ব্যবহার করা যায়। এগুলো সবই NVIDIA GPU-যুক্ত Linux machine-এ ComfyUI-এর অধীনে চলে। এর ফল হিসেবে প্রায় পাঁচ সেকেন্ডের 720p clip পাওয়া যায়। একটি পূর্ণ scene নয়। সম্পাদিত এক মিনিটের ফুটেজও নয়।
বিস্তারিত আলোচনার আগে সংক্ষিপ্ত উত্তরটি জেনে নিন। একটি 24 GB card পাঁচ সেকেন্ডের 720p clip কয়েক মিনিটের মধ্যে render করে। একটি 12 GB card একই কাজ করতে 20 মিনিট বা তার বেশি সময় নেয়, কারণ weights video memory-তে ধরে না এবং software বারবার layers system RAM-এ পাঠায় ও ফিরিয়ে আনে। GPU ছাড়া server বাস্তব ব্যবহারের জন্য এটি করতে পারে না। CPU-তে image generation ধীর হওয়ার যে কারণ, CPU-তে video generation-কে কার্যত অর্থহীন করে তোলার কারণও সেটিই।
আপনি যদি ইতিমধ্যে self-hosted image generator-এর hardware ladder পড়ে থাকেন, তাহলে video-র ক্ষেত্রেও একই যুক্তি প্রযোজ্য, তবে প্রতিটি সংখ্যা এক শ্রেণি বেশি ধরে বিবেচনা করতে হবে। VRAM (video memory, graphics chip-এর পাশে soldered RAM) এখনও একমাত্র specification, যা নির্ধারণ করে এই কাজ স্বাচ্ছন্দ্যকর হবে নাকি কষ্টকর।
একটি ভিডিওর খরচ একটি ছবির চেয়ে এত বেশি কেন
একটি diffusion model ধাপের মাধ্যমে denoising করে একটি image তৈরি করে, এবং প্রতিটি ধাপে model-এর প্রতিটি weight পড়ে। একটি video model একই কাজ একসঙ্গে পুরো frame block-এর ওপর করে। এটি সময়জুড়ে attention-ও যোগ করে, যাতে frame 80 জানতে পারে frame 12 দেখতে কেমন ছিল। প্রতি সেকেন্ডে 24 frame হলে 5 সেকেন্ডের একটি ভিডিওতে এক batch-এ 120টি frame থাকে।
এই temporal attention-এর কারণেই clip-এর দৈর্ঘ্য বাড়লে খরচ সরল অনুপাতে বাড়ে না। frame-এর সংখ্যা দ্বিগুণ করলে sampler-এর প্রয়োজনীয় memory দ্বিগুণেরও বেশি হয়। তাই সমস্যা ধীর rendering নয়। render ব্যর্থ হয়ে বন্ধ হয়ে যায়।
আরেকটি memory spike-ও দেখা দিতে পারে, যা অনেকেই প্রত্যাশা করেন না। sampler শেষ হওয়ার পরে VAE (variational autoencoder, যা compressed latent-কে বাস্তব pixel-এ রূপান্তর করে) পুরো latent video একসঙ্গে decode করে। এই decode-এ sampling-এর চেয়েও বেশি memory লাগতে পারে। লক্ষণ হলো, progress bar সম্পূর্ণ দেখানোর পর job ব্যর্থ হয়ে নিচের বার্তাটি দেখায়:
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiBএর সমাধান হলো tiled decoding ব্যবহার করা অথবা clip ছোট করা। কোন পর্যায়ে memory শেষ হয়েছে তা জানা থাকলে এক ঘণ্টা ভুল সেটিং সমন্বয় করা থেকে বাঁচা যায়।
AI video generation-এর জন্য কত VRAM প্রয়োজন
দুটি প্রকাশিত তথ্য পুরো সিদ্ধান্তের পরিসর নির্ধারণ করে, এবং প্রথম দেখায় এগুলো পরস্পরবিরোধী মনে হয়। Alibaba জানায়, Wan 2.2 TI2V-5B model একটি 4090-এর মতো একক consumer GPU-তে 24 frames per second-এ 720p clip, যার দৈর্ঘ্য পাঁচ seconds, নয় minutes-এর কম সময়ে তৈরি করতে পারে। তারা অন্তত 24 GB VRAM সুপারিশ করে। ComfyUI documentation-এ বলা হয়েছে, একই 5B model "should fit well on 8GB vram with the ComfyUI native offloading"।
দুটিই সঠিক, কারণ এগুলো ভিন্ন বিষয় পরিমাপ করে। 8 GB হলো যেখানে modelটি চালানো সম্ভব। 24 GB হলো যেখানে এটি স্বচ্ছন্দে চলে। Offloading-এর সময় model-এর বেশির ভাগ system RAM-এ রাখা হয় এবং প্রতিটি step-এ layer-গুলো GPU-তে পাঠানো হয়। ফলে card-টি গণনা করার বদলে PCIe bus-এর জন্য অপেক্ষা করে। এই খরচ একবার নয়, প্রতিটি sampler step-এ দিতে হয়।
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]শুধু শেষ row-টি vendor-এর প্রকাশিত তথ্য। 24 GB card-এ প্রতি clip-এর সময় 9 minutes, যা এই model-এর জন্য Alibaba-এর প্রকাশিত সংখ্যা। অন্য row-গুলোতে offloading-এর প্রভাব দেখানো হয়েছে; এগুলো benchmark result নয়, বরং order-of-magnitude অনুমান। মূল বিষয়টি হলো প্রবণতা: 8 GB card-এ 40 minutes সময় লাগা technically কার্যকর setup হলেও বাস্তবে এটি এমন একটি batch job, যা আপনি রাতভর চালু রেখে দেন।
বড় Wan 2.2 model-গুলো সম্পূর্ণ ভিন্ন শ্রেণির। A14B text-to-video এবং image-to-video variant-গুলোর single-GPU inference-এর জন্য অন্তত 80 GB VRAM প্রয়োজন। এটি data-center hardware; desk machine-এ বসানোর মতো card নয়। এই পর্যায়ে self-hosted ব্যবস্থার অর্থ দাঁড়ায় প্রতি ঘণ্টায় অন্যের accelerator ভাড়া নেওয়া। Text-এর ক্ষেত্রে একই হিসাব আরও অনেক বড় পরিসরে প্রযোজ্য। সেখানে Kimi K3-এর মতো 2.8 trillion parameter model নিজে host করা একটি card নিয়ে প্রশ্ন থাকে না; বরং আপনি কতগুলো 80 GB card একসঙ্গে সংযোগ করার খরচ বহন করতে পারবেন, সেটিই প্রশ্ন হয়ে দাঁড়ায়।
একটি ভাড়া করা GPU-তে একটি clip-এর খরচ
বেশির ভাগ মানুষের এই পদ্ধতি পরীক্ষা করার জন্য ভাড়া নেওয়াই উচিত, কারণ আপনি যে GPU কিনবেন তা ভুল hardware হতে পারে, যদি শেষ পর্যন্ত আপনার প্রয়োজনীয় model-এর জন্য 80 GB দরকার হয়। 2026 সালের July পর্যন্ত GPU rental market-এ on-demand মূল্যের median:
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]4090 row-তে 5B model চলে এবং প্রতি ঘণ্টায় 0.36 dollar হিসাবে প্রতি clip-এর খরচ প্রায় 0.05 dollar। 80 GB row-গুলোতে 14B model চলে। তাই hardware নিজে অনেক দ্রুত হলেও প্রতি clip-এর খরচ বেড়ে 0.6 dollar হয়। Model বড় হলে প্রতি second video-তে বেশি compute লাগে।
প্রতি clip পাঁচ cent শুনতে খুব কম মনে হয়। বিভ্রান্তির কারণ এখানেই। ব্যবহারযোগ্য প্রথম পাঁচ second কখনও একটি render-এ পাওয়া যায় না। Video model-এ prompting আসলে একটি search প্রক্রিয়া। নির্দিষ্ট motion থাকা একটি shot-এর জন্য উপযোগী result পাওয়ার আগে 20 থেকে 40টি render স্বাভাবিক। তাই একটি কার্যকর working session-এর খরচ cent নয়, dollar-এ হিসাব হয়। ভাড়া করা hardware-এ একটি afternoon iteration-এর খরচ প্রায় একটি lunch-এর সমান।
ভাড়া নেওয়ার ক্ষেত্রে দুটি বিষয় উপেক্ষা করলে প্রকৃত খরচ হয়। Box weights download করার সময়ও আপনাকে billing করা হয়। Wan 2.2 files, তাদের text encoder এবং VAE মিলে কয়েক দশ gigabyte হয়। তাই persistent volume-সহ provider বেছে নিন এবং একবার download করুন। SSH session খোলা রেখে box idle থাকলেও আপনাকে billing করা হয়। শুধু terminal বন্ধ না করে instance stop করুন।
GPU box-এ ComfyUI ইনস্টল করুন
NVIDIA driver আগে থেকেই ইনস্টল করা Ubuntu 24.04 দিয়ে শুরু করুন। প্রথমে driver পরীক্ষা করুন। এই পরীক্ষা না করলে পরের প্রতিটি failure একই রকম মনে হবে।
nvidia-smiএতে আপনার card এবং একটি CUDA version-সহ table দেখানোর কথা। যদি NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver দেখায়, তাহলে kernel module loaded হয়নি। সাধারণত reboot না করে kernel upgrade করলে এটি ঘটে। এখানেই সমস্যা ঠিক করুন। তা না হলে ComfyUI CPU path-এ fallback করবে, আর আপনি এক ঘণ্টা model-কে দোষ দেবেন।
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txtএকটিও weight file download করার আগে নিশ্চিত করুন যে PyTorch card-টি শনাক্ত করছে।
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"True এবং আপনার card name দেখালে stack সঠিকভাবে কাজ করছে। False দেখালে ইনস্টল করা wheel-টি CPU-only build। pip আগের install থেকে cached torch ব্যবহার করলে এটি ঘটে। উপরের index URL ব্যবহার করে আবার install করুন।
Wan 2.2 model ফাইল ডাউনলোড করুন
ComfyUI কোনো weights ছাড়াই আসে, এবং একটি video model একটি মাত্র ফাইল নয়। এতে একটি diffusion model, একটি text encoder এবং একটি VAE থাকে, এবং প্রতিটি নিজস্ব directory-তে রাখতে হয়। কোনো ফাইল ভুল folder-এ রাখলে loader node সেটি তালিকাভুক্ত করবে না, কেন তা বোঝানোর জন্য কোনো error-ও দেখাবে না।
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors5B model text-to-video এবং image-to-video উভয়ই সমর্থন করে। তাই এটি দিয়ে শুরু করাই যুক্তিসঙ্গত। সবসময় .safetensors-কে .ckpt-এর ওপর অগ্রাধিকার দিন। .ckpt ফাইল একটি pickled Python object। তাই এটি load করলে যে ব্যক্তি এটি তৈরি করেছে, তার লেখা code চালানো হয়। Disk space-এর জন্য পর্যাপ্ত বরাদ্দ রাখুন: একটি model family এবং তার output-সহ কার্যকর install-এর জন্য 100 GB প্রয়োজন, এবং video file একটি image workflow থেকে তৈরি PNG image-এর তুলনায় অনেক বড় হয়। আপনার workflow JSON file object storage-এ encrypted incremental backup-এর মতো পদ্ধতিতে backup করুন, কারণ weights আবার download করা যায়, কিন্তু আপনার tuned workflow পুনরায় তৈরি করা যায় না।
চালান এবং নিরাপদে এতে প্রবেশ করুন
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188ComfyUI-তে কোনো login screen বা user account নেই। যে কেউ port 8188-এ পৌঁছাতে পারলে job queue করতে, আপনার তৈরি করা প্রতিটি clip পড়তে এবং custom node install করতে পারে। এর মাধ্যমে আপনার server-এ arbitrary code execution সম্ভব। এটিকে localhost-এ bind করুন এবং নিজের machine থেকে SSH tunnel ব্যবহার করে এতে প্রবেশ করুন।
ssh -N -L 8188:127.0.0.1:8188 you@your-serverএরপর browser-এ http://127.0.0.1:8188 খুলুন। নিজে node সংযুক্ত করার পরিবর্তে ComfyUI templates menu থেকে Wan 2.2 template workflow load করুন। Official template-গুলোতে model-এর জন্য নির্ধারিত sampler settings থাকে। এছাড়া image workflow-এর তুলনায় video workflow-তে এমন অনেক বেশি জায়গা থাকে যেখানে কোনো value নিঃশব্দে ভুল সেট হতে পারে।
যখন API ব্যবহার করাই সঠিক সিদ্ধান্ত
Self-hosted video generation বেছে নেওয়া সঠিক সিদ্ধান্ত, যখন কাজের পরিমাণ বেশি এবং নিয়মিত, যখন আপনার frames অবশ্যই নিজের infrastructure-এর বাইরে যাওয়া চলবে না, অথবা যখন আপনার এমন নির্দিষ্ট model বা custom adapter প্রয়োজন যা কোনো hosted service দেয় না। Pipeline-টি এক বছর পরেও একইভাবে কাজ করতে হবে—এমন প্রয়োজন থাকলেও এটি সঠিক সিদ্ধান্ত। কারণ hosted model আপনার নিয়ন্ত্রণের বাইরে পরিবর্তিত হতে পারে এবং pin করার মতো কোনো version নাও থাকতে পারে।
মাসে অল্প কয়েকটি clip প্রয়োজন হলে, open model-গুলো যতটা output তৈরি করতে পারে তার চেয়ে দীর্ঘ বা বড় output প্রয়োজন হলে, অথবা এই সপ্তাহেই deadline থাকলে hosted API ব্যবহার করুন। Break-even হিসাবটি বাস্তবভাবে করুন। July 2026-এর median rate অনুযায়ী 24 GB card সারাক্ষণ ভাড়া নিলে মাসে প্রায় 260 dollars খরচ হয়। একই card কিনতে শুরুতেই এর চেয়েও বেশি খরচ হবে, একটি frame তৈরি করার আগেই। Idle self-hosted box প্রতিবারই per-clip API pricing-এর কাছে হেরে যায়। Text model কীভাবে serve করবেন, সেটিও একই trade-off-এর ওপর নির্ভর করে। এটি self-hosted LLM serving-এর জন্য Ollama বনাম vLLM-এ আলোচনা করা হয়েছে। এর পাশাপাশি GPU-সহ VPS-এর খরচ আদৌ সার্থক কি না-এ থাকা আরও মৌলিক প্রশ্নটিও বিবেচনা করতে হয়।
রেন্ডার ব্যর্থ হলে যা পরীক্ষা করবেন
Sampler bar সম্পূর্ণ হওয়ার পর রেন্ডার একেবারে শেষে বন্ধ হয়ে গেলে VAE decode ধাপে মেমরি শেষ হয়ে গেছে। Frame count কমান অথবা tiled decode node ব্যবহার করুন। Step count পরিবর্তন করে লাভ হবে না, কারণ সব step শেষ হওয়ার পর decode একবারই চলে।
Output সম্পূর্ণ কালো বা গুরুতরভাবে বিকৃত হলে সাধারণত VAE মডেলের সঙ্গে সামঞ্জস্যপূর্ণ নয়। Wan 2.2 diffusion model-এর সঙ্গে Wan 2.1 VAE load করলে ঠিক এমন ফল পাওয়া যায়, অথচ log-এর কোথাও কোনো error দেখা যায় না।
যে মেশিনে GPU আছে বলে নিশ্চিত, সেখানে রেন্ডার চললেও কয়েক ঘণ্টা লাগলে ComfyUI CPU path ব্যবহার করছে। Startup log-এ device line পরীক্ষা করুন, তারপর উপরের torch.cuda.is_available() check আবার চালান।
dmesg-এ Killed দেখা যাওয়ার সময় process হঠাৎ অদৃশ্য হয়ে গেলে সেটি kernel-এর out-of-memory killer-এর কাজ। অর্থাৎ সমস্যা system RAM-এ, VRAM-এ নয়। Offloading-এর জন্য পুরো model-টি system RAM-এ resident থাকতে হয়। তাই 16 GB মেমরির মেশিনে 5B model offload করার মতো RAM যথেষ্ট নয়। RAM বাড়ান অথবা swap যোগ করুন।
FAQ
আমি কি GPU ছাড়া VPS-এ AI video তৈরি করতে পারি?
না, অন্তত এমনভাবে নয় যে আপনি এটি দ্বিতীয়বার ব্যবহার করতে চাইবেন। 24 GB GPU-তে যে 720p, পাঁচ সেকেন্ডের clip তৈরি করতে নয় মিনিট লাগে, CPU-তে সেটির জন্য অনেক ঘণ্টা লাগতে পারে। কারণ model চালানোর জন্য CPU-তে matrix hardware নেই, এবং system RAM-এর bandwidth GPU memory bandwidth-এর তুলনায় এক order of magnitude কম। CPU server-এ ComfyUI interface চালানো, model সংরক্ষণ করা এবং workflow রাখা যায়। তবে rendering-এর জন্য GPU প্রয়োজন।
Wan 2.2-এর জন্য কত VRAM প্রয়োজন?
TI2V-5B model-এর জন্য ComfyUI native offloading ব্যবহার করলে 8 GB হলো ন্যূনতম পরিমাণ। প্রকাশিত speed পেতে Alibaba 24 GB সুপারিশ করে। A14B text-to-video এবং image-to-video model-এর ক্ষেত্রে model card single-GPU inference-এর জন্য অন্তত 80 GB VRAM চায়। তাই এগুলোর জন্য data-center card প্রয়োজন।
Self-hosted clip কত দীর্ঘ হতে পারে?
July 2026 অনুযায়ী 720p-তে প্রায় পাঁচ সেকেন্ড হলো বাস্তবসম্মত একক। দীর্ঘ output পেতে segment তৈরি করে সেগুলো জোড়া দেওয়া হয়। এ ক্ষেত্রে একটি segment-এর শেষ frame-কে পরবর্তী segment-এর প্রথম frame হিসেবে ব্যবহার করা হয়। Join-এর অংশগুলোতে quality ধীরে ধীরে পরিবর্তিত হয়। তাই দীর্ঘ video-কে একটি generation হিসেবে না দেখে editing job হিসেবে বিবেচনা করুন।
প্রতি ঘণ্টায় GPU ভাড়া নেওয়া কি card কেনার চেয়ে সস্তা?
প্রতিদিন কয়েক ঘণ্টার কম rendering হলে ভাড়া নেওয়াই সাশ্রয়ী। July 2026-এর হিসাবে 24 GB card-এর প্রতি ঘণ্টার median ভাড়া প্রায় 0.36 dollars। card-টির ক্রয়মূল্যের সমান খরচে পৌঁছানোর আগে আপনি দীর্ঘ সময় ভাড়া নিতে পারবেন। আপনি এমন hardware কেনার ঝুঁকিও এড়াতে পারবেন, যা পরে আপনার প্রয়োজনীয় model-এর জন্য ভুল শ্রেণির বলে প্রমাণিত হয়। প্রতিদিন প্রায় পুরো দিন box ব্যস্ত থাকলেই কেনা সাশ্রয়ী হয়।