SSD Nodes Learn 8GB RAM — $66/বছর
নির্দেশিকা Matt Connorদ্বারা Matt Connor · আপডেট করা হয়েছে 2026-08-01

Self-hosted AI video generator বাস্তবে কী করতে পারে

July 2026-এ Wan 2.2 ও HunyuanVideo কী তৈরি করে, 12 GB ও 24 GB VRAM-এ 5 সেকেন্ডের 720p clip বানাতে কত সময় লাগে এবং কখন API নেওয়া যুক্তিযুক্ত তা জানুন।

একটি self-hosted AI video generator বাস্তবে কী করতে পারে

একটি self-hosted AI video generator বর্তমানে কাজ করে, তবে demo reel-এ যা দেখানো হয় তার তুলনায় এটি ধীর এবং এর সক্ষমতা সীমিত। July 2026 অনুযায়ী চালানোর মতো open model হলো Alibaba-এর Wan 2.2 এবং Tencent-এর HunyuanVideo। গতি বাস্তবতার চেয়ে বেশি গুরুত্বপূর্ণ হলে Lightricks-এর LTX-Video ব্যবহার করা যায়। এগুলো সব Linux machine-এ NVIDIA GPU সহ ComfyUI-এর অধীনে চলে। ফল হিসেবে প্রায় পাঁচ সেকেন্ডের 720p clip পাওয়া যায়। এটি কোনো সম্পূর্ণ scene নয়। এটি এক মিনিটের finished footage-ও নয়।

বিস্তারিত আলোচনার আগে সংক্ষিপ্ত উত্তরটি হলো: একটি 24 GB card single-digit minutes-এ পাঁচ সেকেন্ডের 720p clip render করে। একটি 12 GB card একই কাজ করতে twenty minutes বা তার বেশি সময় নেয়, কারণ weights video memory-তে ধরে না এবং software layer-গুলো system RAM-এ বারবার স্থানান্তর করে। GPU ছাড়া server ব্যবহারিক অর্থে এটি করতে পারে না। CPU image generation ধীর হওয়ার যে হিসাব, CPU video generation-কে তা অর্থহীন করে তোলে।

আপনি যদি ইতিমধ্যে self-hosted image generator-এর hardware ladder পড়ে থাকেন, তাহলে video একই যুক্তি অনুসরণ করে, তবে প্রতিটি সংখ্যা এক ধাপ ওপরে। VRAM (video memory, graphics chip-এর পাশে soldered থাকা RAM) এখনও একমাত্র spec, যা নির্ধারণ করে এই কাজ আনন্দদায়ক হবে নাকি কষ্টকর।

একটি ভিডিওর খরচ একটি ছবির তুলনায় এত বেশি কেন

একটি diffusion model ধাপের মাধ্যমে denoising করে ছবি তৈরি করে। প্রতিটি ধাপে model-এর প্রতিটি weight পড়া হয়। একটি video model একই কাজ একসঙ্গে সম্পূর্ণ frame ব্লকের ওপর করে। একই সঙ্গে এটি সময়জুড়ে attention প্রয়োগ করে, যাতে frame 80 জানতে পারে frame 12 কেমন ছিল। প্রতি সেকেন্ডে 24 frame হারে 5 সেকেন্ডের ভিডিওতে একটি batch-এ 120টি frame থাকে।

এই temporal attention-এর কারণে clip-এর দৈর্ঘ্য বাড়লে খরচ সমান হারে বাড়ে না। frame-এর সংখ্যা দ্বিগুণ করলে sampler-এর প্রয়োজনীয় memory দ্বিগুণেরও বেশি হয়। তাই সমস্যা শুধু rendering ধীর হয়ে যাওয়া নয়। Render ব্যর্থ হয়ে বন্ধ হয়ে যায়।

আরেকটি memory spike অনেকেই প্রত্যাশা করেন না। Sampler শেষ হওয়ার পর VAE (variational autoencoder, যা compressed latent-কে প্রকৃত pixel-এ রূপান্তর করে) সম্পূর্ণ latent video একসঙ্গে decode করে। এই decode ধাপে sampling-এর চেয়েও বেশি memory প্রয়োজন হতে পারে। লক্ষণ হলো, job-এ completed progress bar দেখা যায়, তারপর এটি মুদ্রিত হয়:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

সমাধান হলো tiled decoding ব্যবহার করা অথবা clip ছোট করা। কোন stage-এ memory শেষ হয়েছে তা জানলে এক ঘণ্টা ভুল setting সমন্বয় করতে হয় না।

AI ভিডিও জেনারেশনের জন্য কত VRAM প্রয়োজন

দুটি প্রকাশিত তথ্য পুরো সিদ্ধান্তের ভিত্তি তৈরি করে, এবং এগুলো পরস্পরবিরোধী মনে হতে পারে। Alibaba জানায়, Wan 2.2 TI2V-5B মডেলটি 4090-এর মতো একটি সাধারণ ভোক্তা GPU-তে 720p ক্লিপ, প্রতি সেকেন্ডে 24 ফ্রেম এবং পাঁচ সেকেন্ড দৈর্ঘ্যে, নয় মিনিটেরও কম সময়ে তৈরি করে। তারা অন্তত 24 GB VRAM ব্যবহারের সুপারিশ করে। ComfyUI-এর ডকুমেন্টেশনে বলা হয়েছে, একই 5B মডেলটি “ComfyUI native offloading” ব্যবহার করলে 8GB VRAM-এ ভালোভাবে চলা উচিত।

দুটি তথ্যই সঠিক, কারণ এগুলো ভিন্ন বিষয় পরিমাপ করে। 8 GB হলো মডেলটি যেখানে চালানো যায়। 24 GB হলো যেখানে এটি স্বচ্ছন্দে চলে। Offloading-এর মাধ্যমে মডেলের বেশিরভাগ অংশ system RAM-এ রাখা হয় এবং প্রতিটি ধাপে layer-গুলো GPU-তে পাঠানো হয়। ফলে GPU গণনা করার বদলে PCIe bus-এর জন্য অপেক্ষা করে। এই খরচ প্রতিটি sampler step-এ দিতে হয়, শুধু একবার নয়।

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

শেষ সারিটিই কেবল vendor-এর প্রকাশিত তথ্য। 24 GB কার্ডে প্রতি ক্লিপের সময় 9 মিনিট, যা এই মডেলের জন্য Alibaba-এর প্রকাশিত সংখ্যা। অন্য সারিগুলোতে offloading-এর প্রভাব দেখানো হয়েছে; এগুলো benchmark result নয়, বরং আনুমানিক মাত্রার হিসাব। মূল বিষয়টি হলো: 8 GB কার্ডে 40 মিনিট সময় লাগা technically কার্যকর setup হলেও বাস্তবে এটি এমন একটি batch job, যা আপনি সারা রাত চালু রেখে দেন।

বড় Wan 2.2 মডেলগুলোর ক্ষেত্রে পরিস্থিতি সম্পূর্ণ ভিন্ন। A14B text-to-video এবং image-to-video variant-গুলোর single-GPU inference-এর জন্য অন্তত 80 GB VRAM প্রয়োজন। এটি data-center hardware; ডেস্কটপ মেশিনে বসানোর মতো কার্ড নয়। এই পর্যায়ে self-hosted ব্যবহারের অর্থ দাঁড়ায় ঘণ্টাভিত্তিক ভাড়ায় অন্য কারও accelerator ব্যবহার করা।

ভাড়া করা GPU-তে একটি ক্লিপের খরচ

বেশিরভাগ মানুষের জন্য এটি পরীক্ষা করার সঠিক উপায় হলো ভাড়া নেওয়া। কারণ আপনি যে কার্ড কিনবেন, মডেলটির জন্য 80 GB প্রয়োজন হলে সেটি ভুল হার্ডওয়্যার হয়ে যাবে। 2026 সালের July অনুযায়ী GPU ভাড়া বাজারে on-demand মূল্যের মধ্যম মান:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

4090 সারিতে 5B মডেল চলে এবং প্রতি ঘণ্টায় 0.36 ডলার খরচ হলে প্রতি ক্লিপে প্রায় 0.05 ডলার লাগে। 80 GB সারিগুলোতে 14B মডেল চলে। তাই হার্ডওয়্যারটি অনেক দ্রুত হলেও প্রতি ক্লিপের খরচ বেড়ে 0.6 ডলারে পৌঁছায়। মডেল যত বড়, ভিডিওর প্রতি সেকেন্ডে computation তত বেশি।

প্রতি ক্লিপে পাঁচ সেন্ট খরচ খুব সামান্য মনে হয়। বিভ্রান্তির কারণটি এখানেই। ব্যবহারযোগ্য প্রথম পাঁচ সেকেন্ড পেতে কখনোই একটি render যথেষ্ট হয় না। Video model-এ prompting হলো অনুসন্ধানের প্রক্রিয়া। নির্দিষ্ট motion-সহ একটি shot-এর জন্য keeper পাওয়ার আগে 20 থেকে 40টি render করা স্বাভাবিক। তাই একটি কার্যকর session-এর খরচ cents নয়, dollars-এ হিসাব হয়। ভাড়া করা হার্ডওয়্যারে একটি afternoon iteration-এর খরচ প্রায় একটি lunch-এর সমান।

ভাড়ার দুটি বিষয় উপেক্ষা করলে প্রকৃত খরচ হয়। Box weights download করার সময়ও আপনাকে বিল করা হয়। Wan 2.2-এর files, text encoder এবং VAE মিলে কয়েক দশক gigabytes হয়। তাই persistent volume-সহ provider বেছে নিন এবং একবারই download করুন। SSH session খোলা রেখে box idle থাকলেও আপনাকে বিল করা হয়। শুধু terminal বন্ধ না করে instance বন্ধ করুন।

GPU box-এ ComfyUI ইনস্টল করুন

NVIDIA driver আগে থেকেই ইনস্টল করা Ubuntu 24.04 দিয়ে শুরু করুন। প্রথমে driver পরীক্ষা করুন, কারণ এই পরীক্ষা না করলে পরবর্তী প্রতিটি ব্যর্থতা একই রকম দেখাবে।

nvidia-smi

এতে আপনার card এবং একটি CUDA version-সহ table দেখাতে হবে। যদি NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver দেখায়, kernel module লোড হয়নি। সাধারণত reboot না করে kernel upgrade করার পর এটি ঘটে। এখানেই সমস্যাটি ঠিক করুন। তা না হলে ComfyUI CPU path-এ চলে যাবে এবং আপনি model-কে দোষ দিতে দিতে এক ঘণ্টা ব্যয় করবেন।

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

একটিও weight file download করার আগে নিশ্চিত করুন যে PyTorch card-টি শনাক্ত করছে।

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True এবং আপনার card name দেখালে stack সুস্থ আছে। False দেখালে ইনস্টল করা wheel-টি CPU-only build। pip আগের install থেকে cache করা torch খুঁজে পেলে এটি ঘটে। উপরের index URL ব্যবহার করে আবার ইনস্টল করুন।

Wan 2.2 মডেল ফাইল ডাউনলোড করুন

ComfyUI-তে কোনো weights থাকে না, এবং একটি video model একটি মাত্র ফাইল নয়। এতে একটি diffusion model, একটি text encoder এবং একটি VAE থাকে। প্রতিটি নিজস্ব directory-তে রাখতে হয়। কোনো ফাইল ভুল folder-এ রাখলে loader node সেটি তালিকাভুক্ত করবে না। কেন এমন হচ্ছে, তা জানানোর জন্য কোনো error-ও দেখাবে না।

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

5B model text-to-video এবং image-to-video উভয়ই সমর্থন করে। তাই শুরু করার জন্য এটি যুক্তিসংগত পছন্দ। সবসময় .safetensors-কে .ckpt-এর ওপর অগ্রাধিকার দিন। .ckpt ফাইলটি একটি pickled Python object। তাই এটি load করলে যে ব্যক্তি এটি তৈরি করেছে, তার লেখা code চালানো হয়। Disk space পর্যাপ্ত রাখুন। একটি model family এবং তার output-সহ সচল installation-এর জন্য 100 GB প্রয়োজন। Video file একটি image workflow থেকে তৈরি হওয়া PNG image-এর তুলনায় অনেক বড়। আপনার workflow JSON file-গুলোর backup object storage-এ encrypted incremental backup-এর মতো পদ্ধতিতে রাখুন। কারণ weights পুনরায় download করা যায়, কিন্তু আপনার সমন্বয় করা workflow পুনরায় তৈরি করা যায় না।

এটি চালান এবং নিরাপদে অ্যাক্সেস করুন

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI-তে কোনো লগইন স্ক্রিন বা user account নেই। 8188 port-এ পৌঁছাতে পারে এমন যেকোনো ব্যক্তি job queue করতে, আপনার তৈরি করা প্রতিটি clip পড়তে এবং custom node install করতে পারে। এর ফলে আপনার server-এ নির্বিচারে code execution সম্ভব হয়। এটিকে localhost-এ bind করুন এবং নিজের machine থেকে SSH tunnel ব্যবহার করে অ্যাক্সেস করুন।

ssh -N -L 8188:127.0.0.1:8188 you@your-server

এরপর browser-এ http://127.0.0.1:8188 খুলুন। হাতে node সংযোগ করার পরিবর্তে ComfyUI templates menu থেকে Wan 2.2 template workflow load করুন। Official template-গুলোতে model-এর জন্য নির্ধারিত sampler setting থাকে। Video workflow-তে image workflow-এর তুলনায় এমন অনেক বেশি জায়গা থাকে যেখানে কোনো value নীরবে ভুল সেট হতে পারে।

সৎ উত্তর যখন API ব্যবহার করা

আপনার ফ্রেমগুলো নিজস্ব অবকাঠামোর বাইরে না যাওয়া দরকার হলে, অথবা কোনো hosted service-এ না থাকা নির্দিষ্ট model বা custom adapter প্রয়োজন হলে, self-hosted video generation ব্যবহার করাই সঠিক সিদ্ধান্ত। ভলিউম বেশি ও নিয়মিত হলেও এটি উপযুক্ত। এক বছর পরেও pipeline একইভাবে কাজ করা দরকার হলেও এটি উপযুক্ত, কারণ hosted model আপনার নিয়ন্ত্রণ ছাড়াই পরিবর্তিত হতে পারে এবং নির্দিষ্ট version pin করার সুযোগ নাও থাকতে পারে।

মাসে অল্প কয়েকটি clip প্রয়োজন হলে, open model-গুলোর উৎপাদিত output-এর চেয়ে দীর্ঘ বা বড় output প্রয়োজন হলে, অথবা এই সপ্তাহেই deadline থাকলে hosted API ব্যবহার করুন। break-even হিসাব সঠিকভাবে করুন। July 2026-এর median অনুযায়ী 24 GB card সারাক্ষণ ভাড়া নিলে মাসে প্রায় 260 dollars খরচ হয়। একই card কিনতে শুরুতেই এর চেয়ে বেশি খরচ হয়, এমনকি একটি frame generate করার আগেই। নিষ্ক্রিয় self-hosted box প্রতিবারই প্রতি-clip API pricing-এর কাছে হেরে যায়। Text model কীভাবে serve করবেন, সেই একই trade-off self-hosted LLM serving-এর জন্য Ollama বনাম vLLM-এ ব্যাখ্যা করা হয়েছে। এর সঙ্গে GPU-সহ VPS আদৌ অর্থের সঠিক ব্যবহার কি না-এ আলোচিত আরও মৌলিক প্রশ্নটিও যুক্ত রয়েছে।

রেন্ডার ব্যর্থ হলে যা পরীক্ষা করবেন

স্যাম্পলার বার সম্পূর্ণ হওয়ার পর রেন্ডার একেবারে শেষে বন্ধ হয়ে গেলে, VAE decode চালানোর সময় মেমরি শেষ হয়ে গেছে। ফ্রেমের সংখ্যা কমান অথবা tiled decode node ব্যবহার করুন। step-এর সংখ্যা পরিবর্তন করে লাভ হবে না, কারণ সব step চলার পর decode একবারই হয়।

আউটপুট সম্পূর্ণ কালো হলে বা গুরুতরভাবে এলোমেলো হলে সাধারণত VAE এবং model-এর মধ্যে মিল নেই। Wan 2.2 diffusion model-এর সঙ্গে Wan 2.1 VAE লোড করলে ঠিক এমন ফল দেখা যায়, এবং log-এ কোথাও কোনো error দেখা যায় না।

GPU আছে বলে নিশ্চিত এমন মেশিনে রেন্ডার চললেও ঘণ্টার পর ঘণ্টা লাগলে বুঝবেন ComfyUI CPU path ব্যবহার করছে। startup log-এ device line পরীক্ষা করুন, তারপর উপরের torch.cuda.is_available() check আবার চালান।

Killed-এ process অদৃশ্য হয়ে গেলে, dmesg-এ Python traceback না থাকলে, এটি kernel-এর out-of-memory killer-এর কাজ। অর্থাৎ সমস্যা system RAM-এ, VRAM-এ নয়। Offloading-এর জন্য পুরো model-কে system RAM-এ resident রাখতে হয়। তাই 16 GB মেমরির মেশিনে 5B model offload করার জন্য মেমরি কম পড়ে। RAM বাড়ান অথবা swap যোগ করুন।

FAQ

GPU ছাড়া VPS-এ কি AI video তৈরি করা যায়?

না, অন্তত এমনভাবে নয় যাতে আপনি এটি দ্বিতীয়বার ব্যবহার করতে চান। 24 GB GPU-তে যে পাঁচ সেকেন্ডের 720p clip তৈরি করতে নয় মিনিট লাগে, CPU-তে সেটিতে অনেক ঘণ্টা লাগে। কারণ model চালানোর জন্য CPU-তে matrix hardware নেই, এবং system RAM-এর bandwidth GPU memory bandwidth-এর তুলনায় এক order of magnitude কম। CPU server ComfyUI interface host করতে, model সংরক্ষণ করতে এবং workflow ধরে রাখতে পারে। তবে rendering-এর জন্য GPU প্রয়োজন।

Wan 2.2-এর জন্য কত VRAM প্রয়োজন?

TI2V-5B model-এর জন্য ComfyUI native offloading ব্যবহার করলে 8 GB হলো সর্বনিম্ন প্রয়োজন। প্রকাশিত গতি পেতে Alibaba 24 GB সুপারিশ করে। A14B text-to-video এবং image-to-video model-এর ক্ষেত্রে model card single-GPU inference-এর জন্য কমপক্ষে 80 GB VRAM চায়। তাই এগুলোর জন্য data-center card প্রয়োজন।

Self-hosted clip কত দীর্ঘ হতে পারে?

July 2026 অনুযায়ী 720p-তে প্রায় পাঁচ সেকেন্ড হলো বাস্তবসম্মত একক। দীর্ঘ output তৈরি করতে segment তৈরি করে সেগুলো যুক্ত করতে হয়। এ ক্ষেত্রে একটি segment-এর শেষ frame-কে পরের segment-এর প্রথম frame হিসেবে ব্যবহার করা হয়। সংযোগস্থলগুলোর মধ্যে quality পরিবর্তিত হয়। তাই দীর্ঘ video-কে একটি generation-এর পরিবর্তে editing job হিসেবে বিবেচনা করুন।

ঘণ্টাভিত্তিক GPU ভাড়া করা কি card কেনার চেয়ে সস্তা?

প্রতিদিন কয়েক ঘণ্টার কম rendering হলে ভাড়া নেওয়াই সাশ্রয়ী। July 2026-এ 24 GB card-এর median ভাড়ার হার প্রায় 0.36 dollars per hour ছিল। তাই card-এর purchase price-এর সমান খরচ হওয়ার আগে দীর্ঘ সময় ভাড়া নিতে পারবেন। আপনি এমন hardware কেনার ঝুঁকিও এড়াতে পারবেন, যা আপনার প্রয়োজনীয় model-এর জন্য পরে ভুল শ্রেণির বলে প্রমাণিত হতে পারে। প্রতিদিন প্রায় সারাদিন box ব্যস্ত থাকলেই কেবল কেনা সাশ্রয়ী হয়।

#ai-video#comfyui#gpu#self-hosting#wan#vram