مولد ویدئوی AI خودمیزبان واقعاً چه میکند؟
مدلهای متنباز ویدئو در ژوئیه 2026 چه خروجیای میسازند؟ نیاز VRAM هر مدل، هزینه کلیپ 5 ثانیهای روی GPU اجارهای و زمان استفاده از API را ببینید.
یک مولد ویدئوی هوش مصنوعی خودمیزبان عملاً چه کارهایی میتواند انجام دهد
یک مولد ویدئوی هوش مصنوعی خودمیزبان اکنون قابل استفاده است، اما از آنچه حلقههای نمایشی نشان میدهند کندتر و محدودتر است. در ژوئیه 2026، مدلهای متنباز قابلاجرا شامل Wan 2.2 از Alibaba و HunyuanVideo از Tencent هستند. LTX-Video از Lightricks نیز زمانی مناسب است که سرعت از واقعگرایی مهمتر باشد. همه این مدلها با ComfyUI روی یک ماشین Linux مجهز به GPU شرکت NVIDIA اجرا میشوند. خروجی، کلیپی تقریباً پنجثانیهای با وضوح 720p است. این خروجی یک صحنه نیست. یک دقیقه ویدئوی نهاییشده هم نیست.
پیش از جزئیات، پاسخ کوتاه این است: یک کارت 24 GB، یک کلیپ پنجثانیهای با وضوح 720p را در چند دقیقه تولید میکند. یک کارت 12 GB همین کار را در 20 دقیقه یا بیشتر انجام میدهد، زیرا وزنهای مدل در حافظه ویدئویی جا نمیشوند و نرمافزار لایهها را پیوسته بین حافظه ویدئویی و RAM سیستم جابهجا میکند. سروری بدون GPU نمیتواند این کار را بهصورت کاربردی انجام دهد. محاسباتی که تولید تصویر با CPU را کند میکنند، تولید ویدئو با CPU را عملاً بیفایده میکنند.
اگر نردبان سختافزاری یک مولد تصویر خودمیزبان را قبلاً خواندهاید، ویدئو همان استدلال را با انتقال همه اعداد به یک رده بالاتر دنبال میکند. VRAM (حافظه ویدئویی، یعنی RAM لحیمشده در کنار تراشه گرافیکی) همچنان تنها مشخصهای است که تعیین میکند این کار لذتبخش باشد یا دشوار.
چرا یک ویدیو بسیار بیشتر از یک تصویر هزینه دارد
یک مدل diffusion با حذف نویز در چند مرحله تصویر تولید میکند و در هر مرحله همه وزنهای مدل را میخواند. یک مدل ویدیو همین کار را همزمان روی یک بلوک کامل از فریمها انجام میدهد و attention را در طول زمان نیز اضافه میکند تا فریم 80 بداند فریم 12 چه شکلی بوده است. پنج ثانیه با نرخ 24 فریم بر ثانیه، در یک batch شامل 120 فریم است.
همین temporal attention باعث میشود هزینه با طول کلیپ بهصورت خطی افزایش پیدا نکند. دو برابر شدن تعداد فریمها، حافظه موردنیاز sampler را بیش از دو برابر میکند. بنابراین حالت خرابی، طولانیتر شدن rendering نیست؛ بلکه فرایند render متوقف میشود.
یک افزایش مصرف حافظه دیگر نیز وجود دارد که بسیاری انتظارش را ندارند. پس از پایان کار sampler، بخش VAE (variational autoencoder؛ بخشی که latent فشرده را به پیکسلهای واقعی تبدیل میکند) کل latent video را یکجا decode میکند. این decode ممکن است به حافظه بیشتری از مرحله sampling نیاز داشته باشد. نشانه آن، jobی است که نوار پیشرفت تکمیلشده را نشان میدهد و سپس این پیام را چاپ میکند:
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiBراهحل، استفاده از tiled decoding یا کوتاهتر کردن کلیپ است. اگر بدانید حافظه در کدام مرحله تمام شده است، برای مدت یک ساعت تنظیمات بخش نادرست را تغییر نمیدهید.
برای تولید ویدئوی هوش مصنوعی به چه مقدار VRAM نیاز دارید
دو رقم منتشرشده، چارچوب کل تصمیم را مشخص میکنند و در نگاه اول متناقض به نظر میرسند. Alibaba اعلام میکند که مدل Wan 2.2 TI2V-5B کلیپهای 720p را با سرعت 24 فریمبرثانیه و به مدت پنج ثانیه، روی یک GPU مصرفی مانند 4090 در کمتر از 9 دقیقه تولید میکند و حداقل 24 GB از VRAM را توصیه میکند. مستندات ComfyUI اعلام میکنند که همین مدل 5B، با قابلیت native offloading در ComfyUI، «باید بهخوبی روی 8GB vram اجرا شود».
هر دو گزاره درست هستند، زیرا دو چیز متفاوت را اندازهگیری میکنند. 8 GB مقداری است که مدل با آن اجرا میشود. 24 GB مقداری است که اجرای مدل با آن بدون فشار انجام میشود. Offloading با نگهداشتن بخش عمده مدل در RAM سیستم و انتقال لایهها به GPU در هر مرحله کار میکند. در نتیجه، کارت بیشتر زمان خود را به انتظار برای گذرگاه PCIe میگذراند تا انجام محاسبات. این هزینه در هر مرحله از sampler پرداخت میشود، نه فقط یک بار.
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]فقط ردیف آخر، رقم ارائهشده توسط سازنده است. کارت 24 GB هر کلیپ را در 9 دقیقه تولید میکند؛ این همان رقم منتشرشده Alibaba برای این مدل است. ردیفهای دیگر اثر offloading را نشان میدهند و ارقام آنها تقریبی و مرتبهای هستند، نه نتایج benchmark. نکته اصلی، روند کلی است: 40 دقیقه روی کارت 8 GB از نظر فنی یک پیکربندی قابل اجراست، اما در عمل کاری دستهای است که آن را یک شب کامل در حال اجرا رها میکنید.
مدلهای بزرگتر Wan 2.2 شرایط کاملاً متفاوتی دارند. گونههای A14B برای تبدیل متن به ویدئو و تبدیل تصویر به ویدئو، برای inference با یک GPU حداقل به 80 GB از VRAM نیاز دارند. این مقدار به سختافزار مرکز داده نیاز دارد، نه کارتی که در یک رایانه رومیزی نصب کنید. در این مرحله، self-hosted عملاً به معنای اجاره ساعتی شتابدهنده شخص دیگری است.
هزینه هر کلیپ در GPU اجارهای
اجارهکردن برای آزمایش این مدل، انتخاب مناسب بیشتر افراد است؛ زیرا اگر در نهایت به مدلی نیاز داشته باشید که 80 GB حافظه بخواهد، کارتی که میخرید سختافزار نامناسبی خواهد بود. میانه قیمتهای on-demand در بازار اجاره GPU، تا July 2026:
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]ردیف 4090 مدل 5B را اجرا میکند و هزینه آن برای هر کلیپ، با نرخ 0.05 دلار بهازای هر کلیپ و 0.36 دلار در ساعت است. ردیفهای 80 GB مدلهای 14B را اجرا میکنند؛ به همین دلیل هزینه هر کلیپ آنها به 0.6 دلار میرسد، با اینکه خود سختافزار بسیار سریعتر است. مدل بزرگتر، محاسبات بیشتری برای هر ثانیه ویدئو نیاز دارد.
پنج سنت برای هر کلیپ ناچیز به نظر میرسد، اما همین موضوع میتواند گمراهکننده باشد. اولین پنج ثانیه قابلاستفاده شما تقریباً هیچوقت حاصل یک render نیست. Prompt کردن یک مدل ویدئویی، فرایندی برای جستوجو است و برای نمایی با حرکت مشخص، انجام 20 تا 40 render پیش از رسیدن به نتیجه قابلاستفاده عادی است. بنابراین هزینه یک جلسه کاری، چند دلار است نه چند سنت؛ و یک بعدازظهر iteration روی سختافزار اجارهای تقریباً به اندازه هزینه ناهار تمام میشود.
اگر دو نکته درباره اجاره را نادیده بگیرید، هزینه واقعی ایجاد میکنند. هنگام دانلود weights نیز هزینه از شما دریافت میشود. فایلهای Wan 2.2 بههمراه text encoder و VAE به دهها گیگابایت میرسند؛ بنابراین ارائهدهندهای را انتخاب کنید که persistent volume داشته باشد و فایلها را فقط یکبار دانلود کنید. همچنین وقتی box بدون استفاده و SSH session شما باز است، هزینه ادامه دارد. بهجای بستن terminal، instance را متوقف کنید.
نصب ComfyUI روی سرور GPU
کار را با Ubuntu 24.04 و درایور NVIDIA نصبشده آغاز کنید. ابتدا درایور را بررسی کنید، زیرا بدون این بررسی، علت همه خطاهای بعدی یکسان به نظر میرسد.
nvidia-smiاین دستور باید جدولی شامل کارت شما و نسخه CUDA نمایش دهد. اگر NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver نمایش داده شد، ماژول kernel بارگذاری نشده است. این وضعیت معمولاً پس از ارتقای kernel و بدون راهاندازی مجدد سیستم رخ میدهد. مشکل را همینجا برطرف کنید. در غیر این صورت، ComfyUI به مسیر CPU بازمیگردد و یک ساعت را صرف بررسی اشتباه مدل میکنید.
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txtپیش از دانلود حتی یک فایل weight، مطمئن شوید که PyTorch کارت را شناسایی میکند.
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"نمایش True بههمراه نام کارت شما به این معناست که stack سالم است. نمایش False یعنی wheel نصبشده، build مخصوص CPU است. این وضعیت زمانی رخ میدهد که pip یک torch ذخیرهشده در cache را از نصب قبلی پیدا کند. با index URL بالا دوباره نصب کنید.
فایلهای مدل Wan 2.2 را دانلود کنید
ComfyUI هیچ weightای همراه خود ندارد و یک مدل ویدئویی نیز فقط یک فایل نیست. این مدل شامل یک diffusion model، یک text encoder و یک VAE است و هرکدام باید در پوشه جداگانه خود قرار بگیرند. اگر فایلی را در پوشه نادرست قرار دهید، loader node آن را فهرست نمیکند و هیچ خطایی نیز برای توضیح علت نمایش نمیدهد.
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensorsمدل 5B هم text-to-video و هم image-to-video را پشتیبانی میکند؛ به همین دلیل نقطه شروع مناسبی است. همیشه .safetensors را به .ckpt ترجیح دهید. فایل .ckpt یک شیء pickled پایتون است؛ بنابراین بارگذاری آن کدی را اجرا میکند که سازنده آن نوشته است. برای فضای دیسک ظرفیت کافی در نظر بگیرید: یک نصب عملیاتی با یک خانواده مدل و خروجیهای آن به 100 GB فضا نیاز دارد و فایلهای ویدئویی بسیار بزرگتر از تصاویر PNG هستند که یک workflow تصویری ایجاد میکند. از فایلهای JSON مربوط به workflow خود با چیزی مانند پشتیبانگیری افزایشی رمزنگاریشده در فضای ذخیرهسازی اشیا نسخه پشتیبان تهیه کنید، زیرا weights را میتوان دوباره دانلود کرد، اما workflowهای تنظیمشده شما قابل بازتولید نیستند.
آن را اجرا کنید و با ایمنی به آن دسترسی داشته باشید
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188ComfyUI صفحه ورود و حساب کاربری ندارد. هر چیزی که بتواند به پورت 8188 دسترسی پیدا کند، میتواند jobها را در صف قرار دهد، همه clipهایی را که تولید کردهاید بخواند و custom nodeها را نصب کند؛ این کار به اجرای کد دلخواه روی server شما منجر میشود. آن را به localhost محدود کنید و از طریق یک SSH tunnel از دستگاه خودتان به آن دسترسی پیدا کنید.
ssh -N -L 8188:127.0.0.1:8188 you@your-serverسپس http://127.0.0.1:8188 را در browser باز کنید. workflow الگوی Wan 2.2 را از منوی templateهای ComfyUI بارگذاری کنید و بهجای اتصال دستی nodeها، از آن استفاده کنید. templateهای رسمی، تنظیمات sampler را که model برای آنها بهینه شده است در خود دارند. در workflow ویدئو، نسبت به workflow تصویر، نقاط بسیار بیشتری وجود دارد که ممکن است یک مقدار در آنها بدون جلب توجه اشتباه وارد شود.
وقتی پاسخ صادقانه، استفاده از یک API است
میزبانی ویدئو بهصورت self-hosted زمانی انتخاب درستی است که حجم کار زیاد و پایدار باشد، زمانی که فریمهای شما نباید زیرساخت خودتان را ترک کنند، یا زمانی که به مدل خاصی یا adapter سفارشی نیاز دارید که هیچ سرویس میزبانیشدهای ارائه نمیکند. این انتخاب زمانی نیز مناسب است که pipeline باید یک سال بعد هم به همان شکل کار کند، زیرا مدل میزبانیشده ممکن است بدون امکان pin کردن نسخه، در اختیار شما تغییر کند.
زمانی از یک API میزبانیشده استفاده کنید که ماهانه فقط به چند کلیپ نیاز دارید، زمانی که به خروجی طولانیتر یا بزرگتری از خروجی مدلهای open نیاز دارید، یا زمانی که این هفته deadline دارید. نقطه سربهسر را صادقانه محاسبه کنید. اجاره یک کارت 24 GB بهصورت شبانهروزی، بر اساس median در July 2026، تقریباً 260 دلار در ماه هزینه دارد؛ خرید همان کارت نیز پیش از تولید حتی یک فریم، هزینهای بیشتر از این مبلغ دارد. یک سرور self-hosted بیکار، هر بار در مقایسه با قیمتگذاری API بهازای هر کلیپ بازنده است. این همان موازنهای است که روش ارائه مدلهای متنی را تعیین میکند و در مقایسه Ollama با vLLM برای ارائه self-hosted مدلهای LLM پوشش داده شده است؛ همچنین این موضوع بر پرسش بنیادیتر مطرحشده در اینکه آیا VPS دارای GPU اصلاً ارزش هزینهکردن دارد یا نه مبتنی است.
هنگام ناموفق بودن رندر چه چیزهایی را بررسی کنیم
اگر رندر پس از تکمیل نوار sampler، درست در پایان متوقف شود، حافظه در مرحله رمزگشایی VAE تمام شده است. تعداد فریمها را کاهش دهید یا به یک گره رمزگشایی tiled تغییر دهید. تغییر تعداد گامها کمکی نمیکند، زیرا رمزگشایی یکبار و پس از اجرای همه گامها انجام میشود.
خروجی کاملاً سیاه یا بهشدت درهمریخته معمولاً به این معناست که VAE با مدل مطابقت ندارد. بارگذاری VAE مربوط به Wan 2.1 در برابر مدل انتشار Wan 2.2 دقیقاً چنین نتیجهای ایجاد میکند و هیچ خطایی نیز در log ظاهر نمیشود.
اگر رندر اجرا شود اما روی ماشینی که مطمئن هستید GPU دارد، ساعتها طول بکشد، یعنی ComfyUI از مسیر CPU استفاده میکند. خط مربوط به دستگاه را در startup log بررسی کنید، سپس بررسی torch.cuda.is_available() بالا را دوباره اجرا کنید.
اگر فرایند با Killed در dmesg ناپدید شود و هیچ Python traceback وجود نداشته باشد، این وضعیت ناشی از kernel out-of-memory killer است؛ بنابراین مشکل مربوط به RAM سیستم است، نه VRAM. Offloading به حضور کل مدل در RAM سیستم نیاز دارد. در نتیجه، ماشینی با 16 GB RAM که یک مدل 5B را offload میکند، حافظه کافی ندارد. RAM بیشتری اضافه کنید یا swap ایجاد کنید.
FAQ
آیا میتوانم بدون GPU روی یک VPS ویدئوی هوش مصنوعی تولید کنم؟
خیر، دستکم نه به شکلی که بخواهید آن را بیش از یک بار انجام دهید. تولید یک کلیپ 720p پنجثانیهای که روی یک GPU با 24 GB حافظه 9 دقیقه طول میکشد، روی CPU چندین ساعت زمان میبرد؛ زیرا مدل سختافزار ماتریسی برای اجرا در اختیار ندارد و پهنایباند RAM سیستم یک مرتبه بزرگی کمتر از پهنایباند حافظه GPU است. یک سرور CPU میتواند رابط ComfyUI را میزبانی کند، مدلهای شما را ذخیره کند و workflowهای شما را نگه دارد، اما فرایند رندر به GPU نیاز دارد.
برای Wan 2.2 به چه مقدار VRAM نیاز دارم؟
برای مدل TI2V-5B، با native offloading در ComfyUI، مقدار 8 GB حداقل لازم است و برای رسیدن به سرعت منتشرشده، Alibaba مقدار 24 GB را توصیه میکند. برای مدلهای A14B در حوزه text-to-video و image-to-video، model card دستکم 80 GB VRAM برای inference با یک GPU درخواست میکند؛ بنابراین این مدلها به کارتهای data-center نیاز دارند.
یک کلیپ self-hosted تا چه مدت میتواند طول داشته باشد؟
تا ژوئیه 2026، حدود پنج ثانیه در وضوح 720p واحد عملی تولید است. خروجی طولانیتر با تولید segmentها و اتصال آنها به یکدیگر ایجاد میشود؛ در این روش، آخرین frame یک segment بهعنوان اولین frame segment بعدی استفاده میشود. کیفیت در محل اتصال segmentها بهتدریج تغییر میکند؛ بنابراین ویدئوی طولانی را یک کار ویرایشی در نظر بگیرید، نه یک تولید واحد.
آیا اجاره GPU بهصورت ساعتی از خرید کارت ارزانتر است؟
برای هر میزان استفادهای که کمتر از چند ساعت رندر در روز باشد، اجاره مقرونبهصرفهتر است. با median حدود 0.36 دلار در ساعت در ژوئیه 2026 برای یک کارت 24 GB، میتوانید مدت زیادی GPU اجاره کنید تا هزینه به قیمت خرید آن کارت برسد. همچنین از خرید سختافزاری که بعداً مشخص میشود برای مدلی که واقعاً میخواهید استفاده کنید در رده نامناسبی قرار دارد، اجتناب میکنید. خرید فقط زمانی مقرونبهصرفه است که سیستم هر روز و بیشتر ساعات روز در حال استفاده باشد.