واقعیت تولید ویدیو با هوش مصنوعی در حالت self-hosted
در ژوئیه 2026، مدلهای Wan 2.2 و HunyuanVideo چه خروجی واقعی دارند؟ بررسی نیاز به 24 GB VRAM، هزینه اجاره GPU برای کلیپ 5 ثانیهای و زمان مناسب استفاده از API.
قابلیتهای واقعی یک تولیدکننده ویدیوی هوش مصنوعی در حالت self-hosted
یک تولیدکننده ویدیوی هوش مصنوعی در حالت self-hosted امروزه کار میکند، اما کندتر و محدودتر از آن چیزی است که در ویدیوهای نمایشی دیده میشود. تا ژوئیه 2026، مدلهای متنبازی که ارزش اجرا دارند شامل Wan 2.2 از Alibaba و HunyuanVideo از Tencent، به علاوه LTX-Video از Lightricks (زمانی که سرعت از واقعگرایی مهمتر است) هستند. همه این مدلها تحت ComfyUI روی یک ماشین Linux با کارت گرافیک NVIDIA اجرا میشوند. خروجی که دریافت میکنید یک کلیپ تقریباً پنج ثانیهای با کیفیت 720p است. نه یک صحنه کامل و نه یک دقیقه فیلم نهایی.
پاسخ کوتاه پیش از جزئیات این است: یک کارت گرافیک 24 GB یک کلیپ پنج ثانیهای 720p را در چند دقیقه (تکرقمی) رندر میکند. یک کارت 12 GB همین کار را در بیست دقیقه یا بیشتر انجام میدهد، زیرا وزنهای مدل در حافظه ویدیویی جا نمیشوند و نرمافزار مدام لایهها را بین VRAM و RAM سیستم جابهجا میکند. سروری که فاقد GPU باشد، نمیتواند این کار را به شکل کاربردی انجام دهد. محاسباتی که تولید تصویر با CPU را کند میکرد، تولید ویدیو با CPU را کاملاً بیمعنا میکند.
اگر قبلاً نردبان سختافزاری برای تولیدکننده تصویر self-hosted را مطالعه کردهاید، ویدیو همان استدلال است با این تفاوت که هر عدد یک رده بالاتر رفته است. VRAM (حافظه ویدیویی، همان RAM لحیمشده در کنار تراشه گرافیکی) همچنان تنها مشخصهای است که تعیین میکند این تجربه لذتبخش است یا عذابآور.
چرا هزینه یک ویدیو بسیار بیشتر از یک تصویر است
یک مدل انتشار (diffusion model) با حذف نویز در چندین مرحله، یک تصویر تولید میکند و هر مرحله تمام وزنهای مدل را میخواند. یک مدل ویدیو همین کار را برای مجموعهای از فریمها بهطور همزمان انجام میدهد و توجه زمانی (temporal attention) را اضافه میکند تا فریم 80 بداند فریم 12 چگونه بوده است. پنج ثانیه ویدیو با نرخ 24 فریم بر ثانیه، شامل 120 فریم در یک دسته (batch) است.
آن توجه زمانی دلیل این است که هزینه با افزایش طول کلیپ بهصورت خطی رشد نمیکند. دو برابر کردن تعداد فریمها، حافظه مورد نیاز sampler را بیش از دو برابر میکند؛ بنابراین حالت شکست (failure mode)، کند شدن رندر نیست، بلکه متوقف شدن کامل آن است.
یک جهش حافظه دوم نیز وجود دارد که افراد انتظار آن را ندارند. پس از پایان کار sampler، بخش VAE (رمزگذار خودکار متغیر، بخشی که latent فشرده را به پیکسلهای واقعی تبدیل میکند) کل ویدیوی latent را بهطور یکجا رمزگشایی میکند. این رمزگشایی ممکن است به حافظه بیشتری نسبت به مرحله sampling نیاز داشته باشد. نشانه این وضعیت، کاری است که نوار پیشرفت آن کامل شده و سپس این پیام را چاپ میکند:
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiBراه حل، استفاده از رمزگشایی کاشیکاریشده (tiled decoding) یا کوتاهتر کردن کلیپ است. دانستن اینکه کدام مرحله با کمبود حافظه مواجه شده، شما را از یک ساعت تنظیم اشتباه پارامترها نجات میدهد.
چه مقدار VRAM برای تولید ویدیو با هوش مصنوعی نیاز دارید
دو عدد منتشرشده، کل تصمیمگیری را چارچوببندی میکنند و در ظاهر با یکدیگر در تضاد هستند. شرکت Alibaba اعلام کرده است که مدل Wan 2.2 TI2V-5B کلیپهای 720p با نرخ 24 فریم بر ثانیه و طول پنج ثانیه را در کمتر از نه دقیقه روی یک GPU مصرفی مانند 4090 تولید میکند و حداقل 24 گیگابایت VRAM را توصیه میکند. مستندات ComfyUI بیان میکند که همان مدل 5B «باید با استفاده از قابلیت offloading بومی ComfyUI بهخوبی روی 8 گیگابایت VRAM اجرا شود».
هر دو گزاره درست هستند زیرا معیارهای متفاوتی را اندازهگیری میکنند. 8 گیگابایت حداقل فضایی است که مدل در آن جا میشود. 24 گیگابایت فضایی است که در آن عملکرد مطلوب است. قابلیت offloading با نگهداری بخش عمدهای از مدل در RAM سیستم و انتقال لایهها به GPU در هر مرحله کار میکند؛ بنابراین کارت گرافیک بهجای انجام محاسبات، زمان خود را صرف انتظار در گذرگاه PCIe میکند. شما این هزینه را در هر مرحله از sampler میپردازید، نه فقط یکبار.
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]تنها ردیف آخر، عدد اعلامی سازنده است. کارت 24 گیگابایتی به 9 دقیقه برای هر کلیپ میرسد که عدد منتشرشده توسط Alibaba برای این مدل است. ردیفهای دیگر نشاندهنده تأثیر offloading هستند و بیشتر از آنکه نتایج بنچمارک باشند، نشاندهنده مقیاس تغییرات هستند. نکته اصلی در شکل نمودار است: 40 دقیقه روی یک کارت 8 گیگابایتی، از نظر فنی یک تنظیمات کاری است، اما در عمل یک پردازش دستهای (batch job) است که باید بگذارید شب تا صبح اجرا شود.
مدلهای بزرگتر Wan 2.2 دنیای متفاوتی دارند. مدلهای A14B (تبدیل متن به ویدیو و تصویر به ویدیو) حداقل 80 گیگابایت VRAM برای استنتاج (inference) روی یک GPU نیاز دارند. این سختافزار دیتاسنتری است، نه کارتی که در سیستم رومیزی قرار دهید؛ و این همان نقطهای است که self-hosting به معنای اجاره ساعتی شتابدهندههای دیگران میشود. همین محاسبات در بخش متن بسیار فراتر میرود، جایی که میزبانی شخصی یک مدل 2.8 تریلیون پارامتری مانند Kimi K3 دیگر پرسشی درباره یک کارت نیست، بلکه به این تبدیل میشود که چند کارت 80 گیگابایتی را میتوانید از نظر مالی تأمین کرده و به هم متصل کنید.
هزینه هر کلیپ روی GPU اجارهای
اجاره کردن روشی است که اکثر افراد باید برای تست این موضوع از آن استفاده کنند، زیرا کارتی که خریداری میکنید اگر مدلی که در نهایت به آن نیاز دارید به 80 GB حافظه نیاز داشته باشد، سختافزار اشتباهی خواهد بود. میانگین قیمتهای درخواستی در بازار اجاره GPU، تا ژوئیه 2026:
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]ردیف 4090 مدل 5B را اجرا میکند و هزینه آن حدود 0.05 دلار به ازای هر کلیپ با نرخ 0.05 دلار در ساعت است. ردیفهای 80 GB مدلهای 14B را اجرا میکنند؛ به همین دلیل است که هزینه هر کلیپ آنها به 0.6 دلار افزایش مییابد، حتی با اینکه خود سختافزار بسیار سریعتر است. مدل بزرگتر، به معنای محاسبات بیشتر به ازای هر ثانیه ویدیو است.
پنج سنت برای هر کلیپ ناچیز به نظر میرسد، و این همان بخش گمراهکننده است. اولین پنج ثانیه قابل استفاده شما هرگز با یک رندر به دست نمیآید. پرامپتنویسی برای یک مدل ویدیویی نوعی جستجو است و بیست تا چهل رندر پیش از رسیدن به نتیجه مطلوب برای یک شات با حرکت خاص، امری عادی است. بنابراین، یک جلسه کاری به جای سنت، با دلار محاسبه میشود و یک بعدازظهر کار روی سختافزار اجارهای، تقریباً به اندازه هزینه یک ناهار خرج برمیدارد.
دو نکته در اجاره وجود دارد که اگر به آنها توجه نکنید، هزینه واقعی روی دستتان میگذارد. زمانی که سیستم در حال دانلود وزنهای مدل است، هزینه برای شما محاسبه میشود؛ فایلهای Wan 2.2 به همراه text encoder و VAE آن به دهها گیگابایت میرسند، بنابراین ارائهدهندهای را انتخاب کنید که دارای persistent volume باشد تا فقط یک بار دانلود کنید. همچنین زمانی که سیستم در حالت بیکار (idle) است و نشست SSH شما باز مانده، هزینه محاسبه میشود. به جای بستن ترمینال، حتماً instance را متوقف (stop) کنید.
نصب ComfyUI روی سرور دارای GPU
کار را با Ubuntu 24.04 که درایور NVIDIA روی آن نصب شده است، شروع کنید. ابتدا درایور را بررسی کنید، زیرا در صورت عدم انجام این بررسی، تمام خطاهای بعدی مشابه به نظر میرسند.
nvidia-smiاین دستور باید جدولی شامل کارت گرافیک و نسخه CUDA شما را نمایش دهد. اگر خروجی NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver باشد، یعنی ماژول کرنل بارگذاری نشده است که معمولاً پس از ارتقای کرنل بدون reboot رخ میدهد. این مشکل را در همین مرحله رفع کنید. در غیر این صورت، ComfyUI به مسیر CPU بازمیگردد و شما یک ساعت وقت خود را صرف عیبیابی مدل خواهید کرد.
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txtپیش از دانلود حتی یک فایل وزن (weight)، تأیید کنید که PyTorch کارت گرافیک را شناسایی میکند.
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"خروجی True به همراه نام کارت شما به این معنی است که پشته نرمافزاری سالم است. خروجی False نشان میدهد که نسخه نصبشده از نوع CPU-only است؛ این اتفاق زمانی میافتد که pip یک نسخه کششده از torch مربوط به نصبهای قبلی را پیدا میکند. با استفاده از index URL بالا، آن را مجدداً نصب کنید.
دانلود فایلهای مدل Wan 2.2
نرمافزار ComfyUI بدون وزنها (weights) عرضه میشود و یک مدل ویدئویی تنها از یک فایل تشکیل نشده است. این مدل شامل یک مدل diffusion، یک text encoder و یک VAE است که هر کدام باید در دایرکتوری مخصوص خود قرار بگیرند. اگر فایلی را در پوشه اشتباه قرار دهید، گره (node) بارگذار آن را نمایش نمیدهد و هیچ خطایی نیز برای توضیح علت آن صادر نمیشود.
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensorsمدل 5B هم تبدیل متن به ویدئو و هم تصویر به ویدئو را پشتیبانی میکند و به همین دلیل، نقطه شروع منطقی است. همیشه .safetensors را به .ckpt ترجیح دهید. فایل .ckpt یک شیء Python است که به صورت pickled ذخیره شده است، بنابراین بارگذاری آن کدهایی را اجرا میکند که توسط سازنده آن نوشته شده است. فضای دیسک را دستودلبازانه در نظر بگیرید: یک نصب فعال با یک خانواده مدل و خروجیهای آن به 100 GB فضا نیاز دارد و فایلهای ویدئویی بسیار حجیمتر از تصاویر PNG هستند که در جریان کاری (workflow) تصویر باقی میمانند. از فایلهای JSON جریان کاری خود با ابزاری مانند پشتیبانگیری افزایشی رمزنگاریشده در فضای ذخیرهسازی شیء نسخه پشتیبان تهیه کنید، زیرا وزنها قابل دانلود مجدد هستند اما جریانهای کاری تنظیمشده شما خیر.
اجرا و دسترسی ایمن
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188نرمافزار ComfyUI فاقد صفحه ورود و حساب کاربری است. هر کسی که به پورت 8188 دسترسی داشته باشد، میتواند درخواستها را در صف قرار دهد، تمام کلیپهای تولیدشده توسط شما را مشاهده کند و custom nodes نصب نماید؛ این یعنی اجرای کد دلخواه روی سرور شما. سرویس را روی localhost محدود کنید و از طریق یک SSH tunnel از سیستم شخصی خود به آن متصل شوید.
ssh -N -L 8188:127.0.0.1:8188 you@your-serverسپس http://127.0.0.1:8188 را در مرورگر خود باز کنید. بهجای سیمکشی دستی گرهها (nodes)، از منوی قالبهای ComfyUI، قالب Wan 2.2 را بارگذاری کنید. قالبهای رسمی شامل تنظیمات sampler هستند که مدل برای آنها بهینهسازی شده است؛ یک گردشکار ویدیویی نسبت به گردشکار تصویری، نقاط بسیار بیشتری برای بروز خطاهای جزئی در مقادیر دارد.
چه زمانی استفاده از API انتخاب منطقیتری است
Self-hosting برای تولید ویدیو زمانی انتخاب درستی است که حجم کار بالا و مداوم باشد، فریمهای شما نباید از زیرساخت شخصیتان خارج شوند، یا به مدل خاص یا adapter سفارشی نیاز دارید که هیچ سرویس میزبانیشدهای آن را ارائه نمیدهد. همچنین زمانی که پایپلاین شما باید یک سال بعد هم دقیقاً به همین شکل کار کند، این روش مناسب است؛ چرا که مدلهای میزبانیشده ممکن است بدون اطلاع شما تغییر کنند و امکان ثابت نگهداشتن نسخه (pin) وجود نداشته باشد.
زمانی از API میزبانیشده استفاده کنید که در ماه به تعداد کمی کلیپ نیاز دارید، خروجیهای طولانیتر یا بزرگتر از آنچه مدلهای متنباز تولید میکنند میخواهید، یا در همین هفته ضربالاجل دارید. محاسبات نقطه سربهسر را صادقانه انجام دهید. اجاره یک کارت 24 GB بهصورت شبانهروزی با نرخ میانگین ژوئیه 2026، تقریباً 260 دلار در ماه هزینه دارد، در حالی که خرید همان کارت پیش از تولید حتی یک فریم، هزینهای بیش از این مبلغ روی دست شما میگذارد. یک سرور self-hosted که بلااستفاده مانده باشد، همیشه در برابر مدل قیمتگذاری به ازای هر کلیپ در API شکست میخورد. این همان مبادلهای است که تعیین میکند چگونه مدلهای متنی را سرویسدهی کنید، که در مقایسه Ollama و vLLM برای سرویسدهی LLM به صورت self-hosted به آن پرداخته شده است و در سطحی بالاتر، به پرسش بنیادیتری در اینکه آیا اجاره یک VPS دارای GPU اصلاً ارزش هزینه کردن دارد یا خیر متصل است.
هنگام شکست رندر چه مواردی را بررسی کنیم
رندری که در آخرین لحظه، پس از تکمیل نوار sampler متوقف میشود، با کمبود حافظه در مرحله VAE decode مواجه شده است. تعداد فریمها را کاهش دهید یا از یک node برای tiled decode استفاده کنید. تغییر تعداد stepها کمکی نمیکند، زیرا مرحله decode تنها یکبار و پس از اجرای تمام stepها انجام میشود.
خروجی که کاملاً سیاه یا بهشدت بههمریخته است، معمولاً به این معناست که VAE با مدل مطابقت ندارد. بارگذاری یک Wan 2.1 VAE روی مدل diffusion از نوع Wan 2.2 دقیقاً چنین نتیجهای میدهد و هیچ خطایی نیز در لاگ ظاهر نمیشود.
رندری که اجرا میشود اما روی سیستمی که میدانید GPU دارد، ساعتها طول میکشد، به این معناست که ComfyUI در مسیر CPU قرار گرفته است. لاگ راهاندازی را برای مشاهده خط مربوط به device بررسی کنید و سپس دستور torch.cuda.is_available() ذکر شده در بالا را دوباره اجرا کنید.
ناپدید شدن پردازش با Killed در dmesg بدون هیچ traceback از Python، نشاندهنده عملکرد kernel out-of-memory killer است؛ بنابراین مشکل از RAM سیستم است، نه VRAM. قابلیت offloading نیاز دارد که کل مدل در RAM سیستم بارگذاری شود، به این معنی که یک سیستم با 16 GB رم برای offload کردن یک مدل 5B کافی نیست. رم اضافه کنید یا swap بسازید.
FAQ
آیا میتوانم روی یک VPS بدون GPU ویدئوی هوش مصنوعی تولید کنم؟
خیر، نه به شکلی که بخواهید بیش از یک بار انجام دهید. یک کلیپ 720p پنج ثانیهای که روی یک GPU با 24 GB حافظه، 9 دقیقه زمان میبرد، روی CPU چندین ساعت طول میکشد؛ زیرا مدل سختافزار ماتریسی برای اجرا ندارد و پهنای باند RAM سیستم یک مرتبه بزرگی کمتر از پهنای باند حافظه GPU است. یک سرور CPU میتواند رابط کاربری ComfyUI را میزبانی کند، مدلهای شما را ذخیره کرده و گردشکارهای شما را نگه دارد، اما عملیات رندر کردن به خودی خود نیازمند GPU است.
برای مدل Wan 2.2 به چه مقدار VRAM نیاز دارم؟
برای مدل TI2V-5B، مقدار 8 GB حداقلِ مورد نیاز با استفاده از قابلیت offloading بومی ComfyUI است و 24 GB مقداری است که Alibaba برای دستیابی به سرعت اعلامشده توصیه میکند. برای مدلهای text-to-video و image-to-video نسخه A14B، کارت مدل حداقل 80 GB حافظه VRAM را برای استنتاج (inference) روی یک GPU واحد درخواست میکند، بنابراین این مدلها به کارتهای مخصوص دیتاسنتر نیاز دارند.
طول یک کلیپ self-hosted چقدر میتواند باشد؟
تا ژوئیه 2026، حدود 5 ثانیه با کیفیت 720p واحد عملی و کاربردی است. خروجیهای طولانیتر با تولید بخشهای مجزا و اتصال آنها به یکدیگر ساخته میشوند، به طوری که از آخرین فریم یک بخش به عنوان اولین فریم بخش بعدی استفاده میشود. کیفیت در محل اتصال افت میکند، بنابراین به یک ویدئوی طولانی به عنوان یک پروژه تدوین نگاه کنید، نه یک تولید واحد.
آیا اجاره ساعتی GPU ارزانتر از خرید کارت است؟
برای هر کاری که کمتر از چند ساعت رندر در روز باشد، اجاره کردن بهصرفهتر است. با میانگین قیمت حدود 0.36 دلار در هر ساعت برای یک کارت 24 GB در ژوئیه 2026، شما میتوانید مدت بسیار زیادی اجاره کنید پیش از آنکه هزینهتان با قیمت خرید آن کارت برابری کند؛ همچنین از خرید سختافزاری که مشخص شود برای مدل مورد نظر شما در کلاس مناسبی نیست، جلوگیری میکنید. خرید تنها زمانی بهصرفه است که دستگاه در بیشتر ساعات هر روز در حال کار باشد.