SSD Nodes Learn Hosting plans →
راهنماها Matt Connorتوسط Matt Connor · به‌روزرسانی شده 2026-08-13

واقعیت تولید ویدیو با هوش مصنوعی در حالت self-hosted

در ژوئیه 2026، مدل‌های Wan 2.2 و HunyuanVideo چه خروجی واقعی دارند؟ بررسی نیاز به 24 GB VRAM، هزینه اجاره GPU برای کلیپ 5 ثانیه‌ای و زمان مناسب استفاده از API.

قابلیت‌های واقعی یک تولیدکننده ویدیوی هوش مصنوعی در حالت self-hosted

یک تولیدکننده ویدیوی هوش مصنوعی در حالت self-hosted امروزه کار می‌کند، اما کندتر و محدودتر از آن چیزی است که در ویدیوهای نمایشی دیده می‌شود. تا ژوئیه 2026، مدل‌های متن‌بازی که ارزش اجرا دارند شامل Wan 2.2 از Alibaba و HunyuanVideo از Tencent، به علاوه LTX-Video از Lightricks (زمانی که سرعت از واقع‌گرایی مهم‌تر است) هستند. همه این مدل‌ها تحت ComfyUI روی یک ماشین Linux با کارت گرافیک NVIDIA اجرا می‌شوند. خروجی که دریافت می‌کنید یک کلیپ تقریباً پنج ثانیه‌ای با کیفیت 720p است. نه یک صحنه کامل و نه یک دقیقه فیلم نهایی.

پاسخ کوتاه پیش از جزئیات این است: یک کارت گرافیک 24 GB یک کلیپ پنج ثانیه‌ای 720p را در چند دقیقه (تک‌رقمی) رندر می‌کند. یک کارت 12 GB همین کار را در بیست دقیقه یا بیشتر انجام می‌دهد، زیرا وزن‌های مدل در حافظه ویدیویی جا نمی‌شوند و نرم‌افزار مدام لایه‌ها را بین VRAM و RAM سیستم جابه‌جا می‌کند. سروری که فاقد GPU باشد، نمی‌تواند این کار را به شکل کاربردی انجام دهد. محاسباتی که تولید تصویر با CPU را کند می‌کرد، تولید ویدیو با CPU را کاملاً بی‌معنا می‌کند.

اگر قبلاً نردبان سخت‌افزاری برای تولیدکننده تصویر self-hosted را مطالعه کرده‌اید، ویدیو همان استدلال است با این تفاوت که هر عدد یک رده بالاتر رفته است. VRAM (حافظه ویدیویی، همان RAM لحیم‌شده در کنار تراشه گرافیکی) همچنان تنها مشخصه‌ای است که تعیین می‌کند این تجربه لذت‌بخش است یا عذاب‌آور.

چرا هزینه یک ویدیو بسیار بیشتر از یک تصویر است

یک مدل انتشار (diffusion model) با حذف نویز در چندین مرحله، یک تصویر تولید می‌کند و هر مرحله تمام وزن‌های مدل را می‌خواند. یک مدل ویدیو همین کار را برای مجموعه‌ای از فریم‌ها به‌طور هم‌زمان انجام می‌دهد و توجه زمانی (temporal attention) را اضافه می‌کند تا فریم 80 بداند فریم 12 چگونه بوده است. پنج ثانیه ویدیو با نرخ 24 فریم بر ثانیه، شامل 120 فریم در یک دسته (batch) است.

آن توجه زمانی دلیل این است که هزینه با افزایش طول کلیپ به‌صورت خطی رشد نمی‌کند. دو برابر کردن تعداد فریم‌ها، حافظه مورد نیاز sampler را بیش از دو برابر می‌کند؛ بنابراین حالت شکست (failure mode)، کند شدن رندر نیست، بلکه متوقف شدن کامل آن است.

یک جهش حافظه دوم نیز وجود دارد که افراد انتظار آن را ندارند. پس از پایان کار sampler، بخش VAE (رمزگذار خودکار متغیر، بخشی که latent فشرده را به پیکسل‌های واقعی تبدیل می‌کند) کل ویدیوی latent را به‌طور یکجا رمزگشایی می‌کند. این رمزگشایی ممکن است به حافظه بیشتری نسبت به مرحله sampling نیاز داشته باشد. نشانه این وضعیت، کاری است که نوار پیشرفت آن کامل شده و سپس این پیام را چاپ می‌کند:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

راه حل، استفاده از رمزگشایی کاشی‌کاری‌شده (tiled decoding) یا کوتاه‌تر کردن کلیپ است. دانستن اینکه کدام مرحله با کمبود حافظه مواجه شده، شما را از یک ساعت تنظیم اشتباه پارامترها نجات می‌دهد.

چه مقدار VRAM برای تولید ویدیو با هوش مصنوعی نیاز دارید

دو عدد منتشرشده، کل تصمیم‌گیری را چارچوب‌بندی می‌کنند و در ظاهر با یکدیگر در تضاد هستند. شرکت Alibaba اعلام کرده است که مدل Wan 2.2 TI2V-5B کلیپ‌های 720p با نرخ 24 فریم بر ثانیه و طول پنج ثانیه را در کمتر از نه دقیقه روی یک GPU مصرفی مانند 4090 تولید می‌کند و حداقل 24 گیگابایت VRAM را توصیه می‌کند. مستندات ComfyUI بیان می‌کند که همان مدل 5B «باید با استفاده از قابلیت offloading بومی ComfyUI به‌خوبی روی 8 گیگابایت VRAM اجرا شود».

هر دو گزاره درست هستند زیرا معیارهای متفاوتی را اندازه‌گیری می‌کنند. 8 گیگابایت حداقل فضایی است که مدل در آن جا می‌شود. 24 گیگابایت فضایی است که در آن عملکرد مطلوب است. قابلیت offloading با نگهداری بخش عمده‌ای از مدل در RAM سیستم و انتقال لایه‌ها به GPU در هر مرحله کار می‌کند؛ بنابراین کارت گرافیک به‌جای انجام محاسبات، زمان خود را صرف انتظار در گذرگاه PCIe می‌کند. شما این هزینه را در هر مرحله از sampler می‌پردازید، نه فقط یک‌بار.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

تنها ردیف آخر، عدد اعلامی سازنده است. کارت 24 گیگابایتی به 9 دقیقه برای هر کلیپ می‌رسد که عدد منتشرشده توسط Alibaba برای این مدل است. ردیف‌های دیگر نشان‌دهنده تأثیر offloading هستند و بیشتر از آنکه نتایج بنچمارک باشند، نشان‌دهنده مقیاس تغییرات هستند. نکته اصلی در شکل نمودار است: 40 دقیقه روی یک کارت 8 گیگابایتی، از نظر فنی یک تنظیمات کاری است، اما در عمل یک پردازش دسته‌ای (batch job) است که باید بگذارید شب تا صبح اجرا شود.

مدل‌های بزرگ‌تر Wan 2.2 دنیای متفاوتی دارند. مدل‌های A14B (تبدیل متن به ویدیو و تصویر به ویدیو) حداقل 80 گیگابایت VRAM برای استنتاج (inference) روی یک GPU نیاز دارند. این سخت‌افزار دیتاسنتری است، نه کارتی که در سیستم رومیزی قرار دهید؛ و این همان نقطه‌ای است که self-hosting به معنای اجاره ساعتی شتاب‌دهنده‌های دیگران می‌شود. همین محاسبات در بخش متن بسیار فراتر می‌رود، جایی که میزبانی شخصی یک مدل 2.8 تریلیون پارامتری مانند Kimi K3 دیگر پرسشی درباره یک کارت نیست، بلکه به این تبدیل می‌شود که چند کارت 80 گیگابایتی را می‌توانید از نظر مالی تأمین کرده و به هم متصل کنید.

هزینه هر کلیپ روی GPU اجاره‌ای

اجاره کردن روشی است که اکثر افراد باید برای تست این موضوع از آن استفاده کنند، زیرا کارتی که خریداری می‌کنید اگر مدلی که در نهایت به آن نیاز دارید به 80 GB حافظه نیاز داشته باشد، سخت‌افزار اشتباهی خواهد بود. میانگین قیمت‌های درخواستی در بازار اجاره GPU، تا ژوئیه 2026:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

ردیف 4090 مدل 5B را اجرا می‌کند و هزینه آن حدود 0.05 دلار به ازای هر کلیپ با نرخ 0.05 دلار در ساعت است. ردیف‌های 80 GB مدل‌های 14B را اجرا می‌کنند؛ به همین دلیل است که هزینه هر کلیپ آن‌ها به 0.6 دلار افزایش می‌یابد، حتی با اینکه خود سخت‌افزار بسیار سریع‌تر است. مدل بزرگ‌تر، به معنای محاسبات بیشتر به ازای هر ثانیه ویدیو است.

پنج سنت برای هر کلیپ ناچیز به نظر می‌رسد، و این همان بخش گمراه‌کننده است. اولین پنج ثانیه قابل استفاده شما هرگز با یک رندر به دست نمی‌آید. پرامپت‌نویسی برای یک مدل ویدیویی نوعی جستجو است و بیست تا چهل رندر پیش از رسیدن به نتیجه مطلوب برای یک شات با حرکت خاص، امری عادی است. بنابراین، یک جلسه کاری به جای سنت، با دلار محاسبه می‌شود و یک بعدازظهر کار روی سخت‌افزار اجاره‌ای، تقریباً به اندازه هزینه یک ناهار خرج برمی‌دارد.

دو نکته در اجاره وجود دارد که اگر به آن‌ها توجه نکنید، هزینه واقعی روی دستتان می‌گذارد. زمانی که سیستم در حال دانلود وزن‌های مدل است، هزینه برای شما محاسبه می‌شود؛ فایل‌های Wan 2.2 به همراه text encoder و VAE آن به ده‌ها گیگابایت می‌رسند، بنابراین ارائه‌دهنده‌ای را انتخاب کنید که دارای persistent volume باشد تا فقط یک بار دانلود کنید. همچنین زمانی که سیستم در حالت بیکار (idle) است و نشست SSH شما باز مانده، هزینه محاسبه می‌شود. به جای بستن ترمینال، حتماً instance را متوقف (stop) کنید.

نصب ComfyUI روی سرور دارای GPU

کار را با Ubuntu 24.04 که درایور NVIDIA روی آن نصب شده است، شروع کنید. ابتدا درایور را بررسی کنید، زیرا در صورت عدم انجام این بررسی، تمام خطاهای بعدی مشابه به نظر می‌رسند.

nvidia-smi

این دستور باید جدولی شامل کارت گرافیک و نسخه CUDA شما را نمایش دهد. اگر خروجی NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver باشد، یعنی ماژول کرنل بارگذاری نشده است که معمولاً پس از ارتقای کرنل بدون reboot رخ می‌دهد. این مشکل را در همین مرحله رفع کنید. در غیر این صورت، ComfyUI به مسیر CPU بازمی‌گردد و شما یک ساعت وقت خود را صرف عیب‌یابی مدل خواهید کرد.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

پیش از دانلود حتی یک فایل وزن (weight)، تأیید کنید که PyTorch کارت گرافیک را شناسایی می‌کند.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

خروجی True به همراه نام کارت شما به این معنی است که پشته نرم‌افزاری سالم است. خروجی False نشان می‌دهد که نسخه نصب‌شده از نوع CPU-only است؛ این اتفاق زمانی می‌افتد که pip یک نسخه کش‌شده از torch مربوط به نصب‌های قبلی را پیدا می‌کند. با استفاده از index URL بالا، آن را مجدداً نصب کنید.

دانلود فایل‌های مدل Wan 2.2

نرم‌افزار ComfyUI بدون وزن‌ها (weights) عرضه می‌شود و یک مدل ویدئویی تنها از یک فایل تشکیل نشده است. این مدل شامل یک مدل diffusion، یک text encoder و یک VAE است که هر کدام باید در دایرکتوری مخصوص خود قرار بگیرند. اگر فایلی را در پوشه اشتباه قرار دهید، گره (node) بارگذار آن را نمایش نمی‌دهد و هیچ خطایی نیز برای توضیح علت آن صادر نمی‌شود.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

مدل 5B هم تبدیل متن به ویدئو و هم تصویر به ویدئو را پشتیبانی می‌کند و به همین دلیل، نقطه شروع منطقی است. همیشه .safetensors را به .ckpt ترجیح دهید. فایل .ckpt یک شیء Python است که به صورت pickled ذخیره شده است، بنابراین بارگذاری آن کدهایی را اجرا می‌کند که توسط سازنده آن نوشته شده است. فضای دیسک را دست‌ودلبازانه در نظر بگیرید: یک نصب فعال با یک خانواده مدل و خروجی‌های آن به 100 GB فضا نیاز دارد و فایل‌های ویدئویی بسیار حجیم‌تر از تصاویر PNG هستند که در جریان کاری (workflow) تصویر باقی می‌مانند. از فایل‌های JSON جریان کاری خود با ابزاری مانند پشتیبان‌گیری افزایشی رمزنگاری‌شده در فضای ذخیره‌سازی شیء نسخه پشتیبان تهیه کنید، زیرا وزن‌ها قابل دانلود مجدد هستند اما جریان‌های کاری تنظیم‌شده شما خیر.

اجرا و دسترسی ایمن

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

نرم‌افزار ComfyUI فاقد صفحه ورود و حساب کاربری است. هر کسی که به پورت 8188 دسترسی داشته باشد، می‌تواند درخواست‌ها را در صف قرار دهد، تمام کلیپ‌های تولیدشده توسط شما را مشاهده کند و custom nodes نصب نماید؛ این یعنی اجرای کد دلخواه روی سرور شما. سرویس را روی localhost محدود کنید و از طریق یک SSH tunnel از سیستم شخصی خود به آن متصل شوید.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

سپس http://127.0.0.1:8188 را در مرورگر خود باز کنید. به‌جای سیم‌کشی دستی گره‌ها (nodes)، از منوی قالب‌های ComfyUI، قالب Wan 2.2 را بارگذاری کنید. قالب‌های رسمی شامل تنظیمات sampler هستند که مدل برای آن‌ها بهینه‌سازی شده است؛ یک گردش‌کار ویدیویی نسبت به گردش‌کار تصویری، نقاط بسیار بیشتری برای بروز خطاهای جزئی در مقادیر دارد.

چه زمانی استفاده از API انتخاب منطقی‌تری است

Self-hosting برای تولید ویدیو زمانی انتخاب درستی است که حجم کار بالا و مداوم باشد، فریم‌های شما نباید از زیرساخت شخصی‌تان خارج شوند، یا به مدل خاص یا adapter سفارشی نیاز دارید که هیچ سرویس میزبانی‌شده‌ای آن را ارائه نمی‌دهد. همچنین زمانی که پایپ‌لاین شما باید یک سال بعد هم دقیقاً به همین شکل کار کند، این روش مناسب است؛ چرا که مدل‌های میزبانی‌شده ممکن است بدون اطلاع شما تغییر کنند و امکان ثابت نگه‌داشتن نسخه (pin) وجود نداشته باشد.

زمانی از API میزبانی‌شده استفاده کنید که در ماه به تعداد کمی کلیپ نیاز دارید، خروجی‌های طولانی‌تر یا بزرگ‌تر از آنچه مدل‌های متن‌باز تولید می‌کنند می‌خواهید، یا در همین هفته ضرب‌الاجل دارید. محاسبات نقطه سربه‌سر را صادقانه انجام دهید. اجاره یک کارت 24 GB به‌صورت شبانه‌روزی با نرخ میانگین ژوئیه 2026، تقریباً 260 دلار در ماه هزینه دارد، در حالی که خرید همان کارت پیش از تولید حتی یک فریم، هزینه‌ای بیش از این مبلغ روی دست شما می‌گذارد. یک سرور self-hosted که بلااستفاده مانده باشد، همیشه در برابر مدل قیمت‌گذاری به ازای هر کلیپ در API شکست می‌خورد. این همان مبادله‌ای است که تعیین می‌کند چگونه مدل‌های متنی را سرویس‌دهی کنید، که در مقایسه Ollama و vLLM برای سرویس‌دهی LLM به صورت self-hosted به آن پرداخته شده است و در سطحی بالاتر، به پرسش بنیادی‌تری در اینکه آیا اجاره یک VPS دارای GPU اصلاً ارزش هزینه کردن دارد یا خیر متصل است.

هنگام شکست رندر چه مواردی را بررسی کنیم

رندری که در آخرین لحظه، پس از تکمیل نوار sampler متوقف می‌شود، با کمبود حافظه در مرحله VAE decode مواجه شده است. تعداد فریم‌ها را کاهش دهید یا از یک node برای tiled decode استفاده کنید. تغییر تعداد stepها کمکی نمی‌کند، زیرا مرحله decode تنها یک‌بار و پس از اجرای تمام stepها انجام می‌شود.

خروجی که کاملاً سیاه یا به‌شدت به‌هم‌ریخته است، معمولاً به این معناست که VAE با مدل مطابقت ندارد. بارگذاری یک Wan 2.1 VAE روی مدل diffusion از نوع Wan 2.2 دقیقاً چنین نتیجه‌ای می‌دهد و هیچ خطایی نیز در لاگ ظاهر نمی‌شود.

رندری که اجرا می‌شود اما روی سیستمی که می‌دانید GPU دارد، ساعت‌ها طول می‌کشد، به این معناست که ComfyUI در مسیر CPU قرار گرفته است. لاگ راه‌اندازی را برای مشاهده خط مربوط به device بررسی کنید و سپس دستور torch.cuda.is_available() ذکر شده در بالا را دوباره اجرا کنید.

ناپدید شدن پردازش با Killed در dmesg بدون هیچ traceback از Python، نشان‌دهنده عملکرد kernel out-of-memory killer است؛ بنابراین مشکل از RAM سیستم است، نه VRAM. قابلیت offloading نیاز دارد که کل مدل در RAM سیستم بارگذاری شود، به این معنی که یک سیستم با 16 GB رم برای offload کردن یک مدل 5B کافی نیست. رم اضافه کنید یا swap بسازید.

FAQ

آیا می‌توانم روی یک VPS بدون GPU ویدئوی هوش مصنوعی تولید کنم؟

خیر، نه به شکلی که بخواهید بیش از یک بار انجام دهید. یک کلیپ 720p پنج ثانیه‌ای که روی یک GPU با 24 GB حافظه، 9 دقیقه زمان می‌برد، روی CPU چندین ساعت طول می‌کشد؛ زیرا مدل سخت‌افزار ماتریسی برای اجرا ندارد و پهنای باند RAM سیستم یک مرتبه بزرگی کمتر از پهنای باند حافظه GPU است. یک سرور CPU می‌تواند رابط کاربری ComfyUI را میزبانی کند، مدل‌های شما را ذخیره کرده و گردش‌کارهای شما را نگه دارد، اما عملیات رندر کردن به خودی خود نیازمند GPU است.

برای مدل Wan 2.2 به چه مقدار VRAM نیاز دارم؟

برای مدل TI2V-5B، مقدار 8 GB حداقلِ مورد نیاز با استفاده از قابلیت offloading بومی ComfyUI است و 24 GB مقداری است که Alibaba برای دستیابی به سرعت اعلام‌شده توصیه می‌کند. برای مدل‌های text-to-video و image-to-video نسخه A14B، کارت مدل حداقل 80 GB حافظه VRAM را برای استنتاج (inference) روی یک GPU واحد درخواست می‌کند، بنابراین این مدل‌ها به کارت‌های مخصوص دیتاسنتر نیاز دارند.

طول یک کلیپ self-hosted چقدر می‌تواند باشد؟

تا ژوئیه 2026، حدود 5 ثانیه با کیفیت 720p واحد عملی و کاربردی است. خروجی‌های طولانی‌تر با تولید بخش‌های مجزا و اتصال آن‌ها به یکدیگر ساخته می‌شوند، به طوری که از آخرین فریم یک بخش به عنوان اولین فریم بخش بعدی استفاده می‌شود. کیفیت در محل اتصال افت می‌کند، بنابراین به یک ویدئوی طولانی به عنوان یک پروژه تدوین نگاه کنید، نه یک تولید واحد.

آیا اجاره ساعتی GPU ارزان‌تر از خرید کارت است؟

برای هر کاری که کمتر از چند ساعت رندر در روز باشد، اجاره کردن به‌صرفه‌تر است. با میانگین قیمت حدود 0.36 دلار در هر ساعت برای یک کارت 24 GB در ژوئیه 2026، شما می‌توانید مدت بسیار زیادی اجاره کنید پیش از آنکه هزینه‌تان با قیمت خرید آن کارت برابری کند؛ همچنین از خرید سخت‌افزاری که مشخص شود برای مدل مورد نظر شما در کلاس مناسبی نیست، جلوگیری می‌کنید. خرید تنها زمانی به‌صرفه است که دستگاه در بیشتر ساعات هر روز در حال کار باشد.