SSD Nodes Learn 8GB RAM — سالی $66
راهنماها Matt Connorتوسط Matt Connor · به‌روزرسانی شده 2026-08-01

مولد ویدئوی AI خودمیزبان واقعاً چه می‌کند؟

مدل‌های متن‌باز ویدئو در ژوئیه 2026 چه خروجی‌ای می‌سازند؟ نیاز VRAM هر مدل، هزینه کلیپ 5 ثانیه‌ای روی GPU اجاره‌ای و زمان استفاده از API را ببینید.

یک مولد ویدئوی هوش مصنوعی خودمیزبان عملاً چه کارهایی می‌تواند انجام دهد

یک مولد ویدئوی هوش مصنوعی خودمیزبان اکنون قابل استفاده است، اما از آنچه حلقه‌های نمایشی نشان می‌دهند کندتر و محدودتر است. در ژوئیه 2026، مدل‌های متن‌باز قابل‌اجرا شامل Wan 2.2 از Alibaba و HunyuanVideo از Tencent هستند. LTX-Video از Lightricks نیز زمانی مناسب است که سرعت از واقع‌گرایی مهم‌تر باشد. همه این مدل‌ها با ComfyUI روی یک ماشین Linux مجهز به GPU شرکت NVIDIA اجرا می‌شوند. خروجی، کلیپی تقریباً پنج‌ثانیه‌ای با وضوح 720p است. این خروجی یک صحنه نیست. یک دقیقه ویدئوی نهایی‌شده هم نیست.

پیش از جزئیات، پاسخ کوتاه این است: یک کارت 24 GB، یک کلیپ پنج‌ثانیه‌ای با وضوح 720p را در چند دقیقه تولید می‌کند. یک کارت 12 GB همین کار را در 20 دقیقه یا بیشتر انجام می‌دهد، زیرا وزن‌های مدل در حافظه ویدئویی جا نمی‌شوند و نرم‌افزار لایه‌ها را پیوسته بین حافظه ویدئویی و RAM سیستم جابه‌جا می‌کند. سروری بدون GPU نمی‌تواند این کار را به‌صورت کاربردی انجام دهد. محاسباتی که تولید تصویر با CPU را کند می‌کنند، تولید ویدئو با CPU را عملاً بی‌فایده می‌کنند.

اگر نردبان سخت‌افزاری یک مولد تصویر خودمیزبان را قبلاً خوانده‌اید، ویدئو همان استدلال را با انتقال همه اعداد به یک رده بالاتر دنبال می‌کند. VRAM (حافظه ویدئویی، یعنی RAM لحیم‌شده در کنار تراشه گرافیکی) همچنان تنها مشخصه‌ای است که تعیین می‌کند این کار لذت‌بخش باشد یا دشوار.

چرا یک ویدیو بسیار بیشتر از یک تصویر هزینه دارد

یک مدل diffusion با حذف نویز در چند مرحله تصویر تولید می‌کند و در هر مرحله همه وزن‌های مدل را می‌خواند. یک مدل ویدیو همین کار را هم‌زمان روی یک بلوک کامل از فریم‌ها انجام می‌دهد و attention را در طول زمان نیز اضافه می‌کند تا فریم 80 بداند فریم 12 چه شکلی بوده است. پنج ثانیه با نرخ 24 فریم بر ثانیه، در یک batch شامل 120 فریم است.

همین temporal attention باعث می‌شود هزینه با طول کلیپ به‌صورت خطی افزایش پیدا نکند. دو برابر شدن تعداد فریم‌ها، حافظه موردنیاز sampler را بیش از دو برابر می‌کند. بنابراین حالت خرابی، طولانی‌تر شدن rendering نیست؛ بلکه فرایند render متوقف می‌شود.

یک افزایش مصرف حافظه دیگر نیز وجود دارد که بسیاری انتظارش را ندارند. پس از پایان کار sampler، بخش VAE (variational autoencoder؛ بخشی که latent فشرده را به پیکسل‌های واقعی تبدیل می‌کند) کل latent video را یک‌جا decode می‌کند. این decode ممکن است به حافظه بیشتری از مرحله sampling نیاز داشته باشد. نشانه آن، jobی است که نوار پیشرفت تکمیل‌شده را نشان می‌دهد و سپس این پیام را چاپ می‌کند:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

راه‌حل، استفاده از tiled decoding یا کوتاه‌تر کردن کلیپ است. اگر بدانید حافظه در کدام مرحله تمام شده است، برای مدت یک ساعت تنظیمات بخش نادرست را تغییر نمی‌دهید.

برای تولید ویدئوی هوش مصنوعی به چه مقدار VRAM نیاز دارید

دو رقم منتشرشده، چارچوب کل تصمیم را مشخص می‌کنند و در نگاه اول متناقض به نظر می‌رسند. Alibaba اعلام می‌کند که مدل Wan 2.2 TI2V-5B کلیپ‌های 720p را با سرعت 24 فریم‌برثانیه و به مدت پنج ثانیه، روی یک GPU مصرفی مانند 4090 در کمتر از 9 دقیقه تولید می‌کند و حداقل 24 GB از VRAM را توصیه می‌کند. مستندات ComfyUI اعلام می‌کنند که همین مدل 5B، با قابلیت native offloading در ComfyUI، «باید به‌خوبی روی 8GB vram اجرا شود».

هر دو گزاره درست هستند، زیرا دو چیز متفاوت را اندازه‌گیری می‌کنند. 8 GB مقداری است که مدل با آن اجرا می‌شود. 24 GB مقداری است که اجرای مدل با آن بدون فشار انجام می‌شود. Offloading با نگه‌داشتن بخش عمده مدل در RAM سیستم و انتقال لایه‌ها به GPU در هر مرحله کار می‌کند. در نتیجه، کارت بیشتر زمان خود را به انتظار برای گذرگاه PCIe می‌گذراند تا انجام محاسبات. این هزینه در هر مرحله از sampler پرداخت می‌شود، نه فقط یک بار.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

فقط ردیف آخر، رقم ارائه‌شده توسط سازنده است. کارت 24 GB هر کلیپ را در 9 دقیقه تولید می‌کند؛ این همان رقم منتشرشده Alibaba برای این مدل است. ردیف‌های دیگر اثر offloading را نشان می‌دهند و ارقام آن‌ها تقریبی و مرتبه‌ای هستند، نه نتایج benchmark. نکته اصلی، روند کلی است: 40 دقیقه روی کارت 8 GB از نظر فنی یک پیکربندی قابل اجراست، اما در عمل کاری دسته‌ای است که آن را یک شب کامل در حال اجرا رها می‌کنید.

مدل‌های بزرگ‌تر Wan 2.2 شرایط کاملاً متفاوتی دارند. گونه‌های A14B برای تبدیل متن به ویدئو و تبدیل تصویر به ویدئو، برای inference با یک GPU حداقل به 80 GB از VRAM نیاز دارند. این مقدار به سخت‌افزار مرکز داده نیاز دارد، نه کارتی که در یک رایانه رومیزی نصب کنید. در این مرحله، self-hosted عملاً به معنای اجاره ساعتی شتاب‌دهنده شخص دیگری است.

هزینه هر کلیپ در GPU اجاره‌ای

اجاره‌کردن برای آزمایش این مدل، انتخاب مناسب بیشتر افراد است؛ زیرا اگر در نهایت به مدلی نیاز داشته باشید که 80 GB حافظه بخواهد، کارتی که می‌خرید سخت‌افزار نامناسبی خواهد بود. میانه قیمت‌های on-demand در بازار اجاره GPU، تا July 2026:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

ردیف 4090 مدل 5B را اجرا می‌کند و هزینه آن برای هر کلیپ، با نرخ 0.05 دلار به‌ازای هر کلیپ و 0.36 دلار در ساعت است. ردیف‌های 80 GB مدل‌های 14B را اجرا می‌کنند؛ به همین دلیل هزینه هر کلیپ آن‌ها به 0.6 دلار می‌رسد، با اینکه خود سخت‌افزار بسیار سریع‌تر است. مدل بزرگ‌تر، محاسبات بیشتری برای هر ثانیه ویدئو نیاز دارد.

پنج سنت برای هر کلیپ ناچیز به نظر می‌رسد، اما همین موضوع می‌تواند گمراه‌کننده باشد. اولین پنج ثانیه قابل‌استفاده شما تقریباً هیچ‌وقت حاصل یک render نیست. Prompt کردن یک مدل ویدئویی، فرایندی برای جست‌وجو است و برای نمایی با حرکت مشخص، انجام 20 تا 40 render پیش از رسیدن به نتیجه قابل‌استفاده عادی است. بنابراین هزینه یک جلسه کاری، چند دلار است نه چند سنت؛ و یک بعدازظهر iteration روی سخت‌افزار اجاره‌ای تقریباً به اندازه هزینه ناهار تمام می‌شود.

اگر دو نکته درباره اجاره را نادیده بگیرید، هزینه واقعی ایجاد می‌کنند. هنگام دانلود weights نیز هزینه از شما دریافت می‌شود. فایل‌های Wan 2.2 به‌همراه text encoder و VAE به ده‌ها گیگابایت می‌رسند؛ بنابراین ارائه‌دهنده‌ای را انتخاب کنید که persistent volume داشته باشد و فایل‌ها را فقط یک‌بار دانلود کنید. همچنین وقتی box بدون استفاده و SSH session شما باز است، هزینه ادامه دارد. به‌جای بستن terminal، instance را متوقف کنید.

نصب ComfyUI روی سرور GPU

کار را با Ubuntu 24.04 و درایور NVIDIA نصب‌شده آغاز کنید. ابتدا درایور را بررسی کنید، زیرا بدون این بررسی، علت همه خطاهای بعدی یکسان به نظر می‌رسد.

nvidia-smi

این دستور باید جدولی شامل کارت شما و نسخه CUDA نمایش دهد. اگر NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver نمایش داده شد، ماژول kernel بارگذاری نشده است. این وضعیت معمولاً پس از ارتقای kernel و بدون راه‌اندازی مجدد سیستم رخ می‌دهد. مشکل را همین‌جا برطرف کنید. در غیر این صورت، ComfyUI به مسیر CPU بازمی‌گردد و یک ساعت را صرف بررسی اشتباه مدل می‌کنید.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

پیش از دانلود حتی یک فایل weight، مطمئن شوید که PyTorch کارت را شناسایی می‌کند.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

نمایش True به‌همراه نام کارت شما به این معناست که stack سالم است. نمایش False یعنی wheel نصب‌شده، build مخصوص CPU است. این وضعیت زمانی رخ می‌دهد که pip یک torch ذخیره‌شده در cache را از نصب قبلی پیدا کند. با index URL بالا دوباره نصب کنید.

فایل‌های مدل Wan 2.2 را دانلود کنید

ComfyUI هیچ weightای همراه خود ندارد و یک مدل ویدئویی نیز فقط یک فایل نیست. این مدل شامل یک diffusion model، یک text encoder و یک VAE است و هرکدام باید در پوشه جداگانه خود قرار بگیرند. اگر فایلی را در پوشه نادرست قرار دهید، loader node آن را فهرست نمی‌کند و هیچ خطایی نیز برای توضیح علت نمایش نمی‌دهد.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

مدل 5B هم text-to-video و هم image-to-video را پشتیبانی می‌کند؛ به همین دلیل نقطه شروع مناسبی است. همیشه .safetensors را به .ckpt ترجیح دهید. فایل .ckpt یک شیء pickled پایتون است؛ بنابراین بارگذاری آن کدی را اجرا می‌کند که سازنده آن نوشته است. برای فضای دیسک ظرفیت کافی در نظر بگیرید: یک نصب عملیاتی با یک خانواده مدل و خروجی‌های آن به 100 GB فضا نیاز دارد و فایل‌های ویدئویی بسیار بزرگ‌تر از تصاویر PNG هستند که یک workflow تصویری ایجاد می‌کند. از فایل‌های JSON مربوط به workflow خود با چیزی مانند پشتیبان‌گیری افزایشی رمزنگاری‌شده در فضای ذخیره‌سازی اشیا نسخه پشتیبان تهیه کنید، زیرا weights را می‌توان دوباره دانلود کرد، اما workflowهای تنظیم‌شده شما قابل بازتولید نیستند.

آن را اجرا کنید و با ایمنی به آن دسترسی داشته باشید

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI صفحه ورود و حساب کاربری ندارد. هر چیزی که بتواند به پورت 8188 دسترسی پیدا کند، می‌تواند jobها را در صف قرار دهد، همه clipهایی را که تولید کرده‌اید بخواند و custom nodeها را نصب کند؛ این کار به اجرای کد دلخواه روی server شما منجر می‌شود. آن را به localhost محدود کنید و از طریق یک SSH tunnel از دستگاه خودتان به آن دسترسی پیدا کنید.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

سپس http://127.0.0.1:8188 را در browser باز کنید. workflow الگوی Wan 2.2 را از منوی templateهای ComfyUI بارگذاری کنید و به‌جای اتصال دستی nodeها، از آن استفاده کنید. templateهای رسمی، تنظیمات sampler را که model برای آن‌ها بهینه شده است در خود دارند. در workflow ویدئو، نسبت به workflow تصویر، نقاط بسیار بیشتری وجود دارد که ممکن است یک مقدار در آن‌ها بدون جلب توجه اشتباه وارد شود.

وقتی پاسخ صادقانه، استفاده از یک API است

میزبانی ویدئو به‌صورت self-hosted زمانی انتخاب درستی است که حجم کار زیاد و پایدار باشد، زمانی که فریم‌های شما نباید زیرساخت خودتان را ترک کنند، یا زمانی که به مدل خاصی یا adapter سفارشی نیاز دارید که هیچ سرویس میزبانی‌شده‌ای ارائه نمی‌کند. این انتخاب زمانی نیز مناسب است که pipeline باید یک سال بعد هم به همان شکل کار کند، زیرا مدل میزبانی‌شده ممکن است بدون امکان pin کردن نسخه، در اختیار شما تغییر کند.

زمانی از یک API میزبانی‌شده استفاده کنید که ماهانه فقط به چند کلیپ نیاز دارید، زمانی که به خروجی طولانی‌تر یا بزرگ‌تری از خروجی مدل‌های open نیاز دارید، یا زمانی که این هفته deadline دارید. نقطه سربه‌سر را صادقانه محاسبه کنید. اجاره یک کارت 24 GB به‌صورت شبانه‌روزی، بر اساس median در July 2026، تقریباً 260 دلار در ماه هزینه دارد؛ خرید همان کارت نیز پیش از تولید حتی یک فریم، هزینه‌ای بیشتر از این مبلغ دارد. یک سرور self-hosted بیکار، هر بار در مقایسه با قیمت‌گذاری API به‌ازای هر کلیپ بازنده است. این همان موازنه‌ای است که روش ارائه مدل‌های متنی را تعیین می‌کند و در مقایسه Ollama با vLLM برای ارائه self-hosted مدل‌های LLM پوشش داده شده است؛ همچنین این موضوع بر پرسش بنیادی‌تر مطرح‌شده در این‌که آیا VPS دارای GPU اصلاً ارزش هزینه‌کردن دارد یا نه مبتنی است.

هنگام ناموفق بودن رندر چه چیزهایی را بررسی کنیم

اگر رندر پس از تکمیل نوار sampler، درست در پایان متوقف شود، حافظه در مرحله رمزگشایی VAE تمام شده است. تعداد فریم‌ها را کاهش دهید یا به یک گره رمزگشایی tiled تغییر دهید. تغییر تعداد گام‌ها کمکی نمی‌کند، زیرا رمزگشایی یک‌بار و پس از اجرای همه گام‌ها انجام می‌شود.

خروجی کاملاً سیاه یا به‌شدت درهم‌ریخته معمولاً به این معناست که VAE با مدل مطابقت ندارد. بارگذاری VAE مربوط به Wan 2.1 در برابر مدل انتشار Wan 2.2 دقیقاً چنین نتیجه‌ای ایجاد می‌کند و هیچ خطایی نیز در log ظاهر نمی‌شود.

اگر رندر اجرا شود اما روی ماشینی که مطمئن هستید GPU دارد، ساعت‌ها طول بکشد، یعنی ComfyUI از مسیر CPU استفاده می‌کند. خط مربوط به دستگاه را در startup log بررسی کنید، سپس بررسی torch.cuda.is_available() بالا را دوباره اجرا کنید.

اگر فرایند با Killed در dmesg ناپدید شود و هیچ Python traceback وجود نداشته باشد، این وضعیت ناشی از kernel out-of-memory killer است؛ بنابراین مشکل مربوط به RAM سیستم است، نه VRAM. Offloading به حضور کل مدل در RAM سیستم نیاز دارد. در نتیجه، ماشینی با 16 GB RAM که یک مدل 5B را offload می‌کند، حافظه کافی ندارد. RAM بیشتری اضافه کنید یا swap ایجاد کنید.

FAQ

آیا می‌توانم بدون GPU روی یک VPS ویدئوی هوش مصنوعی تولید کنم؟

خیر، دست‌کم نه به شکلی که بخواهید آن را بیش از یک بار انجام دهید. تولید یک کلیپ 720p پنج‌ثانیه‌ای که روی یک GPU با 24 GB حافظه 9 دقیقه طول می‌کشد، روی CPU چندین ساعت زمان می‌برد؛ زیرا مدل سخت‌افزار ماتریسی برای اجرا در اختیار ندارد و پهنای‌باند RAM سیستم یک مرتبه بزرگی کمتر از پهنای‌باند حافظه GPU است. یک سرور CPU می‌تواند رابط ComfyUI را میزبانی کند، مدل‌های شما را ذخیره کند و workflowهای شما را نگه دارد، اما فرایند رندر به GPU نیاز دارد.

برای Wan 2.2 به چه مقدار VRAM نیاز دارم؟

برای مدل TI2V-5B، با native offloading در ComfyUI، مقدار 8 GB حداقل لازم است و برای رسیدن به سرعت منتشرشده، Alibaba مقدار 24 GB را توصیه می‌کند. برای مدل‌های A14B در حوزه text-to-video و image-to-video، model card دست‌کم 80 GB VRAM برای inference با یک GPU درخواست می‌کند؛ بنابراین این مدل‌ها به کارت‌های data-center نیاز دارند.

یک کلیپ self-hosted تا چه مدت می‌تواند طول داشته باشد؟

تا ژوئیه 2026، حدود پنج ثانیه در وضوح 720p واحد عملی تولید است. خروجی طولانی‌تر با تولید segmentها و اتصال آن‌ها به یکدیگر ایجاد می‌شود؛ در این روش، آخرین frame یک segment به‌عنوان اولین frame segment بعدی استفاده می‌شود. کیفیت در محل اتصال segmentها به‌تدریج تغییر می‌کند؛ بنابراین ویدئوی طولانی را یک کار ویرایشی در نظر بگیرید، نه یک تولید واحد.

آیا اجاره GPU به‌صورت ساعتی از خرید کارت ارزان‌تر است؟

برای هر میزان استفاده‌ای که کمتر از چند ساعت رندر در روز باشد، اجاره مقرون‌به‌صرفه‌تر است. با median حدود 0.36 دلار در ساعت در ژوئیه 2026 برای یک کارت 24 GB، می‌توانید مدت زیادی GPU اجاره کنید تا هزینه به قیمت خرید آن کارت برسد. همچنین از خرید سخت‌افزاری که بعداً مشخص می‌شود برای مدلی که واقعاً می‌خواهید استفاده کنید در رده نامناسبی قرار دارد، اجتناب می‌کنید. خرید فقط زمانی مقرون‌به‌صرفه است که سیستم هر روز و بیشتر ساعات روز در حال استفاده باشد.

#ai-video#comfyui#gpu#self-hosting#wan#vram