SSD Nodes Learn 8GB RAM — $66/سنة
الأدلة Matt Connorبقلم Matt Connor · آخر تحديث في 2026-08-01

مولّد فيديو AI مستضاف ذاتيًا: ما الذي ينجح فعليًا؟

اكتشف ما تنتجه نماذج الفيديو المفتوحة في يوليو 2026، وفئة VRAM المطلوبة لكل نموذج، وتكلفة مقطع مدته 5 ثوانٍ على GPU مستأجر، ومتى تختار API.

ما يمكن لمولّد فيديو بالذكاء الاصطناعي مستضاف ذاتيًا فعله فعليًا

يعمل مولّد فيديو بالذكاء الاصطناعي مستضاف ذاتيًا اليوم، لكنه أبطأ وأصغر نطاقًا مما توحي به مقاطع العرض. اعتبارًا من July 2026، النماذج المفتوحة التي تستحق التشغيل هي Wan 2.2 من Alibaba وHunyuanVideo من Tencent، إضافة إلى LTX-Video من Lightricks عندما تكون السرعة أهم من الواقعية. تعمل جميعها ضمن ComfyUI على جهاز Linux مزود بوحدة معالجة رسومات NVIDIA. والناتج مقطع مدته نحو خمس ثوانٍ بدقة 720p. ليس مشهدًا كاملًا، ولا دقيقة من اللقطات الجاهزة.

إليك الإجابة المختصرة قبل التفاصيل. تُنشئ بطاقة بسعة 24 GB مقطعًا بدقة 720p ومدته خمس ثوانٍ خلال بضع دقائق. وتحتاج بطاقة بسعة 12 GB إلى عشرين دقيقة أو أكثر لتنفيذ المهمة نفسها، لأن الأوزان لا تتسع لها ذاكرة الفيديو، ويواصل البرنامج نقل الطبقات ذهابًا وإيابًا إلى ذاكرة RAM النظام. أما الخادم الذي لا يحتوي على GPU فلا يستطيع تنفيذ ذلك بطريقة مفيدة عمليًا. فالحسابات التي جعلت توليد الصور على CPU بطيئًا تجعل توليد الفيديو على CPU عديم الجدوى.

إذا كنت قد قرأت سُلّم العتاد لمولّد الصور المستضاف ذاتيًا، فالفيديو يطرح الحجة نفسها، لكن مع رفع كل رقم فئة واحدة. تظل VRAM (ذاكرة الفيديو، وهي ذاكرة RAM الملحومة بجوار شريحة الرسومات) المواصفة الوحيدة التي تحدد ما إذا كانت التجربة مريحة أو شاقة.

لماذا تكلف مقاطع الفيديو أضعاف تكلفة الصور

ينشئ نموذج الانتشار صورة عبر إزالة التشويش منها على مراحل. وتقرأ كل مرحلة جميع أوزان النموذج. وينفذ نموذج الفيديو العملية نفسها على كتلة كاملة من الإطارات دفعة واحدة. كما يضيف آلية انتباه عبر الزمن، حتى يعرف الإطار 80 شكل الإطار 12. مدة خمس ثوانٍ بمعدل 24 إطارًا في الثانية تعني 120 إطارًا في دفعة واحدة.

هذا الانتباه الزمني هو سبب عدم زيادة التكلفة بصورة متناسبة مع طول المقطع. تؤدي مضاعفة عدد الإطارات إلى زيادة الذاكرة التي يحتاجها sampler بأكثر من الضعف. لذلك لا تتمثل المشكلة في بطء التصيير، بل في توقف عملية التصيير بسبب نفاد الذاكرة.

تحدث قفزة ثانية في استهلاك الذاكرة لا يتوقعها كثيرون. بعد انتهاء sampler، يفك VAE (المشفر التلقائي التغايري، وهو الجزء الذي يحول التمثيل الكامن المضغوط إلى وحدات بكسل فعلية) ترميز فيديو latent بالكامل دفعة واحدة. وقد يحتاج فك الترميز هذا إلى ذاكرة أكبر مما احتاجه أخذ العينات. وتظهر المشكلة على شكل مهمة تعرض شريط تقدم مكتملًا، ثم تطبع ما يلي:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

الحل هو استخدام فك الترميز المقسم إلى بلاطات أو تقصير المقطع. ويساعدك تحديد المرحلة التي نفدت فيها الذاكرة على تجنب ضبط الإعداد الخاطئ لمدة ساعة.

ما مقدار VRAM الذي تحتاجه لتوليد فيديو بالذكاء الاصطناعي

تحدد رقمان منشوران القرار بأكمله، ويبدوان متناقضين. توضح Alibaba أن النموذج Wan 2.2 TI2V-5B ينتج مقاطع بدقة 720p وبمعدل 24 إطارًا في الثانية، ومدتها خمس ثوانٍ، خلال أقل من تسع دقائق على وحدة معالجة رسومات استهلاكية واحدة مثل 4090، وتوصي بسعة VRAM لا تقل عن 24 GB. وتوضح وثائق ComfyUI أن النموذج نفسه بسعة 5B «يناسب جيدًا سعة 8GB من vram مع native offloading في ComfyUI».

كلا الرقمين صحيح، لأن كلًا منهما يقيس أمرًا مختلفًا. سعة 8 GB تكفي لتشغيل النموذج. أما سعة 24 GB فتتيح تشغيله دون ضغط. يعمل offloading على إبقاء معظم النموذج في ذاكرة النظام RAM، ثم بث طبقاته إلى وحدة معالجة الرسومات في كل خطوة. لذلك تقضي البطاقة وقتها في انتظار ناقل PCIe بدلًا من تنفيذ العمليات الحسابية. وتدفع تكلفة ذلك في كل خطوة من خطوات sampler، وليس مرة واحدة.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

الصف الأخير فقط يستند إلى رقم من المورّد. وتنتج بطاقة بسعة 24 GB مقطعًا خلال 9 دقيقة، وهو الرقم الذي نشرته Alibaba لهذا النموذج. أما الصفوف الأخرى فتوضح أثر offloading، وهي تقديرات لرتبة الحجم وليست نتائج اختبارات معيارية. وهذا هو المهم: إن إنتاج مقطع خلال 40 دقيقة على بطاقة بسعة 8 GB إعداد يعمل تقنيًا، لكنه عمليًا مهمة دفعية تتركها قيد التشغيل طوال الليل.

تختلف نماذج Wan 2.2 الأكبر اختلافًا جوهريًا. تتطلب إصدارات A14B لتحويل النص إلى فيديو وتحويل الصورة إلى فيديو سعة VRAM لا تقل عن 80 GB للاستدلال باستخدام وحدة معالجة رسومات واحدة. هذه عتاد مراكز بيانات، وليست بطاقة تضعها في جهاز مكتبي، وعند هذه النقطة يبدأ الاستضافة الذاتية بمعنى استئجار مسرّع يملكه طرف آخر بالساعة.

تكلفة المقطع على GPU مستأجرة

الاستئجار هو الطريقة المناسبة لمعظم المستخدمين لاختبار ذلك، لأن شراء بطاقة قد يكون خيارًا غير مناسب إذا كان النموذج الذي ستحتاج إليه يتطلب 80 GB. فيما يلي الأسعار الوسيطة عند الطلب في سوق تأجير GPU، حتى July 2026:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

يشغّل صف 4090 النموذج 5B، وتبلغ التكلفة نحو 0.05 دولارًا لكل مقطع، بسعر 0.36 دولارًا في الساعة. وتشغّل صفوف 80 GB النماذج 14B، ولذلك ترتفع تكلفة المقطع إلى 0.6 دولارًا، رغم أن العتاد نفسه أسرع بكثير. كلما كبر النموذج، زادت القدرة الحاسوبية المطلوبة لكل ثانية من الفيديو.

قد تبدو تكلفة خمسة سنتات للمقطع ضئيلة، وهذا هو الجانب المضلل. أول خمس ثوانٍ صالحة للاستخدام لا تنتج أبدًا من عملية تصيير واحدة. إنشاء فيديو باستخدام نموذج يتطلب البحث والتجربة، ومن الطبيعي تنفيذ 20 إلى 40 عملية تصيير قبل الحصول على نتيجة مناسبة للقطعة التي تحتوي على حركة محددة. لذلك تكلف جلسة العمل دولارات لا سنتات، وتكلف فترة بعد الظهر من التجارب على عتاد مستأجر نحو تكلفة الغداء.

هناك تفصيلان في التأجير قد يكلفانك مالًا فعليًا إذا أغفلتهما. تُحاسب أثناء تنزيل الأوزان على الجهاز، وتصل ملفات Wan 2.2 مع مشفّر النص وVAE إلى عشرات GB، لذلك اختر مزودًا يوفر وحدة تخزين دائمة ونزّل الملفات مرة واحدة. كما تُحاسب أثناء بقاء الجهاز خاملاً مع بقاء جلسة SSH مفتوحة. أوقف المثيل بدلًا من إغلاق الطرفية فقط.

تثبيت ComfyUI على جهاز GPU

ابدأ باستخدام Ubuntu 24.04 مع تثبيت برنامج تشغيل NVIDIA مسبقًا. تحقّق من برنامج التشغيل أولًا، لأن كل حالات الفشل اللاحقة تبدو متطابقة من دون هذا التحقّق.

nvidia-smi

يجب أن يعرض الأمر جدولًا يتضمن بطاقتك وإصدار CUDA. إذا عرض NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver، فهذا يعني أن وحدة kernel النمطية غير محمّلة. يحدث ذلك عادةً بعد ترقية kernel من دون إعادة تشغيل النظام. أصلح المشكلة هنا. وإلا فسيعود ComfyUI إلى مسار CPU، وستقضي ساعة في إلقاء اللوم على النموذج.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

تأكّد من أن PyTorch يتعرّف على البطاقة قبل تنزيل أي ملف أوزان.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

يعني True مع اسم بطاقتك أن حزمة البرامج تعمل بصورة سليمة. ويعني False أن wheel المثبّتة هي إصدار CPU-only، ويحدث ذلك عندما يعثر pip على نسخة torch مخزّنة مؤقتًا من تثبيت سابق. أعد التثبيت باستخدام عنوان الفهرس أعلاه.

تنزيل ملفات نموذج Wan 2.2

لا يأتي ComfyUI مع أوزان، ونموذج الفيديو ليس ملفًا واحدًا. يتكوّن من نموذج انتشار، ومشفّر نصي، وVAE، ويجب وضع كل واحد منها في مجلده الخاص. إذا وضعت ملفًا في المجلد الخطأ، فلن تعرضه عقدة التحميل، ولن يظهر خطأ يوضح السبب.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

يتعامل نموذج 5B مع تحويل النص إلى فيديو وتحويل الصورة إلى فيديو، ولذلك فهو نقطة بداية مناسبة. استخدم دائمًا .safetensors بدلًا من .ckpt. ملف .ckpt هو كائن Python مُسلسل، ولذلك يؤدي تحميله إلى تشغيل التعليمات البرمجية التي كتبها منشئ الملف. خصص مساحة كبيرة على القرص: يتطلب التثبيت العامل مع عائلة نموذج واحدة ومخرجاتها 100 GB، وتكون ملفات الفيديو أكبر بكثير من صور PNG التي يتركها سير عمل الصور. أنشئ نسخًا احتياطية من ملفات JSON الخاصة بسير العمل باستخدام شيء مثل نسخ احتياطية تزايدية مشفّرة إلى تخزين الكائنات، لأن إعادة تنزيل الأوزان ممكنة، أما سير العمل الذي ضبطته فليس كذلك.

شغّله والوصول إليه بأمان

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

لا يحتوي ComfyUI على شاشة تسجيل دخول أو حسابات مستخدمين. يمكن لأي جهة تصل إلى المنفذ 8188 وضع مهام في قائمة الانتظار، وقراءة كل مقطع أنشأته، وتثبيت العقد المخصصة، ما يتيح تنفيذ تعليمات برمجية عشوائية على خادمك. اربطه بـ localhost، ثم صِل إليه عبر نفق SSH من جهازك.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

بعد ذلك، افتح http://127.0.0.1:8188 في متصفحك. حمّل سير عمل القالب Wan 2.2 من قائمة قوالب ComfyUI بدلًا من توصيل العقد يدويًا. تتضمن القوالب الرسمية إعدادات أداة أخذ العينات التي ضُبط النموذج عليها، ويحتوي سير عمل الفيديو على مواضع أكثر بكثير يمكن أن تُضبط فيها قيمة بشكل غير صحيح من دون ملاحظة، مقارنةً بسير عمل الصور.

عندما تكون الإجابة الصادقة هي استخدام واجهة API

يكون استضافة توليد الفيديو ذاتيًا خيارًا مناسبًا عندما يكون حجم الاستخدام مرتفعًا ومستقرًا، أو عندما يجب ألا تغادر الإطارات بنيتك التحتية، أو عندما تحتاج إلى نموذج محدد أو محول مخصص لا توفره أي خدمة مستضافة. ويكون هذا الخيار مناسبًا أيضًا عندما يجب أن تظل المنظومة تعمل بالطريقة نفسها بعد عام، لأن النموذج المستضاف قد يتغير دون أن يتوفر إصدار يمكنك تثبيته.

استخدم واجهة API مستضافة عندما تحتاج إلى عدد قليل من المقاطع شهريًا، أو عندما تحتاج إلى مخرجات أطول أو أكبر من التي تنتجها النماذج المفتوحة، أو عندما يكون لديك موعد نهائي هذا الأسبوع. احسب نقطة التعادل بواقعية. تبلغ تكلفة استئجار بطاقة بسعة 24 GB على مدار الساعة، وفق السعر الوسيط في July 2026، نحو 260 دولارًا شهريًا. أما شراء البطاقة نفسها فيكلف أكثر من ذلك مقدمًا، قبل أن تنشئ إطارًا واحدًا. يخسر خادم الاستضافة الذاتية غير المستخدم أمام تسعير واجهة API لكل مقطع في كل مرة. هذه هي المفاضلة نفسها التي تحدد طريقة تقديم نماذج النصوص، كما هو موضح في Ollama مقابل vLLM لتقديم نماذج LLM المستضافة ذاتيًا. وتأتي هذه المفاضلة بعد السؤال الأساسي الوارد في ما إذا كان VPS مزودًا بوحدة GPU يستحق التكلفة أصلًا.

ما يجب التحقق منه عند فشل التصيير

إذا توقف التصيير في النهاية تمامًا بعد اكتمال شريط أخذ العينات، فهذا يعني أن الذاكرة نفدت أثناء فك الترميز في VAE. خفّض عدد الإطارات أو بدّل إلى عقدة فك ترميز مقسّمة إلى مربعات. لن يساعد تغيير عدد الخطوات، لأن فك الترميز يحدث مرة واحدة بعد اكتمال جميع الخطوات.

إذا كان الناتج أسود بالكامل أو مشوشًا بشدة، فهذا يعني عادةً أن VAE لا يتطابق مع النموذج. يؤدي تحميل VAE الخاص بـ Wan 2.1 مع نموذج diffusion الخاص بـ Wan 2.2 إلى هذه النتيجة تحديدًا، ولا يظهر أي خطأ في السجل.

إذا استمر التصيير لكنه استغرق ساعات على جهاز تعرف أنه يحتوي على GPU، فهذا يعني أن ComfyUI يستخدم مسار CPU. تحقّق من سطر الجهاز في سجل بدء التشغيل، ثم أعد تشغيل فحص torch.cuda.is_available() أعلاه.

إذا اختفت العملية مع Killed في dmesg من دون ظهور traceback خاص بـ Python، فهذا يعني أن قاتل نفاد الذاكرة في kernel أنهى العملية. المشكلة إذن في ذاكرة النظام RAM، وليست في VRAM. يتطلب التفريغ إلى الذاكرة بقاء النموذج كاملًا في RAM الخاصة بالنظام، ولذلك لا تكفي سعة جهاز بسعة 16 GB عند تفريغ نموذج 5B. أضف RAM أو أضف swap.

FAQ

هل يمكنني إنشاء فيديو بالذكاء الاصطناعي على VPS من دون GPU؟

لا، ليس بطريقة ستستخدمها مرتين. يستغرق إنشاء مقطع مدته خمس ثوانٍ بدقة 720p تسع دقائق على GPU بسعة 24 GB، بينما يستغرق ساعات طويلة على CPU، لأن النموذج لا يملك عتاد المصفوفات اللازم لتشغيله عليه، ولأن عرض نطاق ذاكرة RAM النظام أقل بمرتبة عشرية من عرض نطاق ذاكرة GPU. يمكن لخادم CPU استضافة واجهة ComfyUI وتخزين النماذج والاحتفاظ بسير العمل، لكن عملية التصيير نفسها تحتاج إلى GPU.

ما مقدار VRAM الذي أحتاج إليه من أجل Wan 2.2؟

بالنسبة إلى نموذج TI2V-5B، تمثل سعة 8 GB الحد الأدنى عند استخدام التفريغ الأصلي في ComfyUI، بينما تمثل سعة 24 GB السعة التي توصي بها Alibaba للوصول إلى السرعة المنشورة. أما نموذجا تحويل النص إلى فيديو وتحويل الصورة إلى فيديو من نوع A14B، فتطلب بطاقة النموذج سعة VRAM لا تقل عن 80 GB للاستدلال باستخدام GPU واحد، ولذلك يحتاجان إلى بطاقات مخصصة لمراكز البيانات.

ما المدة التي يمكن أن يبلغها مقطع مستضاف ذاتيًا؟

حوالي خمس ثوانٍ بدقة 720p هي الوحدة العملية حتى يوليو 2026. يُنتج الإخراج الأطول عبر إنشاء مقاطع متعددة وضمها، باستخدام الإطار الأخير من أحد المقاطع بوصفه الإطار الأول للمقطع التالي. تنحرف الجودة عند نقاط الوصل، لذلك تعامل مع الفيديو الطويل باعتباره مهمة تحرير، لا عملية إنشاء واحدة.

هل استئجار GPU بالساعة أرخص من شراء بطاقة؟

يكون الاستئجار أفضل لأي مدة تقل عن بضع ساعات من التصيير يوميًا. وبالسعر الوسيط في يوليو 2026، الذي يبلغ حوالي 0.36 دولارًا في الساعة لبطاقة بسعة 24 GB، يمكنك الاستئجار فترة طويلة قبل أن تعادل تكلفة شراء تلك البطاقة، كما تتجنب شراء عتاد يتضح أنه من الفئة غير المناسبة للنموذج الذي تريده فعلًا. يكون الشراء أفضل فقط عندما يكون الخادم مشغولًا معظم اليوم، كل يوم.