SSD Nodes Learn Hosting plans →
الأدلة Matt Connorبقلم Matt Connor · آخر تحديث في 2026-08-13

مولّد فيديو بالذكاء الاصطناعي مستضاف ذاتياً: الواقع

تعرّف إلى ما تنتجه النماذج المفتوحة في يوليو 2026، وسعة VRAM المطلوبة لكل نموذج، وتكلفة مقطع مدته 5 ثوانٍ على GPU مستأجر، ومتى تختار API.

ما الذي يستطيع مولّد فيديو بالذكاء الاصطناعي مستضاف ذاتياً فعله فعلياً

يعمل مولّد فيديو بالذكاء الاصطناعي مستضاف ذاتياً اليوم، لكنه أبطأ وأصغر نطاقاً مما توحي به المقاطع التجريبية. حتى July 2026، النماذج المفتوحة التي تستحق التشغيل هي Wan 2.2 من Alibaba وHunyuanVideo من Tencent، إضافة إلى LTX-Video من Lightricks عندما تكون السرعة أهم من الواقعية. تعمل جميعها ضمن ComfyUI على جهاز Linux مزوّد بوحدة معالجة رسومات NVIDIA. والنتيجة مقطع مدته نحو خمس ثوانٍ بدقة 720p. ليست مشهداً كاملاً، وليست دقيقة من لقطات نهائية.

إليك الإجابة المختصرة قبل التفاصيل. تعالج بطاقة بسعة 24 GB مقطعاً مدته خمس ثوانٍ بدقة 720p خلال بضع دقائق. وتحتاج بطاقة بسعة 12 GB إلى عشرين دقيقة أو أكثر للمهمة نفسها، لأن الأوزان لا تتسع لها ذاكرة الفيديو، ويواصل البرنامج نقل الطبقات ذهاباً وإياباً إلى ذاكرة RAM النظام. أما الخادم الذي لا يحتوي على GPU فلا يستطيع تنفيذ ذلك بطريقة مفيدة عملياً. فالحسابات التي جعلت توليد الصور باستخدام CPU بطيئاً تجعل توليد الفيديو باستخدام CPU عديم الجدوى.

إذا كنت قد قرأت التدرج العتادي لمولّد صور مستضاف ذاتياً، فالفيديو يطرح الحجة نفسها، لكن مع رفع كل رقم درجة واحدة. تظل VRAM (ذاكرة الفيديو، وهي ذاكرة RAM الملحومة بجوار شريحة الرسومات) المواصفة الوحيدة التي تحدد ما إذا كانت التجربة سهلة أم مرهقة.

لماذا تكلّف لقطة فيديو واحدة أكثر بكثير من صورة واحدة

ينشئ نموذج diffusion صورة عبر إزالة التشويش منها على مراحل، وتقرأ كل مرحلة كل وزن في النموذج. يفعل نموذج الفيديو الشيء نفسه مع كتلة كاملة من الإطارات دفعة واحدة، ويضيف آلية انتباه عبر الزمن، بحيث يعرف الإطار 80 ما الذي ظهر في الإطار 12. خمس ثوانٍ بمعدل 24 إطاراً في الثانية تعني 120 إطاراً في دفعة واحدة.

لهذا السبب لا تتناسب التكلفة بسلاسة مع طول المقطع عند استخدام آلية الانتباه الزمني. تؤدي مضاعفة عدد الإطارات إلى زيادة الذاكرة التي يحتاج إليها sampler بأكثر من الضعف، لذلك لا تكون المشكلة أن التصيير يصبح أبطأ. بل يفشل التصيير ويتوقف.

تحدث طفرة ثانية في استهلاك الذاكرة لا يتوقعها كثيرون. بعد انتهاء sampler، يفك VAE (المشفّر التلقائي التوليدي، وهو الجزء الذي يحوّل latent المضغوط إلى وحدات بكسل فعلية) ترميز فيديو latent بالكامل دفعة واحدة. وقد يحتاج فك الترميز هذا إلى ذاكرة أكبر مما احتاج إليه أخذ العينات. يتمثل العَرَض في مهمة تعرض شريط تقدم مكتملًا، ثم تطبع ما يلي:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

الحل هو استخدام فك ترميز مقسّم إلى أجزاء أو تقصير المقطع. إن معرفة المرحلة التي نفدت فيها الذاكرة تمنعك من ضبط الإعداد الخاطئ لمدة ساعة.

مقدار VRAM الذي تحتاجه لتوليد فيديو بالذكاء الاصطناعي

تحدّد رقمان منشوران كامل القرار، ويبدوان متناقضين. تذكر Alibaba أن نموذج Wan 2.2 TI2V-5B ينشئ مقاطع بدقة 720p وبسرعة 24 إطاراً في الثانية، مدتها خمس ثوانٍ، في أقل من تسع دقائق باستخدام GPU استهلاكي واحد مثل 4090، وتوصي بما لا يقل عن 24 GB من VRAM. وتذكر وثائق ComfyUI أن النموذج نفسه بحجم 5B «يعمل جيداً على 8GB من vram مع آلية offloading الأصلية في ComfyUI».

كلا الرقمين صحيح، لأن كل واحد منهما يقيس أمراً مختلفاً. سعة 8 GB تكفي لتشغيل النموذج. أما 24 GB فتوفّر مساحة مريحة للتشغيل. تعمل آلية offloading على إبقاء معظم النموذج في ذاكرة النظام RAM، وبث طبقاته إلى GPU عند كل خطوة. لذلك تقضي البطاقة وقتها في انتظار ناقل PCIe بدلاً من تنفيذ العمليات الحسابية. وتدفع هذه الكلفة في كل خطوة من خطوات sampler، لا مرة واحدة.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

الصف الأخير فقط هو رقم صادر عن المورّد. تصل البطاقة بسعة 24 GB إلى 9 دقيقة لكل مقطع، وهو الرقم المنشور من Alibaba لهذا النموذج. أما الصفوف الأخرى فتوضح أثر offloading، وهي تقديرات تقريبية من حيث الحجم وليست نتائج benchmark. المغزى هو الاتجاه العام: 40 دقيقة على بطاقة بسعة 8 GB تعني إعداداً يعمل من الناحية التقنية، لكنها عملياً مهمة batch تتركها تعمل طوال الليل.

نماذج Wan 2.2 الأكبر تنتمي إلى فئة مختلفة. تتطلب إصدارات A14B لتحويل النص إلى فيديو وتحويل الصورة إلى فيديو ما لا يقل عن 80 GB من VRAM للاستدلال باستخدام GPU واحد. هذه عتاد مراكز بيانات، وليست بطاقة تضعها في جهاز مكتبي. وهنا يبدأ self-hosting بمعنى استئجار accelerator يملكه طرف آخر بالساعة. وتستمر الحسابات نفسها إلى نطاق أكبر بكثير في جانب النص، إذ إن استضافة نموذج ذاتياً بحجم 2.8 تريليون معلمة مثل Kimi K3 لا تعود مسألة بطاقة واحدة، بل تصبح مسألة عدد البطاقات بسعة 80 GB التي تستطيع تحمل تكلفة توصيلها معاً.

تكلفة المقطع على GPU مستأجر

الاستئجار هو الطريقة المناسبة لمعظم المستخدمين لاختبار ذلك، لأن البطاقة التي تشتريها ستكون عتاداً غير مناسب إذا كان النموذج الذي ستحتاج إليه في النهاية يتطلب 80 GB. هذه هي الأسعار الوسيطة حسب الطلب عبر سوق تأجير GPU، اعتباراً من July 2026:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

يشغّل صف 4090 نموذج 5B، وتبلغ تكلفته نحو 0.05 دولاراً لكل مقطع بسعر 0.36 دولاراً في الساعة. أما الصفوف ذات سعة 80 GB فتشغّل نماذج 14B، ولذلك ترتفع تكلفة المقطع إلى 0.6 دولاراً، رغم أن العتاد نفسه أسرع بكثير. فالنموذج الأكبر يتطلب حسابات أكثر لكل ثانية من الفيديو.

قد تبدو تكلفة خمسة سنتات للمقطع ضئيلة، وهنا يكمن التضليل. لن تكون أول خمسة ثوانٍ قابلة للاستخدام عملية توليد واحدة. إن إنشاء مطالبة لنموذج فيديو هو عملية بحث، ومن الطبيعي إجراء 20 إلى 40 عملية توليد قبل الحصول على لقطة مناسبة، إذا كانت اللقطة تتضمن حركة محددة. لذلك تكلف جلسة العمل الفعلية دولارات لا سنتات، وتبلغ تكلفة قضاء فترة بعد الظهر في التكرار على عتاد مستأجر تقريباً تكلفة وجبة الغداء.

هناك تفصيلان في التأجير قد يكلّفانك مالاً فعلياً إذا أغفلتهما. تُحتسب الرسوم أثناء تنزيل الجهاز للأوزان، كما أن ملفات Wan 2.2 مع مُشفّر النص وVAE الخاصين بها يبلغ حجمها عشرات GB، لذلك اختر موفراً يتيح وحدة تخزين دائمة ونزّل الملفات مرة واحدة. وتُحتسب الرسوم أيضاً أثناء بقاء الجهاز خاملاً مع إبقاء جلسة SSH مفتوحة. أوقف الـinstance بدلاً من الاكتفاء بإغلاق الطرفية.

ثبّت ComfyUI على خادم GPU

ابدأ من Ubuntu 24.04 مع تثبيت برنامج تشغيل NVIDIA مسبقاً. تحقّق من برنامج التشغيل أولاً، لأن كل الأعطال اللاحقة ستبدو متطابقة إذا لم تُجرِ هذا الفحص.

nvidia-smi

يجب أن يعرض هذا الأمر جدولاً يتضمن بطاقتك وإصدار CUDA. إذا عرض NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver، فهذا يعني أن وحدة النواة غير محمّلة، ويحدث ذلك عادةً بعد ترقية النواة من دون إعادة التشغيل. أصلح المشكلة هنا. وإلا فسيتحول ComfyUI إلى مسار CPU، وستقضي ساعة في إلقاء اللوم على النموذج.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

تأكد من أن PyTorch يرى البطاقة قبل تنزيل ملف أوزان واحد.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

يعني True مع اسم بطاقتك أن الحزمة البرمجية تعمل بصورة سليمة. أما False فيعني أن wheel المثبّتة هي الإصدار الذي يعمل على CPU فقط، ويحدث ذلك عندما يعثر pip على نسخة torch مخزنة مؤقتاً من تثبيت سابق. أعد التثبيت باستخدام عنوان الفهرس أعلاه.

تنزيل ملفات نموذج Wan 2.2

لا يتضمن ComfyUI أوزاناً، ونموذج الفيديو ليس ملفاً واحداً. يتكوّن من نموذج diffusion ومشفّر نصي وVAE، ويُوضع كل مكوّن في دليله الخاص. إذا وضعت ملفاً في المجلد الخطأ، فلن تعرضه عقدة التحميل ببساطة، من دون أي خطأ يوضح السبب.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

يدعم نموذج 5B كلاً من تحويل النص إلى فيديو وتحويل الصورة إلى فيديو، ولذلك فهو نقطة البداية المنطقية. استخدم دائماً .safetensors بدلاً من .ckpt. ملف .ckpt هو كائن Python مُسلسل باستخدام pickle، ولذلك يؤدي تحميله إلى تشغيل التعليمات البرمجية التي كتبها من أنشأه. خصّص مساحة كافية على القرص: يحتاج التثبيت العامل مع عائلة نموذج واحدة ومخرجاتها إلى 100 GB، كما أن ملفات الفيديو أكبر بكثير من صور PNG التي يتركها سير عمل الصور. أجرِ نسخاً احتياطية من ملفات JSON الخاصة بسير العمل باستخدام ما يشبه نسخاً احتياطية تزايدية مشفّرة إلى تخزين الكائنات، لأن إعادة تنزيل الأوزان ممكنة، أما عمليات سير العمل التي ضبطتها فليست كذلك.

شغّله والوصول إليه بأمان

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

لا يحتوي ComfyUI على شاشة تسجيل دخول أو حسابات مستخدمين. يمكن لأي جهة تصل إلى المنفذ 8188 وضع المهام في قائمة الانتظار، وقراءة كل المقاطع التي أنشأتها، وتثبيت عقد مخصّصة، ما يتيح تنفيذ تعليمات برمجية عشوائية على خادمك. اربطه بـlocalhost، ثم صِل إليه عبر نفق SSH من جهازك.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

بعد ذلك، افتح http://127.0.0.1:8188 في متصفحك. حمّل سير عمل القالب Wan 2.2 من قائمة قوالب ComfyUI بدلاً من توصيل العقد يدوياً. تتضمن القوالب الرسمية إعدادات أداة أخذ العينات التي ضُبط النموذج وفقها، ويحتوي سير عمل الفيديو على مواضع أكثر بكثير يمكن أن تُضبط فيها قيمة بشكل خاطئ دون ملاحظة، مقارنةً بسير عمل الصور.

متى تكون الإجابة الصريحة هي استخدام API

يكون استضافة توليد الفيديو ذاتياً الخيار المناسب عندما يكون حجم الاستخدام مرتفعاً ومستقراً، أو عندما يجب ألا تغادر الإطارات بنيتك التحتية، أو عندما تحتاج إلى نموذج محدد أو adapter مخصص لا توفره أي خدمة مستضافة. ويكون هذا الخيار مناسباً أيضاً عندما يجب أن يستمر مسار المعالجة في العمل بالطريقة نفسها بعد عام، لأن النموذج المستضاف قد يتغير دون أن يتوفر إصدار يمكن تثبيته.

استخدم API مستضافاً عندما تحتاج إلى عدد قليل من المقاطع شهرياً، أو عندما تحتاج إلى مخرجات أطول أو أكبر مما تنتجه النماذج المفتوحة، أو عندما يكون لديك موعد نهائي هذا الأسبوع. احسب نقطة التعادل بصدق. تبلغ تكلفة بطاقة بسعة 24 GB مستأجرة على مدار الساعة وفق الوسيط في July 2026 نحو 260 دولاراً شهرياً، بينما يكلف شراء البطاقة نفسها أكثر من ذلك مقدماً، قبل أن تولّد إطاراً واحداً. يخسر خادم الاستضافة الذاتية الخامل أمام تسعير API لكل مقطع في كل مرة. هذه هي المفاضلة نفسها التي تحدد طريقة تقديم نماذج النصوص، كما هو موضح في Ollama مقابل vLLM لتقديم LLM مستضاف ذاتياً، وهي تأتي بعد السؤال الأساسي في هل يستحق VPS مزود بـGPU تكلفته أصلاً.

ما الذي يجب التحقق منه عند فشل التصيير

إذا توقف التصيير في النهاية تماماً، بعد اكتمال شريط أداة أخذ العينات، فهذا يعني غالباً نفاد الذاكرة أثناء فك ترميز VAE. قلّل عدد الإطارات أو بدّل إلى عقدة فك ترميز مقسّمة إلى مربعات. لن يفيد تغيير عدد الخطوات، لأن فك الترميز يحدث مرة واحدة بعد اكتمال جميع الخطوات.

إذا كان الناتج أسود بالكامل أو مشوّشاً بشدة، فهذا يعني عادةً أن VAE غير متوافق مع النموذج. يؤدي تحميل VAE الخاص بـWan 2.1 مع نموذج انتشار Wan 2.2 إلى هذه النتيجة تحديداً، ولا يظهر أي خطأ في السجل.

إذا اكتمل التصيير لكنه استغرق ساعات على جهاز تعلم أنه يحتوي على GPU، فهذا يعني أن ComfyUI يعمل عبر مسار CPU. تحقق من سطر الجهاز في سجل بدء التشغيل، ثم أعد تشغيل فحص torch.cuda.is_available() أعلاه.

إذا اختفت العملية وظهر Killed في dmesg من دون تتبّع أخطاء Python، فهذا يعني أن kernel أوقف العملية بسبب نفاد الذاكرة. الذاكرة المقصودة هنا هي RAM النظام، وليست VRAM. يتطلب تفريغ النموذج بقاء النموذج كاملاً في RAM النظام، ولذلك لا تكفي ذاكرة بسعة 16 GB لتفريغ نموذج بحجم 5B. أضف RAM أو أضف swap.

FAQ

هل يمكنني إنشاء فيديو بالذكاء الاصطناعي على VPS من دون GPU؟

لا، ليس بطريقة عملية إذا كنت ستستخدمه أكثر من مرة. يستغرق مقطع مدته خمس ثوانٍ بدقة 720p تسع دقائق على GPU بسعة 24 GB، لكنه يستغرق ساعات كثيرة على CPU، لأن النموذج لا يملك عتاداً مصفوفياً لتشغيله عليه، ولأن عرض نطاق ذاكرة النظام أقل بمرتبة مقدارها 10 مرات من عرض نطاق ذاكرة GPU. يمكن لخادم CPU استضافة واجهة ComfyUI، وتخزين النماذج، والاحتفاظ بسير العمل، لكن عملية التصيير نفسها تحتاج إلى GPU.

ما مقدار VRAM الذي أحتاج إليه لتشغيل Wan 2.2؟

بالنسبة إلى نموذج TI2V-5B، تمثل سعة 8 GB الحد الأدنى مع native offloading في ComfyUI، بينما توصي Alibaba بسعة 24 GB للحصول على السرعة المنشورة. أما نموذجا تحويل النص إلى فيديو وتحويل الصورة إلى فيديو من نوع A14B، فتطلب صفحة النموذج لهما ما لا يقل عن 80 GB من VRAM للاستدلال باستخدام GPU واحد، ولذلك يحتاجان إلى بطاقات مخصصة لمراكز البيانات.

ما المدة التي يمكن أن يبلغها مقطع مستضاف ذاتياً؟

تبلغ المدة العملية نحو خمس ثوانٍ بدقة 720p اعتباراً من July 2026. يُنتج الإخراج الأطول عبر إنشاء مقاطع متتابعة وضمها، باستخدام الإطار الأخير من أحد المقاطع بوصفه الإطار الأول للمقطع التالي. تتغير الجودة عند نقاط الوصل، لذلك تعامل مع الفيديو الطويل باعتباره مهمة مونتاج، لا عملية توليد واحدة.

هل استئجار GPU بالساعة أرخص من شراء بطاقة؟

يكون الاستئجار أفضل إذا كانت مدة التصيير اليومية أقل من بضع ساعات. عند السعر الوسيط في July 2026، والبالغ نحو 0.36 دولاراً في الساعة لبطاقة بسعة 24 GB، يمكنك الاستئجار مدة طويلة قبل أن تصل التكلفة إلى سعر شراء تلك البطاقة، كما تتجنب شراء عتاد يتضح أنه من الفئة غير المناسبة للنموذج الذي تريد استخدامه فعلياً. يكون الشراء أفضل فقط عندما يعمل الخادم معظم اليوم، كل يوم.