מחולל וידאו AI באירוח עצמי: מה באמת אפשרי ביולי 2026
מה מפיקים מודלים כמו Wan 2.2 ו-HunyuanVideo ב-ComfyUI? גלו כמה VRAM נדרש לרינדור 720p, מה העלות האמיתית להשכרת GPU לקליפ של 5 שניות ומתי עדיף להשתמש ב-API חיצוני.
מה מחולל וידאו מבוסס AI באירוח עצמי באמת מסוגל לעשות
מחולל וידאו מבוסס AI באירוח עצמי עובד כיום, אך הוא איטי ומוגבל יותר ממה שסרטוני ההדגמה מרמזים. נכון ליולי 2026, המודלים בקוד פתוח שכדאי להריץ הם Wan 2.2 של Alibaba ו-HunyuanVideo של Tencent, בנוסף ל-LTX-Video של Lightricks כאשר המהירות חשובה יותר מהריאליזם. כולם רצים תחת ComfyUI על מכונת Linux עם כרטיס מסך NVIDIA. התוצר שמתקבל הוא קליפ של כחמש שניות ברזולוציית 720p. לא סצנה שלמה. לא דקה של צילומים ערוכים.
להלן התשובה הקצרה לפני הפירוט. כרטיס עם 24 GB VRAM מרנדר קליפ של חמש שניות ב-720p בתוך דקות בודדות. כרטיס עם 12 GB מבצע את אותה עבודה ב-20 דקות או יותר, מכיוון שהמשקולות (weights) אינן נכנסות בזיכרון הווידאו והתוכנה מעבירה שכבות הלוך ושוב לזיכרון ה-RAM של המערכת. שרת ללא כרטיס מסך אינו יכול לבצע זאת באופן מעשי. החישוב שהפך יצירת תמונות על גבי CPU לאיטית, הופך יצירת וידאו על גבי CPU לחסרת תועלת.
אם כבר קראת את סולם החומרה למחולל תמונות באירוח עצמי, וידאו הוא אותו טיעון בדיוק, כאשר כל מספר עולה בדרגה אחת. VRAM (זיכרון וידאו, ה-RAM המולחם לצד שבב הגרפיקה) הוא עדיין המפרט היחיד שקובע אם מדובר בחוויה מהנה או מייסרת.
מדוע עלות הפקת סרטון גבוהה משמעותית מעלות הפקת תמונה
מודל דיפוזיה מייצר תמונה באמצעות הסרת רעש בשלבים, כאשר כל שלב קורא את כל המשקולות במודל. מודל וידאו מבצע פעולה דומה על בלוק שלם של פריימים בבת אחת, ומוסיף מנגנון attention לאורך ציר הזמן, כך שפריים 80 "מודע" לאופן שבו נראה פריים 12. חמש שניות בקצב של 24 פריימים לשנייה הן 120 פריימים ב-batch אחד.
מנגנון ה-temporal attention הזה הוא הסיבה לכך שהעלות אינה גדלה בצורה ליניארית עם אורך הקטע. הכפלת מספר הפריימים מגדילה את צריכת הזיכרון של ה-sampler ביותר מפי שניים, לכן כשל במערכת אינו מתבטא ברינדור איטי יותר, אלא בקריסת הרינדור עצמו.
קיים זינוק נוסף בזיכרון שמשתמשים רבים אינם צופים. לאחר שה-sampler מסיים את עבודתו, ה-VAE (רכיב ה-variational autoencoder, האחראי על הפיכת ה-latent הדחוס לפיקסלים ממשיים) מפענח את כל ה-latent של הווידאו בבת אחת. פענוח זה עלול לדרוש זיכרון רב יותר מאשר תהליך ה-sampling עצמו. התסמין לכך הוא משימה שמציגה סרגל התקדמות מלא, ולאחריו מופיעה השגיאה הבאה:
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiBהפתרון הוא שימוש ב-tiled decoding או קיצור אורך הקטע. הבנה של איזה שלב חרג ממכסת הזיכרון חוסכת זמן יקר בביצוע כיוונונים שגויים.
כמה VRAM נדרש ליצירת וידאו באמצעות AI
שני נתונים שפורסמו מגדירים את כל תהליך קבלת ההחלטות, והם נראים כסותרים זה את זה. חברת Alibaba מציינת כי מודל Wan 2.2 TI2V-5B מפיק קטעי וידאו ברזולוציית 720p ב-24 פריימים לשנייה, באורך חמש שניות, בפחות מתשע דקות על גבי GPU צרכני יחיד כגון 4090, והיא ממליצה על לפחות 24 GB של VRAM. לעומת זאת, התיעוד של ComfyUI מציין כי אותו מודל 5B "אמור להתאים היטב ל-8 GB VRAM עם ה-native offloading של ComfyUI".
שני הנתונים נכונים כיוון שהם מודדים דברים שונים. 8 GB הם הסף שבו המודל נכנס לזיכרון. 24 GB הם הסף שבו העבודה מתבצעת בנוחות. מנגנון ה-offloading פועל על ידי שמירת רוב המודל ב-RAM של המערכת והזרמת שכבות ל-GPU עבור כל צעד, כך שהכרטיס מבלה את זמנו בהמתנה לאפיק ה-PCIe במקום בביצוע חישובים. את המחיר הזה משלמים בכל צעד של ה-sampler, ולא רק פעם אחת.
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]רק השורה האחרונה מייצגת נתון של היצרן. כרטיס עם 24 GB מגיע ל-9 דקות לקטע וידאו, וזהו הנתון הרשמי שפרסמה Alibaba עבור מודל זה. השורות האחרות מציגות את ההשפעה של ה-offloading, והן מהוות הערכת סדר גודל ולא תוצאות של benchmark. העיקר הוא המגמה: 40 דקות על כרטיס של 8 GB הן טכנית הגדרה תקינה, אך בפועל מדובר במשימת batch שמשאירים לרוץ לאורך כל הלילה.
המודלים הגדולים יותר של Wan 2.2 הם עולם אחר. הגרסאות text-to-video ו-image-to-video של A14B דורשות לפחות 80 GB של VRAM עבור הסקה (inference) ב-GPU יחיד. זהו חומרה של מרכזי נתונים, לא כרטיס שמתקינים במחשב שולחני, וזו הנקודה שבה אירוח עצמי מתחיל להיות שווה ערך לשכירת מאיץ של מישהו אחר לפי שעה. אותה אריתמטיקה תקפה במידה רבה עוד יותר בתחום הטקסט, שבו אירוח עצמי של מודל עם 2.8 טריליון פרמטרים כמו Kimi K3 מפסיק להיות שאלה על כרטיס אחד והופך לשאלה על כמה כרטיסי 80 GB ניתן להרשות לעצמך לחבר יחד.
עלות יצירת קליפ בשימוש ב-GPU מושכר
עבור רוב המשתמשים, השכרה היא הדרך הנכונה לבחון זאת, שכן כרטיס שתקנו עלול להתברר כחומרה לא מתאימה אם המודל שתבחרו בסופו של דבר דורש 80 GB. להלן המחירים החציוניים לפי דרישה בשוק השכרת ה-GPU, נכון ליולי 2026:
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]השורה של 4090 מריצה את מודל ה-5B בעלות של כ-0.05 דולר לקליפ, בתעריף של 0.36 דולר לשעה. השורות של 80 GB מריצות את מודלי ה-14B, וזו הסיבה שהעלות לקליפ קופצת ל-0.6 דולר, אף שהחומרה עצמה מהירה משמעותית. מודל גדול יותר דורש כוח עיבוד רב יותר לכל שניית וידאו.
חמישה סנט לקליפ נשמעים כמו סכום זניח, אך זהו החלק המטעה. חמש השניות הראשונות שניתן להשתמש בהן לעולם אינן תוצר של רינדור אחד. כתיבת פרומפט למודל וידאו היא תהליך של חיפוש, ועשרים עד ארבעים רינדורים לפני השגת תוצאה ראויה הם דבר שבשגרה עבור שוט עם תנועה ספציפית. לכן, סשן עבודה עולה דולרים ולא סנטים, ועלות של אחר צהריים שלם של איטרציות על חומרה מושכרת שקולה לעלות ארוחת צהריים.
שני פרטים בהשכרה עלולים לעלות לכם כסף רב אם תתעלמו מהם. אתם מחויבים בתשלום בזמן שהשרת מוריד משקולות (weights), והקבצים של Wan 2.2, יחד עם מקודד הטקסט וה-VAE, מגיעים לעשרות גיגה-בייטים; לכן, בחרו ספק המציע נפח אחסון קבוע (persistent volume) והורידו את הקבצים פעם אחת בלבד. כמו כן, אתם מחויבים בתשלום בזמן שהשרת עומד ללא פעילות בעוד סשן ה-SSH שלכם פתוח. עצרו את ה-instance במקום רק לסגור את הטרמינל.
התקנת ComfyUI על שרת עם GPU
התחילו עם Ubuntu 24.04 כאשר מנהל ההתקן של NVIDIA כבר מותקן. בדקו תחילה את מנהל ההתקן, שכן כל כשל מאוחר יותר ייראה זהה ללא בדיקה זו.
nvidia-smiהפקודה אמורה להציג טבלה עם כרטיס המסך שלכם וגרסת CUDA. אם מופיעה השגיאה NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, מודול הליבה אינו טעון, מה שקורה בדרך כלל לאחר שדרוג ליבה ללא אתחול (reboot). תקנו זאת כעת. אחרת, ComfyUI יחזור להשתמש ב-CPU ואתם תבזבזו שעה בניסיון לאתר את מקור הבעיה במודל.
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txtוודאו ש-PyTorch מזהה את הכרטיס לפני הורדת קובץ משקולות (weight) כלשהו.
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"הפלט True בצירוף שם הכרטיס שלכם מעיד על כך שהסביבה תקינה. הפלט False מציין שהותקנה גרסת ה-wheel המיועדת ל-CPU בלבד, דבר שקורה כאשר pip מוצא גרסת torch שמורה במטמון מהתקנה קודמת. התקינו מחדש באמצעות ה-index URL המצוין לעיל.
הורדת קובצי המודל Wan 2.2
ComfyUI מופץ ללא משקולות (weights), ומודל וידאו אינו מורכב מקובץ אחד בלבד. מדובר במודל דיפוזיה, מקודד טקסט ו־VAE, כאשר כל אחד מהם נדרש להשמה בספרייה הייעודית לו. הצבת קובץ בתיקייה שגויה תגרום לכך שצומת הטעינה (loader node) פשוט לא יציג אותו ברשימה, ללא הודעת שגיאה שתסביר את הסיבה.
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensorsהמודל בגרסת 5B מטפל הן בטקסט לווידאו והן בתמונה לווידאו, ולכן הוא נקודת ההתחלה ההגיונית. העדיפו תמיד .safetensors על פני .ckpt. קובץ .ckpt הוא אובייקט Python שעבר סריאליזציה (pickled), ולכן טעינתו מריצה קוד שנכתב על ידי מי שבנה אותו. הקצו שטח דיסק בנדיבות: התקנה תקינה הכוללת משפחת מודלים אחת והפלט שלה דורשת 100 GB, וקובצי וידאו גדולים משמעותית מתמונות PNG שנוצרות בתהליכי עבודה של תמונות. בצעו גיבוי לקובצי ה-JSON של תהליכי העבודה שלכם באמצעות כלי כגון גיבויים מצטברים מוצפנים לאחסון אובייקטים, שכן את המשקולות ניתן להוריד מחדש, אך את תהליכי העבודה המכווננים שלכם לא ניתן לשחזר.
הרצה וגישה מאובטחת
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188ל-ComfyUI אין מסך התחברות או חשבונות משתמש. כל גורם שיכול להגיע לפורט 8188 יכול להוסיף משימות לתור, לקרוא כל קליפ שיצרת ולהתקין צמתים (custom nodes) מותאמים אישית, מה שמהווה הרצת קוד שרירותי על השרת שלך. הגדר את השירות להאזין ל-localhost בלבד וגש אליו דרך מנהרת SSH מהמחשב האישי שלך.
ssh -N -L 8188:127.0.0.1:8188 you@your-serverלאחר מכן, פתח את http://127.0.0.1:8188 בדפדפן שלך. טען את תבנית ה-workflow של Wan 2.2 מתוך תפריט התבניות של ComfyUI במקום לחבר צמתים ידנית. התבניות הרשמיות כוללות את הגדרות הדגימה (sampler settings) שעבורן המודל עבר כוונון, ול-workflow של וידאו יש הרבה יותר נקודות שבהן ערך שגוי עלול להוביל לתוצאה לא תקינה בהשוואה ל-workflow של תמונה.
מתי התשובה הכנה היא להשתמש ב-API
אירוח עצמי של יצירת וידאו הוא הבחירה הנכונה כאשר הנפח גבוה וקבוע, כאשר הפריימים חייבים להישאר בתשתית שלכם, או כאשר אתם זקוקים למודל ספציפי או ל-adapter מותאם אישית ששום שירות מאוחסן אינו מציע. זוהי גם הבחירה הנכונה כאשר ה-pipeline חייב להמשיך לעבוד באותה צורה גם בעוד שנה, כיוון שמודל מאוחסן יכול להשתנות ללא התראה וללא אפשרות לקבע גרסה.
השתמשו ב-API מאוחסן כאשר אתם זקוקים למספר קטן של קטעי וידאו בחודש, כאשר אתם זקוקים לפלט ארוך או גדול יותר ממה שהמודלים הפתוחים מסוגלים לייצר, או כאשר יש לכם דד-ליין השבוע. בצעו חישוב כדאיות כנה. כרטיס 24 GB המושכר מסביב לשעון לפי החציון של יולי 2026 עולה בערך 260 דולר בחודש, ורכישת אותו כרטיס עולה יותר מכך מראש, עוד לפני שיצרתם פריים אחד. שרת מאוחסן עצמית שעומד ללא שימוש תמיד יפסיד בהשוואה לתמחור לפי קטע של API. זהו אותו שיקול שמכריע כיצד תגישו מודלי טקסט, כפי שנסקר ב-Ollama מול vLLM להגשת LLM באירוח עצמי, והוא מונח על גבי השאלה הבסיסית יותר ב-האם VPS עם GPU בכלל משתלם כלכלית.
מה לבדוק כאשר רינדור נכשל
רינדור שקורס ממש בסוף, לאחר השלמת סרגל הדגימה, סבל ממחסור בזיכרון במהלך פעולת ה-VAE decode. צמצמו את מספר הפריימים או עברו לשימוש ב-tiled decode node. שינוי מספר הצעדים (step count) לא יועיל, כיוון שהפענוח מתבצע פעם אחת בלבד, לאחר שכל הצעדים כבר הסתיימו.
פלט שחור לחלוטין או משובש בצורה קשה מעיד בדרך כלל על חוסר התאמה בין ה-VAE לבין המודל. טעינת VAE של Wan 2.1 עבור מודל diffusion מסוג Wan 2.2 תפיק בדיוק תוצאה כזו, ולא תופיע שום שגיאה בלוגים.
רינדור שרץ אך נמשך שעות על מכונה שבה מותקן GPU מעיד על כך ש-ComfyUI פועל בנתיב ה-CPU. בדקו בלוג ההפעלה את שורת ה-device, ולאחר מכן הריצו שוב את בדיקת ה-torch.cuda.is_available() שלעיל.
תהליך שנעלם עם Killed בתוך dmesg ללא traceback של Python, הוא תוצאה של ה-kernel out-of-memory killer; מדובר במחסור בזיכרון RAM של המערכת, לא ב-VRAM. תהליך ה-offloading דורש שהמודל כולו יהיה טעון בזיכרון ה-RAM של המערכת, מה שאומר שמכונה עם 16 GB אינה מספיקה עבור מודל 5B. הוסיפו RAM או הוסיפו swap.
FAQ
האם ניתן לייצר וידאו מבוסס AI על שרת VPS ללא GPU?
לא, לא באופן שיהיה שימושי לשימוש חוזר. סרטון באורך חמש שניות ברזולוציית 720p, שלוקח תשע דקות על גבי GPU עם 24 GB, ייקח שעות רבות על מעבד (CPU), כיוון שלמודל אין חומרה לחישובי מטריצות להרצה, ורוחב הפס של ה-RAM במערכת נמוך בסדרי גודל מרוחב הפס של זיכרון ה-GPU. שרת מבוסס CPU יכול לארח את הממשק של ComfyUI, לאחסן את המודלים ולשמור את תהליכי העבודה (workflows), אך הרינדור עצמו מחייב GPU.
כמה VRAM נדרש עבור Wan 2.2?
עבור מודל ה-TI2V-5B, נפח של 8 GB הוא הרף המינימלי בשימוש ב-offloading מובנה של ComfyUI, ו-24 GB הוא הנפח שחברת Alibaba ממליצה עליו כדי להגיע למהירות המוצהרת. עבור מודלי ה-text-to-video וה-image-to-video מסוג A14B, דף המודל דורש לפחות 80 GB של VRAM עבור הסקה (inference) ב-GPU בודד, ולכן מודלים אלו מחייבים כרטיסים ברמת מרכז נתונים (data-center).
מהו אורך הסרטון המקסימלי שניתן להפיק באירוח עצמי?
נכון ליולי 2026, יחידת המידה המעשית היא כחמש שניות ברזולוציית 720p. הפקה של פלט ארוך יותר מתבצעת על ידי יצירת מקטעים וחיבורם, תוך שימוש בפריים האחרון של מקטע אחד כפריים הראשון של המקטע הבא. איכות הווידאו עלולה להיפגע בנקודות החיבור, לכן יש להתייחס לווידאו ארוך כאל עבודת עריכה ולא כאל יצירה אחת בודדת.
האם השכרת GPU לפי שעה זולה יותר מרכישת כרטיס?
השכרה משתלמת יותר לכל שימוש שאינו עולה על כמה שעות רינדור ביום. לפי המחיר החציוני ביולי 2026, העומד על כ-0.36 דולר לשעה עבור כרטיס עם 24 GB, ניתן לשכור שירות למשך זמן רב לפני שמגיעים לעלות הרכישה של כרטיס כזה, ובכך נמנעים מרכישת חומרה שעלולה להתברר כלא מתאימה למודל שבו באמת רוצים להשתמש. רכישה משתלמת רק כאשר השרת עמוס ברוב שעות היום, בכל יום.