מחולל וידאו AI באירוח עצמי: מה באמת אפשר לעשות
מה מפיקים המודלים הפתוחים Wan 2.2, HunyuanVideo ו-LTX-Video ביולי 2026, כמה VRAM דרוש, כמה עולה קטע של 5 שניות ב-GPU שכור ומתי עדיף API.
מה באמת יכול מחולל וידאו מבוסס AI באירוח עצמי לעשות
מחולל וידאו מבוסס AI באירוח עצמי פועל כיום, אך הוא איטי וקטן יותר מכפי שסרטוני ההדגמה מציגים. נכון ליולי 2026, המודלים הפתוחים שכדאי להפעיל הם Wan 2.2 מבית Alibaba ו-HunyuanVideo מבית Tencent, וכן LTX-Video מבית Lightricks כאשר המהירות חשובה יותר מהריאליזם. כולם פועלים תחת ComfyUI במחשב Linux עם GPU של NVIDIA. הפלט הוא קטע באורך של כ-5 שניות וברזולוציה של 720p. לא סצנה. לא דקת צילום גמורה.
הנה התשובה הקצרה לפני הפרטים. כרטיס בנפח 24 GB מרנדר קטע של 5 שניות ברזולוציה של 720p בתוך דקות אחדות. כרטיס בנפח 12 GB מבצע את אותה משימה בתוך 20 דקות או יותר, מכיוון שהמשקולות אינן נכנסות לזיכרון הווידאו והתוכנה מעבירה שכבות הלוך ושוב אל זיכרון ה-RAM של המערכת. שרת ללא GPU אינו מסוגל לבצע זאת באופן שימושי. החישובים שהפכו יצירת תמונות באמצעות CPU לאיטית הופכים יצירת וידאו באמצעות CPU לחסרת טעם.
אם כבר קראת את מדרג החומרה למחולל תמונות באירוח עצמי, וידאו הוא אותו טיעון, כאשר כל מספר עולה בדרגה אחת. VRAM (זיכרון וידאו, כלומר זיכרון ה-RAM המולחם לצד השבב הגרפי) הוא עדיין המפרט היחיד שקובע אם התהליך יהיה נוח או מתסכל.
מדוע סרטון אחד עולה הרבה יותר מתמונה אחת
מודל דיפוזיה יוצר תמונה באמצעות הסרת רעש בשלבים. בכל שלב הוא קורא את כל המשקלים שבמודל. מודל וידאו עושה את אותו הדבר עבור מקטע שלם של פריימים בבת אחת. בנוסף, הוא מפעיל מנגנון קשב לאורך ציר הזמן, כך שפריים 80 יודע כיצד נראה פריים 12. חמש שניות בקצב של 24 פריימים לשנייה הן 120 פריימים באצווה אחת.
מנגנון הקשב לאורך ציר הזמן הוא הסיבה לכך שהעלות אינה גדלה באופן מתון עם אורך הקליפ. הכפלת מספר הפריימים מגדילה ביותר מפי 2 את כמות הזיכרון שהדוגם צריך. לכן הכשל אינו רינדור איטי יותר. הרינדור נכשל.
קיימת קפיצת זיכרון נוספת שרבים אינם מצפים לה. לאחר שהדוגם מסיים, ה-VAE (מקודד-מפענח וריאציוני, הרכיב שממיר את ה-latent הדחוס לפיקסלים ממשיים) מפענח את סרטון ה-latent כולו בבת אחת. פעולת הפענוח עשויה לדרוש יותר זיכרון מפעולת הדגימה. התסמין הוא משימה שמציגה סרגל התקדמות שהושלם ולאחר מכן מדפיסה את הדבר הבא:
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiBהפתרון הוא פענוח באריחים או קליפ קצר יותר. זיהוי השלב שבו אזל הזיכרון מונע מכם לכוונן במשך שעה את ההגדרה הלא נכונה.
כמה זיכרון VRAM דרוש ליצירת סרטוני AI
שני נתונים שפורסמו מגדירים את כל החלטת החומרה, והם נראים סותרים. Alibaba מציינת שהמודל Wan 2.2 TI2V-5B מפיק קטעי וידאו ברזולוציית 720p, בקצב של 24 פריימים לשנייה ובאורך של חמש שניות, בתוך פחות מתשע דקות על GPU צרכני יחיד כגון 4090, וממליצה על לפחות 24 GB של VRAM. בתיעוד של ComfyUI מצוין שאותו מודל 5B "אמור לפעול היטב עם 8GB vram באמצעות native offloading של ComfyUI".
שתי הקביעות נכונות, משום שהן מודדות דברים שונים. 8 GB הוא המקום שבו המודל נכנס. 24 GB הוא המקום שבו הוא פועל ללא מגבלות משמעותיות. Offloading פועל על ידי שמירת רוב המודל ב-RAM של המערכת והזרמת שכבות ל-GPU בכל שלב. לכן הכרטיס מבלה את זמנו בהמתנה לאפיק PCIe במקום בביצוע חישובים. את המחיר הזה משלמים בכל צעד של ה-sampler, ולא פעם אחת בלבד.
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]רק השורה האחרונה היא נתון של היצרן. הכרטיס בנפח 24 GB מפיק קטע בתוך 9 דקות, וזהו הנתון ש-Alibaba פרסמה עבור המודל הזה. שאר השורות מתארות את ההשפעה של offloading, והן מציגות סדר גודל ולא תוצאות benchmark. זהו העיקר: 40 דקות בכרטיס בנפח 8 GB הן תצורה שפועלת מבחינה טכנית, אך בפועל מדובר במשימת אצווה שמשאירים לרוץ במשך הלילה.
המודלים הגדולים יותר של Wan 2.2 שייכים לקטגוריה אחרת. וריאציות A14B להמרת טקסט לווידאו ולהמרת תמונה לווידאו דורשות לפחות 80 GB של VRAM להס inference על GPU יחיד. זו חומרה של מרכזי נתונים, לא כרטיס שמתקינים במחשב שולחני. בשלב הזה, אירוח עצמי מתחיל למעשה בהשכרת מאיץ של ספק אחר לפי שעה.
עלות קטע וידאו ב-GPU מושכר
השכרה היא הדרך המתאימה לרוב האנשים לבדוק את המודל, משום שכרטיס שקונים אינו החומרה המתאימה אם המודל שתרצו בסופו של דבר דורש 80 GB. מחירי on-demand חציוניים בשוק השכרת ה-GPU, נכון ליולי 2026:
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]השורה של 4090 מריצה את מודל 5B ועולה כ-0.05 דולר לכל קטע, במחיר של 0.36 דולר לשעה. השורות של 80 GB מריצות את מודלי 14B, ולכן העלות לכל קטע עולה ל-0.6 דולר, אף שהחומרה עצמה מהירה בהרבה. ככל שהמודל גדול יותר, נדרש יותר חישוב לכל שנייה של וידאו.
חמישה סנטים לקטע נשמעים כמו סכום זניח, וזו הנקודה המטעה. חמש השניות הראשונות שתוכלו להשתמש בהן לעולם אינן תוצאה של רינדור יחיד. יצירת הנחיות למודל וידאו היא תהליך חיפוש, ועשרים עד ארבעים רינדורים לפני שמתקבלת תוצאה ראויה לשימוש הם דבר רגיל כאשר לשוט יש תנועה מסוימת. לכן סשן עבודה עולה דולרים ולא סנטים, ואחר צהריים של איטרציות על חומרה מושכרת עולה בערך כמו ארוחת צהריים.
שני פרטים הנוגעים להשכרה עלולים לעלות כסף רב אם מתעלמים מהם. החיוב נמשך בזמן שהמכונה מורידה את המשקלים, וקובצי Wan 2.2, יחד עם מקודד הטקסט וה-VAE שלהם, מגיעים לעשרות גיגה-בייט. לכן בחרו ספק עם אמצעי אחסון מתמיד והורידו את הקבצים פעם אחת. החיוב נמשך גם בזמן שהמכונה אינה פעילה אך סשן ה-SSH שלכם עדיין פתוח. עצרו את המופע במקום רק לסגור את המסוף.
התקנת ComfyUI במחשב עם GPU
התחילו מ־Ubuntu 24.04, כאשר מנהל ההתקן של NVIDIA כבר מותקן. בדקו תחילה את מנהל ההתקן, משום שללא בדיקה זו כל תקלה בהמשך נראית זהה.
nvidia-smiהפקודה חייבת להציג טבלה ובה הכרטיס שלכם וגרסת CUDA. אם היא מציגה NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, מודול הליבה אינו נטען. מצב זה נגרם בדרך כלל משדרוג ליבה ללא אתחול מחדש. תקנו זאת כעת. אחרת ComfyUI יעבור לנתיב העיבוד של ה־CPU, ותבזבזו שעה בניסיון לאתר את הבעיה במודל.
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txtודאו ש־PyTorch מזהה את הכרטיס לפני שתורידו קובץ משקולות יחיד.
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"True יחד עם שם הכרטיס שלכם מצביעים על מחסנית תקינה. False מציין שה־wheel המותקן הוא גרסה המיועדת ל־CPU בלבד. מצב זה מתרחש כאשר pip מוצא גרסה שמורה במטמון של torch מהתקנה קודמת. התקינו מחדש באמצעות כתובת האינדקס שלמעלה.
הורדת קובצי המודל Wan 2.2
ComfyUI אינו מגיע עם משקלים, ומודל וידאו אינו קובץ יחיד. הוא כולל מודל דיפוזיה, מקודד טקסט ו-VAE, וכל אחד מהם צריך להימצא בספרייה ייעודית. אם מציבים קובץ בתיקייה שגויה, צומת הטעינה פשוט לא יציג אותו, בלי שגיאה שתסביר את הסיבה.
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensorsהמודל בנפח 5B תומך גם בהמרת טקסט לווידאו וגם בהמרת תמונה לווידאו, ולכן הוא נקודת פתיחה הגיונית. העדיפו תמיד את .safetensors על פני .ckpt. קובץ .ckpt הוא אובייקט Python שעבר pickling, ולכן טעינתו מפעילה קוד שנכתב על ידי מי שבנה אותו. הקצו מקום רב בדיסק: התקנה פעילה עם משפחת מודלים אחת ועם הפלטים שלה דורשת 100 GB, וקובצי וידאו גדולים בהרבה מתמונות PNG שנוצרות בתהליך עבודה של תמונות. גבו את קובצי ה-JSON של תהליכי העבודה באמצעות פתרון כגון גיבויים מצטברים מוצפנים לאחסון אובייקטים, משום שניתן להוריד את המשקלים מחדש, אך לא ניתן לשחזר את תהליכי העבודה שהותאמו.
הפעילו את המערכת והתחברו אליה באופן מאובטח
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188ל-ComfyUI אין מסך התחברות ואין חשבונות משתמשים. כל גורם שיכול להגיע אל הפורט 8188 יכול להכניס משימות לתור, לקרוא כל סרטון שיצרתם ולהתקין צמתים מותאמים אישית. משמעות הדבר היא שניתן להריץ קוד שרירותי בשרת שלכם. קשרו את השירות ל-localhost והתחברו אליו באמצעות מנהרת SSH מהמחשב שלכם.
ssh -N -L 8188:127.0.0.1:8188 you@your-serverלאחר מכן פתחו את http://127.0.0.1:8188 בדפדפן. טענו את תהליך העבודה של התבנית Wan 2.2 מתפריט התבניות של ComfyUI, במקום לחבר את הצמתים באופן ידני. התבניות הרשמיות כוללות את הגדרות הדוגם שהמודל כוונן עבורן. בתהליך עבודה ליצירת וידאו יש מקומות רבים יותר שבהם ערך עלול להיות שגוי בלי שתבחינו בכך, בהשוואה לתהליך עבודה ליצירת תמונה.
כאשר התשובה הכנה היא להשתמש ב-API
אירוח עצמי של יצירת וידאו הוא הבחירה הנכונה כאשר הנפח גבוה ויציב, כאשר אסור שהפריימים יעזבו את התשתית שלכם, או כאשר אתם זקוקים למודל מסוים או למתאם מותאם אישית שאף שירות מתארח אינו מציע. זו גם הבחירה הנכונה כאשר הצינור חייב לפעול באותה צורה גם בעוד שנה, משום שמודל מתארח עשוי להשתנות ללא התראה ולא לספק גרסה שניתן לנעול.
השתמשו ב-API מתארח כאשר אתם זקוקים למספר קטן של קטעים בחודש, כאשר אתם זקוקים לפלט ארוך או גדול יותר מזה שהמודלים הפתוחים מפיקים, או כאשר יש לכם תאריך יעד השבוע. חשבו את נקודת האיזון באופן מציאותי. כרטיס בנפח 24 GB המושכר מסביב לשעון במחיר החציוני של יולי 2026 עולה בערך 260 דולר בחודש, ורכישת אותו כרטיס עולה יותר מכך מראש, עוד לפני שיצרתם פריים אחד. שרת באירוח עצמי שנמצא במצב סרק מפסיד בכל פעם לתמחור של API לפי קטע. זהו אותו שיקול שקובע כיצד להגיש מודלי טקסט, כפי שמוסבר ב-Ollama לעומת vLLM להגשת LLM באירוח עצמי, והוא נשען על השאלה הבסיסית יותר שב-האם VPS עם GPU בכלל מצדיק את העלות.
מה לבדוק כאשר הרינדור נכשל
רינדור שנכשל ממש בסופו, לאחר שסרגל הדגימה הושלם, אזל מהזיכרון במהלך פענוח ה-VAE. הפחיתו את מספר הפריימים או עברו לצומת פענוח באריחים. שינוי מספר הצעדים לא יעזור, מכיוון שהפענוח מתבצע פעם אחת, לאחר שכל הצעדים כבר הושלמו.
פלט שחור לחלוטין או משובש מאוד מצביע בדרך כלל על כך שה-VAE אינו תואם למודל. טעינת VAE של Wan 2.1 מול מודל דיפוזיה של Wan 2.2 מפיקה בדיוק תוצאה כזו, ולא תופיע שום שגיאה ביומן.
רינדור שפועל אך נמשך שעות במחשב שאתם יודעים שיש בו GPU מצביע על כך ש-ComfyUI פועל במסלול המעבד. בדקו ביומן האתחול את השורה המציינת את ההתקן, ולאחר מכן הריצו שוב את הבדיקה torch.cuda.is_available() שלעיל.
היעלמות התהליך כאשר Killed מופיע ב-dmesg, ללא מעקב חריגות של Python, נגרמת על-ידי מחסל התהליכים של הליבה עקב מחסור בזיכרון. במקרה זה מדובר ב-RAM של המערכת, ולא ב-VRAM. העברת העיבוד לזיכרון המערכת דורשת שהמודל כולו יהיה תושב ב-RAM, ולכן מחשב עם 16 GB שמבצע העברה של מודל 5B אינו מספיק. הוסיפו RAM או הוסיפו swap.
FAQ
האם ניתן ליצור וידאו באמצעות AI בשרת VPS ללא GPU?
לא, לא באופן שיהיה מעשי להשתמש בו יותר מפעם אחת. קליפ באורך 5 שניות וברזולוציית 720p, שעיבודו נמשך 9 דקות על GPU בנפח 24 GB, ידרוש שעות רבות על CPU. הסיבה היא שלמודל אין חומרה ייעודית לחישובי מטריצות, ורוחב הפס של זיכרון המערכת נמוך בסדר גודל מרוחב הפס של זיכרון ה-GPU. שרת CPU יכול לארח את הממשק של ComfyUI, לאחסן את המודלים ולשמור את תהליכי העבודה, אך פעולת הרינדור עצמה דורשת GPU.
כמה VRAM נדרש עבור Wan 2.2?
עבור המודל TI2V-5B, נפח של 8 GB הוא המינימום בעת שימוש ב-native offloading של ComfyUI, ואילו 24 GB הוא הנפח ש-Alibaba ממליצה עליו כדי להשיג את המהירות שפורסמה. עבור מודלי הטקסט-לווידאו והתמונה-לווידאו A14B, בכרטיס המודל מצוין שנדרשים לפחות 80 GB של VRAM להס inference על GPU יחיד. לכן מודלים אלה דורשים כרטיסי data center.
מה יכול להיות אורכו של קליפ באירוח עצמי?
כ-5 שניות ברזולוציית 720p הן יחידת העבודה המעשית נכון ליולי 2026. פלט ארוך יותר מופק באמצעות יצירת מקטעים וחיבורם, תוך שימוש בפריים האחרון של מקטע אחד כפריים הראשון של המקטע הבא. האיכות משתנה במעברים בין המקטעים. לכן יש להתייחס לסרטון ארוך כאל עבודת עריכה ולא כאל יצירה אחת.
האם השכרת GPU לפי שעה זולה יותר מרכישת כרטיס?
השכרה משתלמת עבור כל שימוש שכולל פחות מכמה שעות רינדור ביום. במחיר חציוני של כ-0.36 דולר לשעה עבור כרטיס בנפח 24 GB, נכון ליולי 2026, ניתן לשכור GPU במשך זמן רב לפני שהעלות תשתווה למחיר הרכישה של הכרטיס. בנוסף, כך נמנעת רכישת חומרה שעלולה להתברר כלא מתאימה לסוג המודל שבו תרצו להשתמש. רכישה משתלמת רק כאשר השרת נמצא בשימוש במשך רוב שעות היום, בכל יום.