האם אפשר לארח את Claude לבד? התשובה הכנה
אי-אפשר להפעיל את Claude בשרת פרטי: Anthropic אינה מפרסמת את משקלי המודל. גלו מה כן ניתן לארח, כולל מודלים פתוחים, שער API ו-Claude Code.
האם ניתן לארח את Claude באופן עצמאי? לא, וזו הסיבה
אי-אפשר לארח את Claude באופן עצמאי. Anthropic אינה מפרסמת את משקלי המודל, ולכן אין קובץ להורדה, אין container להפעלה ואין רישיון שיאפשר להפעיל אותו מהחומרה שלכם. כל בקשה ל-Claude נשלחת אל ה-API של Anthropic או אל שירות של שותף מתארח, כגון Amazon Bedrock, Google Vertex AI או Microsoft Foundry. הפעלה שלו במחשב שבבעלותכם אינה בעיית תצורה. הארטיפקט עצמו אינו קיים מחוץ ל-Anthropic.
זו התשובה הקצרה. התשובה המפורטת יותר היא שרוב האנשים ששואלים את השאלה אינם זקוקים בפועל למשקלי המודל. הם רוצים אחד משלושה דברים, וכולם ניתנים להשגה בשרת שבשליטתכם: מודל בעל יכולות שמופעל באופן מקומי, שער שמאחסן את מפתחות ה-API שלהם ומגביל את ההוצאות, או סוכן תכנות שפועל במחשב שלהם במקום במחשב הנייד. המדריך הזה מכסה את שלוש האפשרויות, כולל הפקודות.
מה בדרך כלל פירושו של "self-hosted Claude"
התנועה בחיפוש אחר "self hosted Claude" משקפת כמה צרכים שונים, ולכל אחד מהם נדרש מענה אחר.
יש אנשים שרוצים פרטיות. הם אינם רוצים שההנחיות שהם שולחים יעזבו את הרשת שלהם. רק מודל מקומי בעל משקולות פתוחות פותר זאת, משום שכל בקשה אל Claude היא בהגדרה בקשה אל Anthropic.
יש אנשים שרוצים לשלוט בעלויות. הם חוששים מסוכן אוטונומי שיצרוך את הקרדיטים במהירות. שער גישה פותר זאת, והוא פועל עם Claude, כך שאיכות המודל נשמרת.
יש אנשים שרוצים לעבוד בלי תלות במחשב נייד. הם רוצים סוכן שימשיך לפעול גם כאשר הם סוגרים את המכסה. VPS פותר זאת, ו-Claude Code פועל עליו ללא בעיה.
יש אנשים שמחפשים את הביטוי "self hosted OpenRouter". גם זה שער גישה, ובדרך כלל הפתרון הוא LiteLLM.
הגדירו לאיזו קטגוריה אתם משתייכים, משום שהפתרון המתאים שונה בכל מקרה.
אירוח עצמאי של מודל פתוח באמצעות Ollama
אם הדרישה היא שאף הנחיה לא תעזוב את השרת, הפעילו מודל בעל משקולות פתוחות. משפחות המודלים שבאמת שימושיות כיום בשרת שכור הן Llama, Qwen, Mistral, Gemma ו-DeepSeek. כולן מפרסמות משקולות שאפשר להוריד ולהפעיל.
Ollama היא הדרך המהירה ביותר להתחיל. סקריפט ההתקנה מורכב משורה אחת, והוא מגדיר שירות systemd ב-Ubuntu.
curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollamasystemctl status ollama אמור להדפיס active (running). לאחר מכן משכו מודל ושוחחו איתו.
ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."ההרצה הראשונה של pull מורידה כמה גיגה-בייטים, לכן המודל חייב להתאים לזיכרון ה-RAM או לזיכרון ה-GPU לפני שיוכל להשיב. כלל אצבע גס למודלים שעברו קוונטיזציה: מודל בעל 8 מיליארד פרמטרים זקוק לכ-6 GB פנויים, מודל בעל 14 מיליארד פרמטרים זקוק לכ-10 GB, ומודל בעל 70 מיליארד פרמטרים זקוק ליותר זיכרון ממה שמספקות רוב תוכניות ה-VPS לשימוש כללי. אם חסר זיכרון בשרת, התהליך מופסק על ידי הליבה ותראו Error: llama runner process has terminated, יחד עם שורת out of memory בתוך dmesg. בדקו את free -h לפני שאתם מאשימים את המודל.
Ollama מספקת גם API של HTTP ב-127.0.0.1:11434. לכן היא שימושית לתוכנות אחרות ולא רק כיישום צ'אט.
curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'השאירו את הפורט קשור ל-localhost. פורט פתוח של Ollama בכתובת IP ציבורית מאפשר לכל מי שמאתר אותו להשתמש ב-GPU שלכם ללא עלות. הבנייה המלאה, כולל יחידת systemd, זיהוי GPU והצבת reverse proxy מלפנים, מתוארת ב-מדריך להפעלת Ollama ב-VPS. אם אתם מספקים שירות ליותר ממשתמש אחד בו-זמנית, קראו תחילה את ההשוואה בין Ollama ל-vLLM, מכיוון שתכנון הזרם היחיד של Ollama הופך לצוואר בקבוק זמן רב לפני שהחומרה עושה זאת.
היו כנים בנוגע לפער. מודל פתוח טוב ב-VPS בינוני שימושי באמת לסיכום, לסיווג, לניסוח טיוטות ולחילוץ פשוט. בהסקה ארוכה ורבת-שלבים, בעבודה על בסיסי קוד גדולים ובשימוש בכלים על ידי סוכנים, הוא אינו מתקרב למודל hosted מתקדם, ושום כוונון של הנחיות לא יסגור את הפער. בחרו במודל המקומי עבור המשימות שבהן הוא טוב, ושלמו עבור המודל hosted כאשר המשימה אכן מורכבת.
הפעלת שער משלכם באמצעות LiteLLM
זהו ה־"OpenRouter באירוח עצמי" שמשתמשים מחפשים. שער יושב בין היישומים שלכם לבין כל ספקי המודלים. היישומים שלכם מחזיקים מפתח אחד, שמצביע לשרת שלכם. המפתחות האמיתיים של הספקים נשמרים רק בשרת הזה. ניתן להגביל את ההוצאה לכל מפתח, לנתב יישומים שונים למודלים שונים ולתעד כל בקשה במקום אחד.
LiteLLM הוא הבחירה המקובלת, מכיוון שהוא מספק API תואם ל־OpenAI ומשמש כ־proxy מול Anthropic, Ollama ורוב הספקים האחרים דרך אותו endpoint. הפעילו אותו ב־Docker באמצעות קובץ תצורה.
model_list:
- model_name: claude
litellm_params:
model: anthropic/claude-sonnet-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: local
litellm_params:
model: ollama/qwen3:8b
api_base: http://127.0.0.1:11434שמרו את התוכן בשם litellm_config.yaml והפעילו את ה־proxy. הוא מאזין בפורט 4000.
docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
-e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
-e LITELLM_MASTER_KEY=sk-1234 \
-p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
--config /app/config.yamlLITELLM_MASTER_KEY הוא פרטי ההתחברות של מנהל המערכת, לכן יש להתייחס אליו כמו לסיסמת root ולא להשתמש בערך שבדוגמה בסביבת ייצור. קראו ל־proxy בדיוק כפי שהייתם קוראים ל־API שמתארח אצל ספק.
curl http://localhost:4000/v1/chat/completions \
-H 'Authorization: Bearer sk-1234' \
-H 'Content-Type: application/json' \
-d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'תגובה תקינה היא JSON רגיל ובו מערך choices. שגיאת 401 פירושה שהכותרת Authorization אינה תואמת למפתח הראשי שלכם. שגיאת 400 שמציינת את שם המודל פירושה שה־model בבקשה שלכם אינו תואם לאף model_name בקובץ התצורה.
הסיבה לבנות את המערכת הזו במקום לקרוא ישירות ל־Anthropic היא הגבלת ההוצאה. הנפיקו מפתח וירטואלי נפרד לכל יישום, עם תקציב משלו.
curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'למפתח הזה יכולה להיות הרשאה להוציא מאה דולר ולגשת למודל אחד בלבד. אין לו הרשאות נוספות. כאשר סוכן מתנהג באופן בלתי צפוי בשלוש לפנות בוקר, היקף הנזק מוגבל למפתח אחד ולא לכל החשבון. הדפוס הזה, יחד עם הניטור הנדרש סביבו, הוא נושא המאמר שמירה על עלויות סוכנים בשליטה ב־VPS. אם אתם עדיין מחליטים אם לשלם בכלל לפי מספר האסימונים, השוואת עלויות בין API למינוי מסבירה את החישוב.
שימו לב למה שהשער אינו עושה. הוא אינו הופך את Claude למקומי, והוא אינו מסתיר את ההנחיות שלכם מ־Anthropic. הבקשות עדיין יוצאות מהשרת שלכם אל הספק. מה שאתם מקבלים הוא שליטה במפתחות, בהוצאה, בניתוב ובלוגים.
הפעלת Claude Code ב-VPS משלכם
את המשאלה השלישית קל ביותר להגשים. Claude Code הוא לקוח. הוא פועל בכל מקום שבו מותקן Node.js, ומתקשר עם ה-API באמצעות HTTPS. התקנתו בשרת שבבעלותכם מאפשרת לסוכן להמשיך לפעול לאחר כיבוי המחשב הנייד, ומגבילה את טווח הנזק של הסוכן למערכת שאפשר לבנות מחדש, במקום למחשב הראשי שלכם.
npm install -g @anthropic-ai/claude-code
claude --versionהפעילו אותו בתוך tmux, כדי שניתוק של חיבור SSH לא יפסיק משימה ממושכת. ההגדרה הזו, כולל ניהול ההפעלה, מתוארת בהפעלת Claude Code ב-VPS באמצעות tmux. הקצו לסוכן משתמש ייעודי ללא הרשאות מוגברות, וקראו את כללי הבטיחות להפעלת Claude Code בשרת לפני שתעניקו לו הרשאת כתיבה לכל דבר שחשוב לכם.
מדובר באירוח עצמי של הסוכן, לא של המודל. חשוב לדייק בכך, משום שאלה שני דברים שנוטים לבלבל ביניהם. אתם שולטים בתהליך, במערכת הקבצים, ביציאה מהרשת וברישומי היומן. Anthropic עדיין מחזיקה בבעלות על הסקת המודל.
מה כל אפשרות עולה לכם בפועל
המחירים משתנים, לכן יש לראות בנתונים האלה תמונת מצב כללית ולא הצעת מחיר. נכון ל-July 2026, Claude Sonnet 5 מתומחר ב-$3 למיליון אסימוני קלט וב-$15 למיליון אסימוני פלט, ואילו Claude Opus 5 מתומחר ב-$5 וב-$25. מודל מקומי אינו עולה דבר לכל אסימון. במקום זאת, הוא עולה את מחיר השרת לחודש, גם כאשר אינכם משתמשים בו.
נקודת האיזון נמוכה מכפי שרבים מצפים. VPS עם די זיכרון להפעלת מודל פתוח שימושי עולה כסף מדי חודש, ורוב הזמן אינו פעיל. אם השימוש שלכם מתפרץ ואינו רציף, ה-API המתארח בדרך כלל זול יותר. אם השימוש שלכם רציף, או אם הנתונים אינם יכולים לצאת מהרשת שלכם, המודל המקומי עדיף בשני ההיבטים.
התשובה המשולבת והכנה היא זו שרוב הצוותים בוחרים בה. הפעילו מודל פתוח מקומית עבור משימות בנפח גבוה ובקושי נמוך. נתחו את הבקשות המורכבות למודל frontier מתארח. הציבו gateway לפני שניהם, כדי שהיישומים לא יצטרכו לדעת באיזה מהם נעשה שימוש, וכדי שתוכלו לשנות את החלוקה ביניהם בלי לגעת בקוד היישום. ארכיטקטורה זו היא הגרסה המעשית של "Claude באירוח עצמי", ובניגוד לגרסה המילולית, היא קיימת. אם ברצונכם להפעיל בעצמכם גם את כל מחסנית הסוכנים, הסקירה של סוכני AI באירוח עצמי מציגה את האפשרויות הזמינות.
FAQ
האם ניתן להוריד את משקלי המודל של Claude ולהפעיל אותם באופן מקומי?
לא. Anthropic מעולם לא פרסמה משקלים עבור אף מודל של Claude, ואין רישיון שמתיר אירוח עצמי. כל דבר שמפורסם באינטרנט כ״מודל Claude״ הניתן להורדה הוא או מודל אחר בשם מטעה, או מעטפת שקוראת ל-API. אם הוא דורש מפתח API, הוא אינו מקומי.
מהו המודל הפתוח הקרוב ביותר ל-Claude?
אין התאמה מדויקת, והמודלים המובילים משתנים מדי כמה חודשים. משפחות המודלים הפתוחים שכדאי לבדוק הן Llama, Qwen, Mistral, Gemma ו-DeepSeek. לסיכום, לסיווג ולעריכות קוד פשוטות, מודל פתוח טוב עם 8 עד 14 מיליארד פרמטרים יכול להיות שימושי מאוד. בהסקה ארוכה ורב-שלבית ובשימוש בכלים של סוכנים, הפער מול מודל חזית מתארח עדיין גדול. בדקו את המודל באמצעות ההנחיות שלכם, במקום להסתמך על טבלת דירוג.
האם LiteLLM הוא OpenRouter באירוח עצמי?
מבחינה תפקודית, כן, בכל הקשור לניתוב ולניהול מפתחות. LiteLLM פועל בשרת שלכם, מספק נקודת קצה אחת תואמת OpenAI ומעביר בקשות אל Anthropic, Ollama ואל רוב הספקים האחרים. תקבלו מגבלות הוצאה לכל מפתח, ניתוב מודלים ומקום מרכזי אחד לקריאת יומנים. עם זאת, הוא אינו מספק הסקה מקומית: בקשות אל Claude עדיין עוברות אל Anthropic.
האם הפעלת Claude Code בשרת שלי שומרת על פרטיות הקוד שלי?
לא. Claude Code שולח אל ה-API של Anthropic את תוכן הקבצים שהוא קורא, ללא קשר למקום שבו התהליך פועל. VPS מספק בידוד של הסוכן, אך לא פרטיות של התוכן. הקצו לו משתמש ייעודי ללא הרשאות מוגברות, הרחיקו אותו מפרטי גישה וממאגרי קוד שאינם קשורים, והתייחסו לכל דבר שהוא יכול לקרוא כאל תוכן שיוצא מהשרת.