האם ניתן לארח את Claude באופן עצמאי? התשובה המלאה
לא ניתן להריץ את Claude על שרת פרטי כי משקולות המודל אינן זמינות לציבור. במדריך זה נציג חלופות קוד פתוח, הגדרת API Gateway ושימוש ב-Claude Code על השרת שלכם.
האם ניתן לארח את Claude באופן עצמאי? לא, ולהלן הסיבות
לא ניתן לארח את Claude באופן עצמאי. חברת Anthropic אינה מפרסמת את משקולות המודל (model weights), לכן אין קובץ להורדה, אין מכולה (container) להרצה, ואין רישיון שיאפשר לכם להגיש אותו מהחומרה שלכם. כל בקשה ל-Claude מופנית ל-API של Anthropic או לשותף מארח כגון Amazon Bedrock, Google Vertex AI או Microsoft Foundry. הרצת המודל על מכונה שבבעלותכם אינה בעיית תצורה; הארטיפקט פשוט אינו קיים מחוץ ל-Anthropic.
זו התשובה הקצרה. התשובה המפורטת היא שרוב האנשים השואלים שאלה זו אינם זקוקים למשקולות המודל בפועל. הם מחפשים אחד משלושה דברים שניתן להשיג על שרת שבשליטתכם: מודל בעל יכולות שרץ מקומית, שער (gateway) המאחסן את מפתחות ה-API שלכם ומגביל את ההוצאות, או סוכן קידוד (coding agent) שחי על השרת שלכם במקום על המחשב הנייד. מדריך זה מכסה את כל השלושה, כולל הפקודות הנדרשות.
מה המשמעות של "Claude בהתקנה עצמית" (self-hosted)
חיפושים אחר "self hosted Claude" מתחלקים לכמה כוונות שונות, וכל אחת מהן דורשת מענה שונה.
יש המבקשים פרטיות. הם אינם רוצים שהנחיות (prompts) יצאו מהרשת שלהם. רק מודל מקומי בעל משקולות פתוחות (open weight) פותר זאת, שכן כל בקשה ל-Claude היא מעצם הגדרתה בקשה ל-Anthropic.
יש המבקשים שליטה בעלויות. הם חוששים מסוכן (agent) שיוצא משליטה ומכלה את יתרת הקרדיטים שלהם. שער (gateway) פותר זאת, והוא עובד עם Claude, כך שניתן לשמור על איכות המודל.
יש המבקשים עצמאות מהמחשב הנייד. הם רוצים סוכן שימשיך לעבוד גם כשהם סוגרים את המכסה. שרת VPS פותר זאת, ו-Claude Code פועל עליו ללא בעיות.
יש המבקשים את המושג "self hosted OpenRouter". גם זהו שער, והפתרון המקובל עבורו הוא LiteLLM.
הגדירו מהו הצורך שלכם, שכן המבנה הנכון משתנה בהתאם לכל מקרה.
אירוח עצמי של מודל פתוח באמצעות Ollama
אם הדרישה היא שאף prompt לא יעזוב את השרת שלכם, הריצו מודל בעל משקולות פתוחות. המשפחות שניתן להשתמש בהן בפועל בשרת שכור כיום הן Llama, Qwen, Mistral, Gemma ו-DeepSeek. כולן מפרסמות משקולות שניתן להוריד ולהריץ.
Ollama היא הדרך המהירה ביותר להתחיל. סקריפט ההתקנה מורכב משורה אחת, והוא מגדיר שירות systemd ב-Ubuntu.
curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollamasystemctl status ollama אמור להדפיס active (running). לאחר מכן, משכו מודל והתחילו לתקשר איתו.
ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."הפקודה pull הראשונה מורידה כמה גיגה-בייטים, לכן המודל חייב להיכנס לזיכרון ה-RAM או לזיכרון ה-GPU לפני שיוכל להשיב. כלל אצבע למודלים שעברו קוונטיזציה (quantised): מודל של 8 מיליארד פרמטרים דורש כ-6 GB פנויים, מודל של 14 מיליארד פרמטרים דורש כ-10 GB, ומודל של 70 מיליארד פרמטרים דורש יותר זיכרון ממה שיש ברוב תוכניות ה-VPS הכלליות. אם לשרת חסר זיכרון, התהליך יסתיים על ידי ה-kernel ותראו Error: llama runner process has terminated, עם שורת out of memory ב-dmesg. בדקו את free -h לפני שמאשימים את המודל. תקציב הזיכרון הזה קובע גם כמה מתוך prompt ארוך המודל באמת קורא, כיוון ש-Ollama קוטמת בשקט כל מה שמעבר לחלון ברירת מחדל צנוע; לכן הגדלת num_ctx והתאמת גודל ה-KV cache היא הדבר הראשון שיש לבדוק כאשר מסמכים ארוכים חוזרים מסוכמים רק בחלקם.
Ollama מפעילה גם HTTP API ב-127.0.0.1:11434, וזה מה שהופך אותה לשימושית עבור תוכנות אחרות ולא רק ככלי צ'אט.
curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'אם הבקשה הראשונה לאחר תקופת שקט לוקחת שלושים שניות בעוד שהבאה אחריה חוזרת מיידית, שום דבר לא מקולקל: Ollama פורקת את המודל מהזיכרון לאחר חמש דקות של המתנה, ו-השארתו בזיכרון באמצעות keep_alive מבטלת את העיכוב הזה בטעינה מחדש.
השאירו את הפורט הזה חסום ל-localhost בלבד. פורט Ollama פתוח בכתובת IP ציבורית הוא GPU בחינם לכל מי שימצא אותו. הבנייה המלאה, כולל יחידת ה-systemd, זיהוי ה-GPU והצבת reverse proxy בחזית, מכוסה ב-מדריך להרצת Ollama על VPS. אם אתם משרתים יותר ממשתמש אחד בו-זמנית, קראו תחילה את ההשוואה בין Ollama ל-vLLM, כיוון שהתכנון של Ollama המבוסס על זרם יחיד הופך לצוואר הבקבוק הרבה לפני שהחומרה הופכת לכזה.
היו כנים לגבי הפער. מודל פתוח טוב על VPS בינוני הוא שימושי באמת לסיכום, סיווג, ניסוח וחילוץ נתונים פשוט. במשימות הסקה (reasoning) מרובות שלבים, בבסיסי קוד גדולים ובשימוש בכלים סוכניים (agentic tool use), הוא אינו מתקרב למודל מאוחסן מהשורה הראשונה, ושום כמות של כוונון prompt לא תסגור את הפער הזה. בחרו במודל מקומי עבור העבודה שהוא טוב בה, ושלמו עבור מודל מאוחסן במקום שבו הקושי הוא אמיתי.
הפעלת Gateway עצמאי עם LiteLLM
זהו ה-"OpenRouter בניהול עצמי" שאנשים מחפשים. ה-Gateway יושב בין היישומים שלכם לבין כל ספק מודלים. היישומים שלכם מחזיקים מפתח אחד, המופנה לשרת שלכם. מפתחות הספק האמיתיים נמצאים רק על אותו שרת. באפשרותכם להגביל הוצאות לכל מפתח, לנתב יישומים שונים למודלים שונים, ולתעד כל בקשה במקום אחד.
LiteLLM הוא הבחירה הנפוצה מכיוון שהוא תומך ב-API תואם OpenAI ומבצע Proxy ל-Anthropic, ל-Ollama ולרוב הספקים האחרים מאחורי אותו Endpoint. הריצו אותו ב-Docker עם קובץ תצורה.
model_list:
- model_name: claude
litellm_params:
model: anthropic/claude-sonnet-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: local
litellm_params:
model: ollama/qwen3:8b
api_base: http://127.0.0.1:11434שמרו זאת כ-litellm_config.yaml והפעילו את ה-proxy. הוא מאזין בפורט 4000.
docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
-e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
-e LITELLM_MASTER_KEY=sk-1234 \
-p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
--config /app/config.yamlLITELLM_MASTER_KEY הוא פרט הגישה לניהול, לכן התייחסו אליו כאל סיסמת root ואל תפיצו את ערך הדוגמה. קראו ל-proxy בדיוק כפי שהייתם קוראים ל-API מאוחסן.
curl http://localhost:4000/v1/chat/completions \
-H 'Authorization: Bearer sk-1234' \
-H 'Content-Type: application/json' \
-d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'תגובה תקינה היא JSON רגיל עם מערך choices. שגיאת 401 מציינת שה-Header מסוג Authorization אינו תואם למפתח הראשי שלכם. שגיאת 400 המציינת את שם המודל פירושה שה-model בבקשה שלכם אינו תואם לאף model_name בקובץ התצורה.
הסיבה לבנות זאת במקום לקרוא ל-Anthropic ישירות היא הגבלת ההוצאות. הנפיקו מפתח וירטואלי נפרד לכל יישום, כאשר לכל אחד תקציב משלו.
curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'מפתח כזה יכול להוציא מאה דולרים ולגשת למודל אחד בלבד, ולא לשום דבר אחר. כאשר סוכן (agent) מתנהג בצורה לא תקינה בשלוש לפנות בוקר, טווח הנזק מוגבל למפתח אחד במקום לכל החשבון שלכם. דפוס זה, בתוספת הניטור סביבו, הוא הנושא של שמירה על עלויות סוכנים תחת שליטה ב-VPS. אם אתם עדיין מתלבטים אם לשלם לפי טוקן בכלל, השוואת עלויות בין API למנוי מפרטת את החישובים.
שימו לב למה שה-gateway אינו עושה. הוא אינו הופך את Claude למקומי, והוא אינו מסתיר את ה-prompts שלכם מ-Anthropic. הבקשות עדיין עוזבות את השרת שלכם לכיוון הספק. מה שאתם משיגים הוא שליטה על מפתחות, הוצאות, ניתוב ולוגים.
הרצת Claude Code על שרת VPS פרטי
המשאלה השלישית היא הקלה ביותר לביצוע. Claude Code הוא לקוח (client). הוא פועל בכל מקום שבו מותקן Node.js, והוא מתקשר עם ה-API באמצעות HTTPS. הרצתו על שרת בבעלותכם מבטיחה שהסוכן ימשיך לעבוד גם לאחר שתכבו את המחשב הנייד, ומבטיחה שרדיוס הפעולה של הסוכן מוגבל לסביבה שניתן לשחזר, ולא למחשב האישי שלכם.
npm install -g @anthropic-ai/claude-code
claude --versionהריצו אותו בתוך tmux כדי שניתוק של חיבור SSH לא יפסיק משימה ארוכה. הגדרה זו, כולל ניהול הסשן, מפורטת ב-הרצת Claude Code על VPS עם tmux. הקצו לסוכן משתמש ללא הרשאות מיוחדות (unprivileged user), וקראו את כללי הבטיחות להרצת Claude Code על שרת לפני שתעניקו לו הרשאות כתיבה לכל דבר שחשוב לכם.
זהו אירוח עצמי (self-hosting) של הסוכן, לא של המודל. חשוב לדייק בכך, כיוון שזהו החלק שאנשים נוטים לבלבל. אתם מחזיקים בתהליך, במערכת הקבצים, בתעבורה היוצאת ובלוגים. Anthropic עדיין מחזיקה בתהליך ההסקה (inference).
מה העלות האמיתית של כל אפשרות
המחירים משתנים, לכן יש להתייחס אליהם כאל הערכה כללית ולא כאל הצעת מחיר מחייבת. נכון ליולי 2026, Claude Sonnet 5 מתומחר ב-3 דולר למיליון טוקנים של קלט ו-15 דולר למיליון טוקנים של פלט, בעוד Claude Opus 5 מתומחר ב-5 דולר ו-25 דולר בהתאמה. מודל מקומי אינו כרוך בעלות לטוקן, אך עלותו היא כעלות השרת לחודש, והוא צורך משאבים בין אם נעשה בו שימוש ובין אם לא.
נקודת האיזון נמוכה מכפי שנהוג לחשוב. שרת VPS עם זיכרון מספיק להרצת מודל פתוח שימושי עולה כסף מדי חודש, והוא נותר ללא שימוש ברוב הזמן. אם השימוש שלכם מתאפיין בפרצי פעילות, ה-API המנוהל יהיה בדרך כלל זול יותר. אם השימוש שלכם קבוע, או אם הנתונים שלכם אינם יכולים לצאת מהרשת הארגונית, המודל המקומי עדיף בשני המובנים.
התשובה הכנה, שרוב הצוותים מאמצים, היא שילוב בין השניים. הריצו מודל פתוח באופן מקומי עבור עבודה בנפח גבוה וברמת קושי נמוכה. נתבו בקשות מורכבות למודל חזיתי מנוהל. הציבו gateway לפני שניהם כדי שהיישומים לא יצטרכו להבחין ביניהם, וכדי שתוכלו לשנות את הגבול ביניהם מבלי לגעת בקוד היישום. ארכיטקטורה זו היא הגרסה המעשית ל-"Claude בניהול עצמי", ובניגוד לגרסה המילולית, היא אכן קיימת. אם ברצונכם להריץ גם את כל מחסנית ה-agent בעצמכם, סקירת ה-AI agents בניהול עצמי מפרטת מה זמין כיום.
FAQ
האם ניתן להוריד את משקולות המודל של Claude ולהריץ אותן מקומית?
לא. Anthropic מעולם לא שחררה משקולות עבור אף מודל Claude, ואין רישיון שמתיר אירוח עצמי. כל מה שמפורסם ברשת כ"מודל Claude" להורדה הוא או מודל אחר עם שם מטעה, או מעטפת (wrapper) שקוראת ל-API. אם נדרש מפתח API, המודל אינו מקומי.
מהו המודל הפתוח הקרוב ביותר ל-Claude?
אין התאמה מדויקת, והמובילים בתחום מתחלפים מדי כמה חודשים. משפחות המודלים בעלי משקולות פתוחות שכדאי לבחון הן Llama, Qwen, Mistral, Gemma ו-DeepSeek. במשימות סיכום, סיווג ועריכת קוד פשוטה, מודל פתוח טוב עם 8 עד 14 מיליארד פרמטרים הוא שימושי באמת. במשימות של הסקה רב-שלבית מורכבת ושימוש בכלים סוכניים (agentic tool use), הפער מול מודל חזית (frontier model) מאוחסן עדיין גדול. בצעו בדיקות על ה-prompts שלכם במקום להסתמך על טבלאות דירוג.
האם LiteLLM הוא OpenRouter באירוח עצמי?
מבחינה תפקודית כן, בכל הנוגע לניתוב וניהול מפתחות. LiteLLM רץ על השרת שלכם, מציג נקודת קצה (endpoint) תואמת OpenAI, ומבצע proxy מול Anthropic, Ollama ורוב הספקים האחרים. אתם מקבלים מגבלות הוצאה לכל מפתח, ניתוב מודלים ונקודה אחת לריכוז לוגים. מה שהוא לא מספק זה הסקה (inference) מקומית: בקשות ל-Claude עדיין עוברות ל-Anthropic.
האם הרצת Claude Code על השרת שלי שומרת על פרטיות הקוד?
לא. Claude Code שולח את תוכן הקבצים שהוא קורא ל-API של Anthropic, ללא קשר למקום שבו התהליך רץ. מה ש-VPS מעניק לכם הוא בידוד של הסוכן, לא פרטיות של התוכן. הקצו לו משתמש ייעודי ללא הרשאות מיוחדות, הרחיקו אותו מפרטי הזדהות וממאגרים לא קשורים, והתייחסו לכל מה שהוא יכול לקרוא כאל תוכן שיוצא מהשרת.