SSD Nodes Learn Hosting plans →
Rehberler Matt ConnorYazan Matt Connor · Güncellendi 2026-08-27

Claude kendi sunucumda çalıştırılabilir mi?

Claude model ağırlıkları halka açık değildir ve yerel olarak çalıştırılamaz. Bunun yerine Llama 3 veya Mistral gibi açık kaynaklı modelleri kendi sunucunuzda nasıl kuracağınızı öğrenin.

Claude'u kendi sunucunuzda barındırabilir misiniz? Hayır, işte nedeni

Claude'u kendi sunucunuzda barındıramazsınız. Anthropic model ağırlıklarını yayınlamamaktadır; bu nedenle indirilebilecek bir dosya, çalıştırılabilecek bir container veya modeli kendi donanımınız üzerinden sunmanıza izin veren bir lisans bulunmamaktadır. Her Claude isteği, Anthropic'in API'sine veya Amazon Bedrock, Google Vertex AI ya da Microsoft Foundry gibi barındırılan bir iş ortağına gider. Modeli kendi sahip olduğunuz bir makinede çalıştırmak bir yapılandırma sorunu değildir. Söz konusu yapay zeka modeli, Anthropic dışında mevcut değildir.

Kısa cevap budur. Daha uzun cevap ise, bu soruyu soran çoğu kişinin aslında model ağırlıklarını istemediği yönündedir. Bu kişiler, kontrolünüz altındaki bir sunucuda elde edilebilecek üç şeyden birini istemektedir: yerel olarak çalışan yetenekli bir model, API anahtarlarınızı tutan ve harcamalarınızı sınırlayan bir ağ geçidi veya dizüstü bilgisayarları yerine kendi sunucularında yaşayan bir kodlama aracı. Bu kılavuz, komutlarıyla birlikte bu üç durumu da kapsamaktadır.

"Self-hosted Claude" ifadesi genellikle ne anlama gelir

"Self-hosted Claude" için yapılan arama trafiği, farklı beklentilere sahip birkaç gruba ayrılır ve her birinin farklı çözümlere ihtiyacı vardır.

Bazı kullanıcılar gizlilik ister. İstemlerin (prompt) ağ dışına çıkmasını istemezler. Bu durum yalnızca yerel bir açık ağırlıklı (open weight) model ile çözülebilir; çünkü herhangi bir Claude isteği, tanımı gereği Anthropic'e yapılan bir istektir.

Bazı kullanıcılar maliyet kontrolü ister. Kontrolden çıkmış bir ajanın kredilerini tüketmesinden endişe ederler. Bir ağ geçidi (gateway) bu sorunu çözer ve Claude ile uyumlu çalıştığı için model kalitesinden ödün vermezsiniz.

Bazı kullanıcılar dizüstü bilgisayardan bağımsızlık ister. Bilgisayarın kapağını kapattıklarında da çalışmaya devam eden bir ajan ararlar. Bir VPS bu sorunu çözer ve Claude Code üzerinde sorunsuz çalışır.

Bazı kullanıcılar ise "self-hosted OpenRouter" ifadesini ararlar. Bu da bir ağ geçididir ve genellikle önerilen çözüm LiteLLM'dir.

Hangi gruba dahil olduğunuzu belirleyin; çünkü her durum için kurulması gereken yapı farklıdır.

Ollama ile açık kaynaklı bir modeli self-host etmek

Eğer hiçbir istemin (prompt) sunucunuzdan dışarı çıkmaması gerekiyorsa, açık ağırlıklı (open weight) bir model çalıştırın. Günümüzde kiralanan bir sunucuda gerçekten kullanılabilir olan aileler Llama, Qwen, Mistral, Gemma ve DeepSeek'tir. Bunların tümü, indirip çalıştırabileceğiniz ağırlıklar yayınlar.

Ollama, bu işe başlamanın en hızlı yoludur. Kurulum betiği tek satırlıktır ve Ubuntu üzerinde bir systemd servisi oluşturur.

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama

systemctl status ollama komutu active (running) çıktısını vermelidir. Ardından bir model çekin ve onunla iletişime geçin.

ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."

İlk pull komutu birkaç gigabaytlık veri indirir; bu nedenle modelin herhangi bir yanıt verebilmesi için RAM veya GPU belleğine sığması gerekir. Kuantize edilmiş modeller için kaba bir kural şudur: 8 milyar parametreli bir model yaklaşık 6 GB boş alan gerektirir, 14 milyar parametreli bir model yaklaşık 10 GB gerektirir ve 70 milyar parametreli bir model ise çoğu genel amaçlı VPS planının sunduğundan daha fazla bellek gerektirir. Eğer sunucuda bellek yetersizse, süreç çekirdek tarafından sonlandırılır ve dmesg içinde "out of memory" satırıyla birlikte Error: llama runner process has terminated hatasını görürsünüz. Modeli suçlamadan önce free -h dosyasını kontrol edin. Aynı bellek bütçesi, modelin uzun bir istemin ne kadarını okuyacağını da belirler; çünkü Ollama, varsayılan pencereyi aşan kısımları sessizce kırpar. Bu yüzden uzun belgeler yarım özetlendiğinde ilk kontrol edilmesi gereken şey num_ctx değerini artırmak ve KV önbelleğini boyutlandırmaktır.

Ollama ayrıca 127.0.0.1:11434 üzerinde bir HTTP API sunar; bu da onu sadece bir sohbet aracı olmaktan çıkarıp diğer yazılımlar için kullanışlı hale getirir.

curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'

Sessiz bir dönemin ardından gelen ilk istek otuz saniye sürerken bir sonrakinin anında yanıtlanması bir hata değildir: Ollama, beş dakikalık boşta kalma süresinden sonra modeli bellekten boşaltır. keep_alive ile modeli bellekte tutmak, bu yeniden yükleme gecikmesini ortadan kaldırır.

Bu portu localhost'a bağlı bırakın. Genel bir IP adresi üzerinde açık bir Ollama portu, onu bulan herkes için ücretsiz bir GPU demektir. Systemd birimi, GPU algılama ve önüne bir reverse proxy koyma dahil olmak üzere tam kurulum, VPS üzerinde Ollama çalıştırma rehberinde ele alınmıştır. Aynı anda birden fazla kullanıcıya hizmet veriyorsanız, önce Ollama ve vLLM karşılaştırmasını okuyun; çünkü Ollama'nın tek akışlı tasarımı, donanım sınırlarına ulaşılmadan çok önce darboğaz haline gelir.

Aradaki fark konusunda dürüst olun. Orta ölçekli bir VPS üzerindeki iyi bir açık kaynaklı model; özetleme, sınıflandırma, taslak oluşturma ve basit veri çıkarma işlemleri için gerçekten kullanışlıdır. Uzun ve çok adımlı mantıksal yürütme, büyük kod tabanları ve aracı (agentic) araç kullanımı konularında ise öncü (frontier) barındırılan modellerin seviyesine yaklaşamaz ve hiçbir istem iyileştirmesi (prompt tuning) bu farkı kapatamaz. Yerel modeli iyi olduğu işler için seçin; zorluk seviyesinin yüksek olduğu işler için ise barındırılan modelleri kullanın.

LiteLLM ile kendi ağ geçidinizi çalıştırın

Bu, insanların aradığı "kendi kendine barındırılan OpenRouter" çözümüdür. Bir ağ geçidi (gateway), uygulamalarınız ile tüm model sağlayıcıları arasında konumlanır. Uygulamalarınız, sunucunuza yönlendirilmiş tek bir anahtar tutar. Gerçek sağlayıcı anahtarları ise yalnızca o sunucuda barındırılır. Anahtar başına harcama limiti koyabilir, farklı uygulamaları farklı modellere yönlendirebilir ve her isteği tek bir merkezden kayıt altına alabilirsiniz.

LiteLLM, OpenAI uyumlu bir API dili konuştuğu ve Anthropic, Ollama ile diğer çoğu sağlayıcıya aynı uç nokta üzerinden proxy yaptığı için yaygın olarak tercih edilir. Bir yapılandırma dosyası ile Docker üzerinde çalıştırın.

model_list:
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local
    litellm_params:
      model: ollama/qwen3:8b
      api_base: http://127.0.0.1:11434

Bunu litellm_config.yaml olarak kaydedin ve proxy'yi başlatın. Proxy, 4000 numaralı portu dinler.

docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
  -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
  -e LITELLM_MASTER_KEY=sk-1234 \
  -p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
  --config /app/config.yaml

LITELLM_MASTER_KEY yönetici kimlik bilgisidir, bu nedenle onu bir root parolası gibi değerlendirin ve örnek değeri asla dağıtmayın. Proxy'yi, barındırılan bir API'yi çağıracağınız şekilde çağırın.

curl http://localhost:4000/v1/chat/completions \
  -H 'Authorization: Bearer sk-1234' \
  -H 'Content-Type: application/json' \
  -d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'

Sağlıklı bir yanıt, choices dizisini içeren normal bir JSON çıktısıdır. 401 hatası, Authorization başlığının ana anahtarınızla eşleşmediği anlamına gelir. Bir modeli belirten 400 hatası ise, isteğinizdeki model değerinin yapılandırma dosyasındaki hiçbir model_name ile eşleşmediğini gösterir.

Bunu doğrudan Anthropic'i çağırmak yerine inşa etmenizin nedeni harcama limitidir. Her uygulama için ayrı bir sanal anahtar oluşturun ve her birine kendi bütçesini atayın.

curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'

Bu anahtar yüz dolar harcayabilir, yalnızca bir modele erişebilir ve başka hiçbir şey yapamaz. Bir ajan gece saat üçte hatalı davrandığında, etki alanı tüm hesabınız yerine sadece o anahtarla sınırlı kalır. Bu model ve çevresindeki izleme mekanizmaları, VPS üzerinde ajan maliyetlerini kontrol altında tutma konusunun içeriğini oluşturur. Eğer hala token başına ödeme yapıp yapmama konusunda kararsızsanız, API ile abonelik maliyeti karşılaştırması matematiksel hesaplamaları sizin için yapar.

Ağ geçidinin ne yapmadığına dikkat edin. Claude'u yerel hale getirmez ve istemlerinizi Anthropic'ten gizlemez. İstekler, sağlayıcıya ulaşmak için sunucunuzdan çıkmaya devam eder. Kazandığınız şey; anahtarlar, harcamalar, yönlendirme ve günlük kayıtları üzerindeki kontroldür.

Claude Code'u kendi VPS'nizde çalıştırma

Üçüncü dileği yerine getirmek en kolayıdır. Claude Code bir istemcidir. Node.js kurduğunuz her yerde çalışır ve API ile HTTPS üzerinden iletişim kurar. Onu kendi sunucunuzda çalıştırmak, dizüstü bilgisayarınızı kapattıktan sonra bile ajanın çalışmaya devam edeceği anlamına gelir. Ayrıca ajanın etki alanı, ana makineniz yerine dilediğiniz zaman yeniden oluşturabileceğiniz izole bir kutu ile sınırlı kalır.

npm install -g @anthropic-ai/claude-code
claude --version

Kesilen bir SSH bağlantısının uzun süren bir işi sonlandırmaması için onu tmux içinde çalıştırın. Oturum yönetimi dahil bu kurulum, Claude Code'u tmux ile VPS üzerinde çalıştırma rehberinde ele alınmıştır. Ajana kendi yetkisiz (unprivileged) kullanıcısını atayın ve ona önem verdiğiniz herhangi bir dosyaya yazma erişimi vermeden önce Claude Code'u sunucuda çalıştırmaya yönelik güvenlik kuralları kısmını okuyun.

Bu işlem modeli değil, ajanı kendi sunucunuzda barındırmaktır. İnsanların sıklıkla karıştırdığı bir konu olduğu için bu ayrımı net yapmak önemlidir. Sürecin, dosya sisteminin, ağ çıkışının ve günlük kayıtlarının sahibi sizsiniz. Çıkarım (inference) işleminin sahibi ise hala Anthropic'tir.

Her seçeneğin gerçek maliyeti

Fiyatlar değişkenlik gösterdiğinden, bunları kesin bir tekliften ziyade genel bir çerçeve olarak değerlendirin. Temmuz 2026 itibarıyla Claude Sonnet 5, milyon girdi token'ı başına 3 dolar ve milyon çıktı token'ı başına 15 dolar; Claude Opus 5 ise sırasıyla 5 ve 25 dolar olarak listelenmektedir. Yerel bir modelin token başına maliyeti yoktur; bunun yerine sunucunun aylık maliyeti neyse o tutar ödenir ve siz kullansanız da kullanmasanız da bu maliyet devam eder.

Başa baş noktası, insanların beklediğinden daha düşüktür. Kullanışlı bir açık kaynak modeli çalıştıracak kadar belleğe sahip bir VPS her ay gerçek bir maliyet oluşturur ve çoğu zaman boşta bekler. Kullanımınız ani artışlar gösteriyorsa, barındırılan API genellikle daha ucuzdur. Kullanımınız sabitse veya verilerinizin ağınızdan çıkmaması gerekiyorsa, yerel model her iki açıdan da avantajlıdır.

Dürüst ve karma çözüm, çoğu ekibin üzerinde uzlaştığı yöntemdir. Yüksek hacimli ve düşük zorluk dereceli işler için yerel bir açık kaynak modeli çalıştırın. Zorlu istekleri ise barındırılan bir sınır modeline yönlendirin. Her ikisinin önüne bir ağ geçidi (gateway) koyun; böylece uygulamalar hangisinin hangisi olduğunu bilmek zorunda kalmaz ve uygulama koduna dokunmadan aradaki sınırı değiştirebilirsiniz. Bu mimari, "self-hosted Claude" kavramının pratik karşılığıdır ve gerçek anlamdaki versiyonunun aksine, bu yöntem uygulanabilirdir. Eğer tüm agent yığınını da kendiniz çalıştırmak istiyorsanız, self-hosted yapay zeka agent'ları özeti mevcut seçenekleri kapsamaktadır.

FAQ

Claude model ağırlıklarını indirip yerel olarak çalıştırabilir miyim?

Hayır. Anthropic, hiçbir Claude modeli için ağırlıkları yayınlamamıştır ve self-host etmeye izin veren bir lisans bulunmamaktadır. İnternette indirilebilir bir "Claude modeli" olarak reklamı yapılan her şey, ya yanıltıcı bir isme sahip farklı bir modeldir ya da API'yi çağıran bir arayüzdür (wrapper). Eğer bir API anahtarı gerektiriyorsa, yerel değildir.

Claude'a en yakın açık model hangisidir?

Tam bir karşılığı yoktur ve liderler birkaç ayda bir değişmektedir. Test etmeye değer açık ağırlıklı model aileleri Llama, Qwen, Mistral, Gemma ve DeepSeek'tir. Özetleme, sınıflandırma ve basit kod düzenlemelerinde 8 ila 14 milyar parametreli iyi bir açık model gerçekten kullanışlıdır. Uzun ve çok adımlı mantık yürütme ve aracı (agentic) araç kullanımı konularında, barındırılan bir sınır (frontier) model ile aradaki fark hala büyüktür. Bir liderlik tablosuna güvenmek yerine kendi istemlerinizle (prompt) test yapın.

LiteLLM, self-hosted bir OpenRouter mıdır?

Yönlendirme ve anahtar yönetimi kısmı için işlevsel olarak evet. LiteLLM sunucunuzda çalışır, OpenAI uyumlu tek bir uç nokta sunar ve Anthropic, Ollama ve diğer çoğu sağlayıcıya proxy görevi görür. Anahtar başına harcama limitleri, model yönlendirme ve logları okumak için tek bir merkez elde edersiniz. Size sağlamadığı şey yerel çıkarımdır (inference): Claude'a yapılan istekler hala Anthropic'e gider.

Claude Code'u kendi sunucumda çalıştırmak kodumu gizli tutar mı?

Hayır. Claude Code, süreç nerede çalışıyor olursa olsun, okuduğu dosya içeriklerini Anthropic API'sine gönderir. Bir VPS'in size sağladığı şey içeriğin gizliliği değil, aracın izolasyonudur. Ona özel, yetkisiz bir kullanıcı atayın, kimlik bilgilerinden ve ilgisiz depolardan uzak tutun ve okuyabildiği her şeyi sunucudan dışarı çıkan içerik olarak değerlendirin.