Bisakah Claude Di-host Sendiri? Jawaban Jujurnya
Bobot Claude tidak dipublikasikan, jadi tidak ada server Anda yang dapat menjalankannya. Pelajari alternatif yang bisa di-host sendiri: model terbuka, gateway, dan Claude Code.
Dapatkah Anda meng-host Claude sendiri? Tidak, dan inilah alasannya
Anda tidak dapat meng-host Claude sendiri. Anthropic tidak memublikasikan bobot modelnya, sehingga tidak ada file untuk diunduh, tidak ada container untuk dijalankan, dan tidak ada lisensi yang memungkinkan Anda menyajikannya dari perangkat keras sendiri. Setiap permintaan Claude dikirim ke API Anthropic atau ke mitra yang menyediakan layanan ter-host seperti Amazon Bedrock, Google Vertex AI, atau Microsoft Foundry. Menjalankannya di mesin milik Anda bukan masalah konfigurasi. Artefak tersebut memang tidak tersedia di luar Anthropic.
Itulah jawaban singkatnya. Jawaban yang lebih lengkap adalah bahwa sebagian besar orang yang mengajukan pertanyaan ini sebenarnya tidak menginginkan bobot model. Mereka menginginkan salah satu dari tiga hal yang semuanya dapat dijalankan pada server yang Anda kendalikan: model yang mumpuni dan berjalan secara lokal, gateway yang menyimpan API key mereka serta membatasi pengeluaran, atau agen coding yang berjalan di komputer milik mereka sendiri, bukan di laptop. Panduan ini membahas ketiganya, lengkap dengan perintah.
Arti "Claude yang di-host sendiri"
Traffic pencarian untuk "self hosted Claude" mencakup beberapa kebutuhan yang berbeda, dan masing-masing memerlukan jawaban yang berbeda.
Sebagian orang menginginkan privasi. Mereka tidak ingin prompt keluar dari jaringan mereka. Hanya model open-weight lokal yang dapat memenuhi kebutuhan itu, karena setiap permintaan Claude pada dasarnya merupakan permintaan ke Anthropic.
Sebagian orang menginginkan pengendalian biaya. Mereka khawatir agent yang berjalan tanpa kendali akan menghabiskan kredit. Gateway dapat mengatasi hal itu, dan gateway tersebut berfungsi dengan Claude sehingga Anda tetap mendapatkan kualitas modelnya.
Sebagian orang menginginkan kemandirian dari laptop. Mereka ingin agent tetap bekerja saat laptop ditutup. VPS dapat mengatasi hal itu, dan Claude Code dapat berjalan di dalamnya tanpa masalah.
Sebagian orang menginginkan frasa "self hosted OpenRouter". Itu juga merupakan gateway, dan jawaban yang umum adalah LiteLLM.
Tentukan kebutuhan Anda, karena rancangan yang tepat berbeda untuk setiap kasus.
Host sendiri model terbuka dengan Ollama
Jika persyaratannya adalah tidak ada prompt yang keluar dari server Anda, jalankan model dengan bobot terbuka. Keluarga model yang benar-benar dapat digunakan di server sewaan saat ini adalah Llama, Qwen, Mistral, Gemma, dan DeepSeek. Semua model tersebut menyediakan bobot yang dapat Anda unduh dan jalankan.
Ollama adalah cara tercepat untuk memulai. Skrip instalasinya hanya satu baris, dan skrip tersebut menyiapkan layanan systemd di Ubuntu.
curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollamasystemctl status ollama harus mencetak active (running). Kemudian, tarik model dan berinteraksilah dengannya.
ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."pull pertama mengunduh beberapa gigabyte, sehingga model harus muat di RAM atau memori GPU sebelum dapat menjawab apa pun. Aturan praktis untuk model terkuantisasi: model dengan 8 miliar parameter memerlukan sekitar 6 GB ruang kosong, model dengan 14 miliar parameter memerlukan sekitar 10 GB, sedangkan model dengan 70 miliar parameter memerlukan lebih banyak memori daripada yang tersedia pada sebagian besar paket VPS serbaguna. Jika memori pada server tidak mencukupi, proses dihentikan oleh kernel dan Anda melihat Error: llama runner process has terminated, disertai baris kehabisan memori di dmesg. Periksa free -h sebelum menyalahkan model.
Ollama juga menyediakan API HTTP pada 127.0.0.1:11434. Hal ini membuatnya berguna bagi perangkat lunak lain, bukan sekadar aplikasi percakapan.
curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'Biarkan port tersebut terikat ke localhost. Port Ollama yang terbuka pada IP publik dapat digunakan siapa saja yang menemukannya tanpa biaya GPU bagi mereka. Panduan lengkap, termasuk unit systemd, deteksi GPU, dan penempatan reverse proxy di depannya, tersedia dalam panduan menjalankan Ollama di VPS. Jika Anda melayani lebih dari satu pengguna pada saat yang sama, baca perbandingan Ollama dan vLLM terlebih dahulu karena desain single stream Ollama menjadi hambatan jauh sebelum perangkat kerasnya.
Bersikaplah realistis mengenai kesenjangan tersebut. Model terbuka yang baik pada VPS kelas menengah benar-benar berguna untuk membuat ringkasan, mengklasifikasikan, menyusun draf, dan melakukan ekstraksi sederhana. Untuk penalaran panjang dengan banyak langkah, basis kode besar, dan penggunaan alat oleh agen, kemampuannya masih jauh di bawah model hosted terdepan, dan penyetelan prompt sebanyak apa pun tidak dapat menutup kesenjangan tersebut. Pilih model lokal untuk pekerjaan yang memang dapat ditanganinya, dan gunakan model hosted berbayar ketika tingkat kesulitannya tinggi.
Jalankan gateway sendiri dengan LiteLLM
Inilah yang dicari orang dengan istilah "OpenRouter yang dihosting sendiri". Gateway berada di antara aplikasi Anda dan setiap penyedia model. Aplikasi Anda hanya menyimpan satu key yang diarahkan ke server Anda. Key penyedia yang sebenarnya hanya berada di server tersebut. Anda dapat membatasi pengeluaran per key, mengarahkan aplikasi yang berbeda ke model yang berbeda, dan mencatat setiap request di satu tempat.
LiteLLM menjadi pilihan umum karena menggunakan API yang kompatibel dengan OpenAI dan memproksikan request ke Anthropic, Ollama, serta sebagian besar penyedia lain melalui endpoint yang sama. Jalankan LiteLLM di Docker dengan file konfigurasi.
model_list:
- model_name: claude
litellm_params:
model: anthropic/claude-sonnet-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: local
litellm_params:
model: ollama/qwen3:8b
api_base: http://127.0.0.1:11434Simpan konfigurasi tersebut sebagai litellm_config.yaml, lalu jalankan proxy. Proxy akan listen pada port 4000.
docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
-e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
-e LITELLM_MASTER_KEY=sk-1234 \
-p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
--config /app/config.yamlLITELLM_MASTER_KEY adalah kredensial admin. Perlakukan kredensial ini seperti password root dan jangan gunakan nilai contoh tersebut di lingkungan produksi. Panggil proxy sama seperti Anda memanggil API yang di-hosting.
curl http://localhost:4000/v1/chat/completions \
-H 'Authorization: Bearer sk-1234' \
-H 'Content-Type: application/json' \
-d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'Respons yang sehat berupa JSON normal dengan array choices. 401 berarti header Authorization tidak cocok dengan master key Anda. 400 yang menyebutkan nama model berarti model dalam request Anda tidak cocok dengan model_name mana pun dalam file konfigurasi.
Alasan membangun gateway ini, alih-alih memanggil Anthropic secara langsung, adalah untuk menerapkan batas pengeluaran. Buat satu virtual key terpisah untuk setiap aplikasi, masing-masing dengan anggarannya sendiri.
curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'Key tersebut dapat membelanjakan seratus dolar dan mengakses satu model saja. Key tersebut tidak dapat melakukan hal lain. Jika agent bermasalah pada pukul tiga pagi, dampaknya terbatas pada satu key, bukan seluruh akun Anda. Pola ini, beserta pemantauannya, dibahas dalam menjaga biaya agent tetap terkendali di VPS. Jika Anda masih mempertimbangkan apakah perlu membayar berdasarkan token, perbandingan biaya API dan langganan menjelaskan perhitungannya.
Perhatikan hal yang tidak dilakukan gateway ini. Gateway tidak membuat Claude berjalan secara lokal, dan tidak menyembunyikan prompt Anda dari Anthropic. Request tetap meninggalkan server Anda menuju penyedia. Yang Anda peroleh adalah kendali atas key, pengeluaran, routing, dan log.
Menjalankan Claude Code di VPS Anda Sendiri
Keinginan ketiga adalah yang paling mudah dipenuhi. Claude Code adalah klien. Aplikasi ini berjalan di mana pun Anda memasang Node.js dan berkomunikasi dengan API melalui HTTPS. Menjalankannya di server milik Anda membuat agen tetap bekerja setelah Anda mematikan laptop. Selain itu, dampak jika agen disusupi terbatas pada sistem yang dapat Anda bangun ulang, bukan komputer utama Anda.
npm install -g @anthropic-ai/claude-code
claude --versionJalankan aplikasi ini di dalam tmux agar koneksi SSH yang terputus tidak menghentikan pekerjaan yang berlangsung lama. Penyiapan tersebut, termasuk penanganan sesi, dibahas dalam menjalankan Claude Code di VPS dengan tmux. Berikan agen akun pengguna sendiri tanpa hak istimewa. Baca aturan keamanan untuk menjalankan Claude Code di server sebelum memberinya akses tulis ke data apa pun yang penting bagi Anda.
Ini adalah hosting mandiri untuk agen, bukan untuk model. Hal ini perlu dijelaskan dengan tepat karena keduanya sering disamakan. Anda mengendalikan proses, sistem file, egress jaringan, dan log. Anthropic tetap mengendalikan inferensi.
Biaya nyata setiap opsi bagi Anda
Harga berubah, jadi anggap angka ini sebagai gambaran, bukan penawaran harga. Per Juli 2026, Claude Sonnet 5 tercantum dengan harga $3 per juta token input dan $15 per juta token output, sedangkan Claude Opus 5 seharga $5 dan $25. Model lokal tidak mengenakan biaya per token. Sebagai gantinya, Anda membayar biaya server per bulan, terlepas dari apakah server tersebut digunakan atau tidak.
Titik impasnya lebih rendah dari perkiraan banyak orang. VPS dengan memori yang cukup untuk menjalankan model open source yang bermanfaat memerlukan biaya bulanan yang nyata, dan sebagian besar waktu VPS tersebut menganggur. Jika penggunaan Anda bersifat tidak menentu, API yang di-host biasanya lebih murah. Jika penggunaan Anda konstan, atau data Anda tidak boleh keluar dari jaringan, model lokal lebih unggul dalam kedua hal tersebut.
Jawaban campuran yang paling realistis adalah pilihan yang diambil sebagian besar tim. Jalankan model open source secara lokal untuk pekerjaan bervolume tinggi dan berkompleksitas rendah. Arahkan permintaan yang sulit ke model frontier yang di-host. Tempatkan gateway di depan keduanya agar aplikasi tidak perlu mengetahui perbedaannya dan agar Anda dapat mengubah batas penggunaan keduanya tanpa menyentuh kode aplikasi. Arsitektur ini merupakan bentuk praktis dari "Claude yang di-host sendiri", dan tidak seperti versi literalnya, arsitektur ini benar-benar ada. Jika Anda juga ingin menjalankan seluruh tumpukan agen sendiri, rangkuman agen AI yang di-host sendiri membahas opsi yang tersedia.
FAQ
Dapatkah saya mengunduh bobot model Claude dan menjalankannya secara lokal?
Tidak. Anthropic tidak pernah merilis bobot untuk model Claude apa pun, dan tidak ada lisensi yang mengizinkan hosting mandiri. Apa pun yang diiklankan secara daring sebagai "model Claude" yang dapat diunduh adalah model lain dengan nama yang menyesatkan atau wrapper yang memanggil API. Jika memerlukan API key, model tersebut tidak berjalan secara lokal.
Model terbuka apa yang paling mendekati Claude?
Tidak ada yang benar-benar sama, dan model terdepan berubah setiap beberapa bulan. Keluarga model dengan bobot terbuka yang layak diuji meliputi Llama, Qwen, Mistral, Gemma, dan DeepSeek. Untuk peringkasan, klasifikasi, dan pengeditan kode sederhana, model terbuka yang baik dengan 8 hingga 14 miliar parameter benar-benar berguna. Untuk penalaran multi-langkah yang panjang dan penggunaan alat oleh agen, kesenjangan dengan model frontier yang di-host masih besar. Lakukan pengujian dengan prompt Anda sendiri, bukan dengan mengandalkan papan peringkat.
Apakah LiteLLM merupakan OpenRouter yang di-host sendiri?
Secara fungsional, ya, untuk bagian perutean dan pengelolaan key. LiteLLM berjalan di server Anda, menyediakan satu endpoint yang kompatibel dengan OpenAI, dan meneruskan permintaan ke Anthropic, Ollama, serta sebagian besar penyedia lainnya. Anda mendapatkan batas pengeluaran per key, perutean model, dan satu tempat untuk membaca log. Namun, LiteLLM tidak menyediakan inferensi lokal: permintaan ke Claude tetap dikirim melalui jaringan ke Anthropic.
Apakah menjalankan Claude Code di server sendiri menjaga kode saya tetap privat?
Tidak. Claude Code mengirimkan isi file yang dibacanya ke Anthropic API, di mana pun proses tersebut berjalan. VPS memberi Anda isolasi untuk agen, bukan privasi untuk konten. Berikan agen tersebut user khusus tanpa hak istimewa, jauhkan dari kredensial dan repositori yang tidak terkait, serta anggap semua hal yang dapat dibacanya sebagai konten yang keluar dari server.