SSD Nodes Learn Hosting plans →
Panduan Matt ConnorOleh Matt Connor · Diperbarui 2026-08-29

Dapatkah Anda Menjalankan Claude Secara Mandiri?

Bobot Claude tidak dipublikasikan, jadi tidak ada server Anda yang dapat menjalankannya. Simak alternatif yang dapat di-host sendiri: model terbuka, gateway, dan Claude Code.

Dapatkah Anda menjalankan Claude secara mandiri? Tidak, dan berikut alasannya

Anda tidak dapat menjalankan Claude secara mandiri. Anthropic tidak menerbitkan bobot model tersebut, sehingga tidak ada file untuk diunduh, tidak ada container untuk dijalankan, dan tidak ada lisensi yang memungkinkan Anda menyajikannya dari perangkat keras sendiri. Setiap permintaan Claude dikirim ke API Anthropic atau ke partner yang menyediakan layanan terkelola, seperti Amazon Bedrock, Google Vertex AI, atau Microsoft Foundry. Menjalankannya pada mesin milik Anda bukan masalah konfigurasi. Artefak tersebut memang tidak tersedia di luar Anthropic.

Itulah jawaban singkatnya. Jawaban yang lebih panjang adalah bahwa sebagian besar orang yang mengajukan pertanyaan ini sebenarnya tidak menginginkan bobot model. Mereka menginginkan salah satu dari tiga hal yang semuanya dapat diwujudkan pada server yang Anda kendalikan: model yang mumpuni dan berjalan secara lokal, gateway yang menyimpan API key mereka serta membatasi pengeluaran, atau coding agent yang berjalan pada mesin mereka sendiri, bukan pada laptop. Panduan ini membahas ketiganya, lengkap dengan perintah.

Apa yang biasanya dimaksud dengan "self-hosted Claude"

Pencarian untuk "self-hosted Claude" mencerminkan beberapa kebutuhan yang berbeda, dan masing-masing memerlukan jawaban yang berbeda.

Sebagian orang menginginkan privasi. Mereka tidak ingin prompt keluar dari jaringan mereka. Hanya model open-weight lokal yang dapat memenuhi kebutuhan itu, karena setiap permintaan ke Claude pada dasarnya adalah permintaan ke Anthropic.

Sebagian orang menginginkan pengendalian biaya. Mereka khawatir agent yang tidak terkendali akan menghabiskan kredit. Gateway dapat mengatasi masalah itu dan tetap berfungsi dengan Claude, sehingga kualitas model tetap terjaga.

Sebagian orang menginginkan kemandirian dari laptop. Mereka ingin agent tetap bekerja saat laptop ditutup. VPS dapat memenuhi kebutuhan itu, dan Claude Code dapat berjalan dengan baik di dalamnya.

Sebagian orang menginginkan konsep "self-hosted OpenRouter". Itu juga merupakan gateway, dan jawaban yang umum adalah LiteLLM.

Tentukan kebutuhan Anda, karena rancangan yang tepat berbeda untuk setiap kasus.

Host sendiri model terbuka dengan Ollama

Jika persyaratannya adalah tidak ada prompt yang keluar dari server Anda, jalankan model open weight. Keluarga model yang saat ini benar-benar dapat digunakan pada server sewaan adalah Llama, Qwen, Mistral, Gemma, dan DeepSeek. Semua model tersebut menyediakan weights yang dapat Anda unduh dan jalankan.

Ollama adalah cara tercepat untuk memulai. Skrip instalasinya hanya satu baris dan menyiapkan service systemd pada Ubuntu.

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama

systemctl status ollama harus menampilkan active (running). Selanjutnya, pull sebuah model dan gunakan model tersebut.

ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."

pull pertama mengunduh beberapa gigabyte, sehingga model harus muat di RAM atau memori GPU sebelum dapat menjawab apa pun. Untuk model terkuantisasi, gunakan perkiraan kasar berikut: model dengan 8 billion parameter membutuhkan sekitar 6 GB ruang kosong, model dengan 14 billion parameter membutuhkan sekitar 10 GB, sedangkan model dengan 70 billion parameter membutuhkan memori yang lebih besar daripada kapasitas sebagian besar paket VPS untuk penggunaan umum. Jika memori server tidak mencukupi, proses akan dihentikan oleh kernel dan Anda akan melihat Error: llama runner process has terminated, disertai baris out of memory dalam dmesg. Periksa free -h sebelum menyalahkan model. Anggaran memori yang sama juga menentukan seberapa banyak prompt panjang yang benar-benar dibaca model, karena Ollama secara diam-diam memotong bagian yang melewati window default yang relatif kecil. Oleh karena itu, menaikkan num_ctx dan menyesuaikan ukuran KV cache adalah hal pertama yang perlu diperiksa ketika dokumen panjang hanya diringkas sebagian.

Ollama juga menyediakan HTTP API pada 127.0.0.1:11434. Inilah yang membuatnya berguna bagi software lain, bukan sekadar mainan chat.

curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'

Jika request pertama setelah beberapa saat tanpa aktivitas membutuhkan waktu tiga puluh detik, sedangkan request berikutnya langsung mendapat respons, tidak ada yang rusak. Ollama membongkar model setelah tidak aktif selama lima menit, dan mempertahankan model di memori dengan keep_alive menghilangkan waktu tambahan untuk memuat ulang tersebut.

Biarkan port itu terikat ke localhost. Port Ollama yang terbuka pada IP publik dapat menjadi GPU gratis bagi siapa saja yang menemukannya. Konfigurasi lengkap, termasuk unit systemd, deteksi GPU, dan penempatan reverse proxy di depannya, dibahas dalam panduan menjalankan Ollama pada VPS. Jika Anda melayani lebih dari satu pengguna secara bersamaan, baca perbandingan Ollama dan vLLM terlebih dahulu, karena desain single stream Ollama menjadi bottleneck jauh sebelum perangkat keras mencapai batasnya.

Jujurlah tentang perbedaannya. Model terbuka yang baik pada VPS kelas menengah benar-benar berguna untuk membuat ringkasan, mengklasifikasikan, menyusun draf, dan melakukan ekstraksi sederhana. Untuk penalaran panjang yang terdiri atas banyak langkah, codebase besar, dan penggunaan tool oleh agent, kemampuannya masih jauh di bawah model hosted terdepan, dan tidak ada jumlah penyetelan prompt yang dapat menutup kesenjangan tersebut. Pilih model lokal untuk pekerjaan yang memang dikuasainya, lalu gunakan model hosted berbayar ketika tingkat kesulitannya benar-benar tinggi.

Jalankan gateway sendiri dengan LiteLLM

Ini adalah "OpenRouter yang di-host sendiri" yang banyak dicari orang. Gateway berada di antara aplikasi Anda dan setiap penyedia model. Aplikasi Anda hanya menyimpan satu key yang diarahkan ke server Anda. Key penyedia yang sebenarnya hanya berada di server tersebut. Anda dapat membatasi pengeluaran per key, mengarahkan aplikasi yang berbeda ke model yang berbeda, dan mencatat setiap request di satu tempat.

LiteLLM menjadi pilihan umum karena mendukung API yang kompatibel dengan OpenAI serta melakukan proxy ke Anthropic, Ollama, dan sebagian besar penyedia lain melalui endpoint yang sama. Jalankan LiteLLM dalam Docker dengan file konfigurasi.

model_list:
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local
    litellm_params:
      model: ollama/qwen3:8b
      api_base: http://127.0.0.1:11434

Simpan konfigurasi tersebut sebagai litellm_config.yaml lalu jalankan proxy. Proxy akan listen pada port 4000.

docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
  -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
  -e LITELLM_MASTER_KEY=sk-1234 \
  -p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
  --config /app/config.yaml

LITELLM_MASTER_KEY adalah kredensial admin. Perlakukan kredensial ini seperti password root dan jangan gunakan nilai contoh tersebut pada deployment. Panggil proxy persis seperti saat memanggil API yang di-host.

curl http://localhost:4000/v1/chat/completions \
  -H 'Authorization: Bearer sk-1234' \
  -H 'Content-Type: application/json' \
  -d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'

Respons yang sehat berupa JSON normal dengan array choices. 401 berarti header Authorization tidak cocok dengan master key Anda. 400 yang mencantumkan nama model berarti model dalam request Anda tidak cocok dengan model_name mana pun di file konfigurasi.

Alasan membangun gateway ini, bukan langsung memanggil Anthropic, adalah pembatasan pengeluaran. Buat satu virtual key terpisah untuk setiap aplikasi, masing-masing dengan anggarannya sendiri.

curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'

Key tersebut dapat dibatasi hingga pengeluaran seratus dolar dan akses ke satu model, tanpa akses lainnya. Jika sebuah agent bermasalah pada pukul tiga pagi, dampaknya terbatas pada satu key, bukan seluruh akun Anda. Pola ini, beserta pemantauannya, dibahas dalam menjaga biaya agent tetap terkendali pada VPS. Jika Anda masih menentukan apakah akan membayar berdasarkan token, perbandingan biaya API dan subscription menjelaskan perhitungannya.

Perhatikan hal yang tidak dilakukan gateway ini. Gateway tidak membuat Claude berjalan secara lokal dan tidak menyembunyikan prompt Anda dari Anthropic. Request tetap keluar dari server Anda menuju penyedia. Yang Anda dapatkan adalah kontrol atas key, pengeluaran, routing, dan log.

Menjalankan Claude Code di VPS milik sendiri

Keinginan ketiga adalah yang paling mudah dipenuhi. Claude Code adalah client. Aplikasi ini berjalan di mana pun Anda menginstal Node.js, lalu berkomunikasi dengan API melalui HTTPS. Menjalankannya di server milik sendiri membuat agent tetap bekerja setelah Anda mematikan laptop. Selain itu, jika agent mengalami masalah, dampaknya terbatas pada satu mesin yang dapat Anda bangun ulang, bukan pada komputer utama Anda.

npm install -g @anthropic-ai/claude-code
claude --version

Jalankan aplikasi ini di dalam tmux agar koneksi SSH yang terputus tidak menghentikan pekerjaan yang berjalan lama. Penyiapan tersebut, termasuk pengelolaan session, dibahas dalam menjalankan Claude Code di VPS dengan tmux. Berikan agent user sendiri yang tidak memiliki hak istimewa. Baca aturan keamanan untuk menjalankan Claude Code di server sebelum memberikan akses tulis ke data apa pun yang penting bagi Anda.

Ini adalah self-hosting agent, bukan modelnya. Hal ini perlu dijelaskan secara tepat karena keduanya sering disamakan. Anda mengelola proses, filesystem, egress jaringan, dan log. Anthropic tetap mengelola inference.

Biaya nyata setiap opsi

Harga dapat berubah, jadi anggap angka berikut sebagai gambaran, bukan penawaran harga. Per Juli 2026, Claude Sonnet 5 memiliki tarif $3 per juta token input dan $15 per juta token output, sedangkan Claude Opus 5 memiliki tarif $5 dan $25. Model lokal tidak mengenakan biaya per token. Sebagai gantinya, biayanya adalah biaya server per bulan, terlepas dari apakah server tersebut digunakan atau tidak.

Titik impasnya lebih rendah daripada yang diperkirakan banyak orang. VPS dengan memori yang cukup untuk menjalankan open model yang berguna tetap memerlukan biaya bulanan, dan sebagian besar waktu server tersebut tidak digunakan. Jika penggunaan Anda tidak merata, hosted API biasanya lebih murah. Jika penggunaan Anda konstan, atau data Anda tidak boleh keluar dari jaringan, model lokal lebih unggul dalam kedua hal tersebut.

Jawaban campuran yang realistis adalah pilihan yang diambil sebagian besar tim. Jalankan open model secara lokal untuk pekerjaan bervolume tinggi dengan tingkat kesulitan rendah. Arahkan permintaan yang sulit ke hosted frontier model. Tempatkan gateway di depan keduanya agar aplikasi tidak perlu mengetahui model yang digunakan, dan agar Anda dapat mengubah pembagian beban tanpa menyentuh kode aplikasi. Arsitektur ini adalah bentuk praktis dari "self hosted Claude", dan tidak seperti versi literalnya, arsitektur ini benar-benar ada. Jika Anda juga ingin menjalankan seluruh agent stack sendiri, ringkasan AI agent yang di-self-host membahas opsi yang tersedia.

FAQ

Dapatkah saya mengunduh bobot model Claude dan menjalankannya secara lokal?

Tidak. Anthropic tidak pernah merilis bobot untuk model Claude mana pun, dan tidak ada lisensi yang mengizinkan self-hosting. Apa pun yang diiklankan secara online sebagai "model Claude" yang dapat diunduh kemungkinan merupakan model lain dengan nama yang menyesatkan atau wrapper yang memanggil API. Jika memerlukan API key, berarti model tersebut tidak berjalan secara lokal.

Model open apa yang paling mendekati Claude?

Tidak ada yang benar-benar sama, dan model terbaik berubah setiap beberapa bulan. Keluarga model dengan bobot terbuka yang layak diuji mencakup Llama, Qwen, Mistral, Gemma, dan DeepSeek. Untuk peringkasan, klasifikasi, dan pengeditan kode sederhana, model open yang baik dengan 8 hingga 14 miliar parameter benar-benar berguna. Untuk penalaran multi-langkah yang panjang dan penggunaan tool secara agentic, kesenjangan dengan frontier model yang di-host masih besar. Uji model menggunakan prompt Anda sendiri, bukan hanya mengandalkan leaderboard.

Apakah LiteLLM merupakan OpenRouter yang di-self-host?

Secara fungsional, ya, untuk bagian routing dan pengelolaan key. LiteLLM berjalan di server Anda, menyediakan satu endpoint yang kompatibel dengan OpenAI, dan bertindak sebagai proxy ke Anthropic, Ollama, serta sebagian besar provider lain. Anda mendapatkan batas pengeluaran per key, routing model, dan satu tempat untuk membaca log. LiteLLM tidak menyediakan inferensi lokal: request ke Claude tetap dikirim melalui jaringan ke Anthropic.

Apakah menjalankan Claude Code di server sendiri membuat kode saya tetap privat?

Tidak. Claude Code mengirim isi file yang dibacanya ke Anthropic API, di mana pun proses tersebut berjalan. VPS memberi Anda isolasi untuk agent, bukan privasi konten. Berikan agent tersebut user khusus tanpa hak istimewa, jauhkan dari kredensial dan repository yang tidak terkait, serta perlakukan semua hal yang dapat dibacanya sebagai konten yang keluar dari server.