SSD Nodes Learn RAM 8GB — $66/tahun
Panduan Matt ConnorOleh Matt Connor · Dikemas kini 2026-08-01

Bolehkah Claude Dihos Sendiri? Jawapan Jujur

Pemberat Claude tidak diterbitkan, jadi tiada pelayan anda boleh menjalankannya. Ketahui pilihan yang boleh dihos sendiri: model terbuka, get laluan dan Claude Code.

Bolehkah anda mengehos sendiri Claude? Tidak, dan inilah sebabnya

Anda tidak boleh mengehos sendiri Claude. Anthropic tidak menerbitkan pemberat model tersebut. Oleh itu, tiada fail untuk dimuat turun, tiada kontena untuk dijalankan dan tiada lesen yang membolehkan anda menyediakannya daripada perkakasan sendiri. Setiap permintaan Claude dihantar ke API Anthropic atau kepada rakan kongsi yang mengehoskannya, seperti Amazon Bedrock, Google Vertex AI atau Microsoft Foundry. Menjalankannya pada mesin milik anda bukan masalah konfigurasi. Artifak itu sememangnya tidak wujud di luar Anthropic.

Itulah jawapan ringkasnya. Jawapan yang lebih panjang ialah kebanyakan orang yang mengemukakan soalan ini sebenarnya tidak memerlukan pemberat tersebut. Mereka mahukan salah satu daripada tiga perkara yang semuanya boleh dicapai pada pelayan yang anda kawal: model berkeupayaan tinggi yang berjalan secara setempat, get laluan yang menyimpan kunci API mereka serta mengehadkan perbelanjaan, atau ejen pengekodan yang berada pada mesin mereka sendiri dan bukannya komputer riba mereka. Panduan ini merangkumi ketiga-tiganya, bersama-sama dengan arahannya.

Maksud "Claude yang dihos sendiri" biasanya

Trafik carian untuk "self hosted Claude" merangkumi beberapa keperluan yang berbeza, dan setiap satunya memerlukan jawapan yang berbeza.

Sesetengah orang mahukan privasi. Mereka tidak mahu gesaan keluar dari rangkaian mereka. Hanya model local open weight yang boleh menyelesaikan keperluan itu, kerana setiap permintaan Claude sememangnya merupakan permintaan kepada Anthropic.

Sesetengah orang mahukan kawalan kos. Mereka bimbang ejen yang tidak terkawal akan menggunakan kredit secara berlebihan. Gateway menyelesaikan masalah itu dan berfungsi dengan Claude, jadi anda masih mengekalkan kualiti model.

Sesetengah orang mahukan kebebasan daripada komputer riba. Mereka mahu ejen yang terus berfungsi semasa mereka menutup penutup komputer. VPS menyelesaikan masalah itu, dan Claude Code boleh berjalan padanya tanpa masalah.

Sesetengah orang menggunakan frasa "self hosted OpenRouter". Itu juga merupakan gateway, dan jawapan lazimnya ialah LiteLLM.

Tentukan kategori anda, kerana binaan yang sesuai berbeza bagi setiap kes.

Hoskan model terbuka sendiri dengan Ollama

Jika syaratnya ialah tiada prompt meninggalkan pelayan anda, jalankan model dengan pemberat terbuka. Keluarga model yang benar-benar boleh digunakan pada pelayan sewaan hari ini ialah Llama, Qwen, Mistral, Gemma dan DeepSeek. Kesemuanya menerbitkan pemberat yang boleh anda muat turun dan jalankan.

Ollama ialah cara terpantas untuk bermula. Skrip pemasangannya hanya satu baris dan menyediakan perkhidmatan systemd pada Ubuntu.

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama

systemctl status ollama sepatutnya mencetak active (running). Kemudian tarik model dan berinteraksi dengannya.

ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."

pull pertama memuat turun beberapa gigabait, jadi model perlu dimuatkan dalam RAM atau memori GPU sebelum boleh memberikan sebarang jawapan. Anggaran kasar untuk model terkuantum: model dengan 8 bilion parameter memerlukan kira-kira 6 GB ruang bebas, model dengan 14 bilion parameter memerlukan kira-kira 10 GB, dan model dengan 70 bilion parameter memerlukan lebih banyak memori daripada yang disediakan oleh kebanyakan pelan VPS tujuan umum. Jika pelayan kekurangan memori, proses itu dihentikan oleh kernel dan anda akan melihat Error: llama runner process has terminated, bersama-sama baris kehabisan memori dalam dmesg. Semak free -h sebelum menyalahkan model.

Ollama juga menyediakan API HTTP pada 127.0.0.1:11434. Ini membolehkannya digunakan oleh perisian lain, bukan sekadar sebagai aplikasi sembang.

curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'

Pastikan port itu terikat pada localhost. Port Ollama yang terbuka pada IP awam boleh menjadi GPU percuma untuk sesiapa sahaja yang menemuinya. Binaan penuh, termasuk unit systemd, pengesanan GPU dan penyediaan proksi terbalik di hadapannya, diterangkan dalam panduan menjalankan Ollama pada VPS. Jika anda menyediakan perkhidmatan kepada lebih daripada seorang pengguna pada satu masa, baca perbandingan Ollama dan vLLM dahulu kerana reka bentuk aliran tunggal Ollama menjadi kesesakan jauh sebelum perkakasan mencapai hadnya.

Jelaskan batasannya. Model terbuka yang baik pada VPS bersaiz sederhana sememangnya berguna untuk membuat ringkasan, mengelaskan, menyediakan draf dan menjalankan pengekstrakan mudah. Untuk penaakulan berbilang langkah yang panjang, pangkalan kod yang besar dan penggunaan alat oleh ejen, model ini masih jauh ketinggalan berbanding model termaju yang dihoskan, dan sebarang jumlah penalaan prompt tidak dapat merapatkan jurang tersebut. Pilih model setempat untuk tugas yang dapat dilakukannya dengan baik, dan bayar untuk model yang dihoskan apabila tugas itu benar-benar sukar.

Jalankan get laluan anda sendiri dengan LiteLLM

Inilah "OpenRouter yang dihos sendiri" yang dicari oleh ramai orang. Get laluan berada antara aplikasi anda dengan setiap penyedia model. Aplikasi anda hanya menyimpan satu kunci yang menghala ke pelayan anda. Kunci penyedia sebenar hanya berada pada pelayan itu. Anda boleh menetapkan had perbelanjaan bagi setiap kunci, menghalakan aplikasi yang berbeza kepada model yang berbeza, dan merekodkan setiap permintaan di satu tempat.

LiteLLM ialah pilihan biasa kerana ia menyediakan API yang serasi dengan OpenAI dan memproksikan permintaan kepada Anthropic, Ollama, serta kebanyakan penyedia lain melalui titik akhir yang sama. Jalankan LiteLLM dalam Docker menggunakan fail konfigurasi.

model_list:
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local
    litellm_params:
      model: ollama/qwen3:8b
      api_base: http://127.0.0.1:11434

Simpan fail itu sebagai litellm_config.yaml dan mulakan proksi. Proksi tersebut mendengar pada port 4000.

docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
  -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
  -e LITELLM_MASTER_KEY=sk-1234 \
  -p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
  --config /app/config.yaml

LITELLM_MASTER_KEY ialah kelayakan pentadbir. Oleh itu, kendalikannya seperti kata laluan root dan jangan gunakan nilai contoh dalam persekitaran sebenar. Panggil proksi itu sama seperti anda memanggil API yang dihoskan.

curl http://localhost:4000/v1/chat/completions \
  -H 'Authorization: Bearer sk-1234' \
  -H 'Content-Type: application/json' \
  -d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'

Respons yang sihat ialah JSON biasa dengan tatasusunan choices. 401 bermaksud pengepala Authorization tidak sepadan dengan kunci induk anda. 400 yang menamakan model bermaksud model dalam permintaan anda tidak sepadan dengan mana-mana model_name dalam fail konfigurasi.

Sebab membina sistem ini dan bukannya memanggil Anthropic secara terus ialah had perbelanjaan. Keluarkan satu kunci maya yang berasingan bagi setiap aplikasi, dengan belanjawan tersendiri.

curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'

Kunci itu boleh membelanjakan seratus dolar dan mengakses satu model sahaja. Tiada akses lain dibenarkan. Apabila ejen berkelakuan tidak wajar pada pukul tiga pagi, kesannya terhad kepada satu kunci dan bukan keseluruhan akaun anda. Corak ini, bersama-sama pemantauan yang berkaitan, diterangkan dalam mengawal kos ejen pada VPS. Jika anda masih menentukan sama ada hendak membayar berdasarkan token, perbandingan kos API dengan langganan menerangkan pengiraannya.

Perhatikan perkara yang tidak dilakukan oleh get laluan ini. Get laluan ini tidak menjadikan Claude berjalan secara setempat dan tidak menyembunyikan gesaan anda daripada Anthropic. Permintaan masih meninggalkan pelayan anda dan dihantar kepada penyedia. Kelebihannya ialah anda mendapat kawalan terhadap kunci, perbelanjaan, penghalaan dan log.

Jalankan Claude Code pada VPS anda sendiri

Hasrat ketiga paling mudah dipenuhi. Claude Code ialah klien. Ia berjalan di mana-mana anda memasang Node.js dan berkomunikasi dengan API melalui HTTPS. Memasangnya pada pelayan yang anda miliki membolehkan ejen terus berfungsi selepas anda mematikan komputer riba. Ini juga mengehadkan kesan jika ejen terjejas kepada satu sistem yang boleh anda bina semula, bukan komputer utama anda.

npm install -g @anthropic-ai/claude-code
claude --version

Jalankan ia dalam tmux supaya sambungan SSH yang terputus tidak menghentikan tugas yang mengambil masa lama. Persediaan ini, termasuk pengendalian sesi, diterangkan dalam menjalankan Claude Code pada VPS dengan tmux. Berikan ejen akaun pengguna tanpa keistimewaan sendiri. Baca peraturan keselamatan untuk menjalankan Claude Code pada pelayan sebelum memberikan akses tulis kepada apa-apa yang penting bagi anda.

Ini ialah pengehosan sendiri bagi ejen, bukan model. Perkara ini perlu dijelaskan kerana kedua-duanya sering disamakan. Anda memiliki proses, sistem fail, egress rangkaian dan log. Anthropic masih memiliki inferens.

Kos sebenar setiap pilihan

Harga berubah, jadi anggap angka ini sebagai gambaran, bukan sebut harga. Setakat Julai 2026, Claude Sonnet 5 berharga $3 bagi setiap juta token input dan $15 bagi setiap juta token output, manakala Claude Opus 5 berharga $5 dan $25. Model tempatan tidak mengenakan kos bagi setiap token. Sebaliknya, kosnya ialah harga pelayan setiap bulan, sama ada anda menggunakannya atau tidak.

Titik pulang modal lebih rendah daripada jangkaan ramai orang. VPS dengan memori yang mencukupi untuk menjalankan model terbuka yang berguna memerlukan kos sebenar setiap bulan, dan kebanyakannya tidak digunakan. Jika penggunaan anda berlaku secara berkala dan tidak tetap, API terhos biasanya lebih murah. Jika penggunaan anda berterusan, atau data anda tidak boleh meninggalkan rangkaian, model tempatan lebih berbaloi dalam kedua-dua aspek.

Jawapan campuran yang paling praktikal ialah pilihan kebanyakan pasukan. Jalankan model terbuka secara tempatan untuk tugas bervolum tinggi dan berkesukaran rendah. Halakan permintaan sukar kepada model frontier terhos. Letakkan gateway di hadapan kedua-duanya supaya aplikasi tidak perlu mengetahui perbezaannya dan supaya anda boleh mengubah pembahagian tugas tanpa mengubah kod aplikasi. Seni bina ini ialah versi praktikal "Claude dihos sendiri", dan tidak seperti versi literalnya, seni bina ini wujud. Jika anda juga mahu menjalankan keseluruhan susunan ejen sendiri, ringkasan ejen AI yang dihos sendiri menerangkan pilihan yang tersedia.

FAQ

Bolehkah saya memuat turun pemberat model Claude dan menjalankannya secara setempat?

Tidak. Anthropic tidak pernah mengeluarkan pemberat bagi mana-mana model Claude, dan tiada lesen yang membenarkan pengehosan sendiri. Apa-apa yang diiklankan dalam talian sebagai "model Claude" yang boleh dimuat turun sama ada model lain dengan nama yang mengelirukan atau pembalut yang memanggil API. Jika ia memerlukan kunci API, ia bukan model setempat.

Apakah model terbuka yang paling hampir dengan Claude?

Tiada padanan tepat, dan model terkemuka berubah setiap beberapa bulan. Keluarga pemberat terbuka yang wajar diuji ialah Llama, Qwen, Mistral, Gemma dan DeepSeek. Untuk membuat ringkasan, pengelasan dan pengeditan kod mudah, model terbuka yang baik dengan 8 hingga 14 bilion parameter sememangnya berguna. Untuk penaakulan berbilang langkah yang panjang dan penggunaan alat oleh ejen, jurang dengan model termaju yang dihoskan masih besar. Uji model menggunakan gesaan anda sendiri dan jangan hanya bergantung pada papan pendahulu.

Adakah LiteLLM ialah OpenRouter yang dihoskan sendiri?

Dari segi fungsi, ya, untuk bahagian penghalaan dan pengurusan kunci. LiteLLM berjalan pada pelayan anda, menyediakan satu titik akhir yang serasi dengan OpenAI dan memproksi kepada Anthropic, Ollama serta kebanyakan penyedia lain. Anda mendapat had perbelanjaan bagi setiap kunci, penghalaan model dan satu tempat untuk membaca log. Namun, ia tidak menyediakan inferens setempat: permintaan kepada Claude masih dihantar kepada Anthropic.

Adakah menjalankan Claude Code pada pelayan saya sendiri memastikan kod saya kekal sulit?

Tidak. Claude Code menghantar kandungan fail yang dibacanya kepada API Anthropic, tanpa mengira tempat proses itu dijalankan. VPS memberikan pengasingan ejen, bukan privasi kandungan. Berikan ejen itu pengguna khusus tanpa keistimewaan, jauhkan daripada bukti kelayakan dan repositori yang tidak berkaitan, serta anggap semua yang boleh dibacanya sebagai kandungan yang meninggalkan pelayan.