Claude 可以自行託管嗎?答案是不行,替代方案看這裡
Claude 不公開模型權重,因此無法在自有伺服器執行。本文說明可自行託管的開放模型、LiteLLM gateway,以及可部署在 VPS 的 Claude Code。
可以自行託管 Claude 嗎?不行,原因如下
您無法自行託管 Claude。Anthropic 不會發布模型權重,因此沒有可下載的檔案、可執行的容器,也沒有允許您在自有硬體上提供服務的授權。每個 Claude 請求都會傳送至 Anthropic 的 API,或 Amazon Bedrock、Google Vertex AI、Microsoft Foundry 等託管合作夥伴。要在您擁有的機器上執行 Claude,不是設定問題。Anthropic 之外根本不存在相應的模型成品。
簡短答案就是這樣。更完整地說,提出這個問題的大多數人其實不需要模型權重。他們需要的是以下三者之一,而且都能在您控制的伺服器上實現:在本機執行的高能力模型、代為保存 API keys 並限制支出的 gateway,或是安裝在自有主機上而非筆記型電腦上的 coding agent。本指南將使用相關命令,說明這三種方案。
「self-hosted Claude」通常代表的意思
搜尋「self hosted Claude」的使用者通常有幾種不同需求,而每種需求都需要不同的解決方案。
有些人重視隱私。他們不希望提示離開自己的網路。只有本機開放權重模型能解決這個問題,因為任何 Claude 要求本質上都是傳送至 Anthropic 的要求。
有些人希望控制成本。他們擔心失控的代理程式耗盡額度。Gateway 可以解決這個問題,而且能搭配 Claude 使用,因此可以保留模型品質。
有些人希望不受筆記型電腦限制。他們希望在闔上螢幕後,代理程式仍能持續運作。VPS 可以解決這個問題,Claude Code 也能在上面正常執行。
有些人搜尋的是「self hosted OpenRouter」。這同樣屬於 Gateway,通常的答案是 LiteLLM。
先確認自己屬於哪一種需求,因為每種情況適合的建置方式都不同。
使用 Ollama 自行託管開放模型
如果要求任何提示都不能離開伺服器,請執行開放權重模型。目前在租用伺服器上實際可用的模型系列包括 Llama、Qwen、Mistral、Gemma 和 DeepSeek。這些模型都提供可下載並執行的權重。
Ollama 是最快的入門方式。安裝指令只有一行,並會在 Ubuntu 上設定 systemd 服務。
curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollamasystemctl status ollama 應輸出 active (running)。接著下載模型並與模型互動。
ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."第一次執行 pull 時會下載數 GB 的資料,因此模型必須先能裝入 RAM 或 GPU 記憶體,才能回答任何問題。量化模型可使用以下概略規則:8 billion parameter 模型約需 6 GB 可用記憶體,14 billion parameter 模型約需 10 GB,而 70 billion parameter 模型所需記憶體通常超過多數一般用途 VPS 方案的容量。如果伺服器記憶體不足,核心會終止該程序,並顯示 Error: llama runner process has terminated;dmesg 中也會有 out of memory 記錄。責怪模型之前,先檢查 free -h。
Ollama 也會在 127.0.0.1:11434 提供 HTTP API,因此其他軟體可以使用它,而不只是將它當成聊天工具。
curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'請讓該連接埠僅繫結至 localhost。在公用 IP 上開放 Ollama 連接埠,等同於為任何找到它的人提供免費 GPU。完整設定方式包括 systemd 單元、GPU 偵測,以及在前方設定反向 Proxy,請參閱在 VPS 上執行 Ollama 的指南。如果要同時服務多位使用者,請先閱讀Ollama 與 vLLM 的比較,因為 Ollama 的單一串流設計,會早於硬體成為瓶頸。
請如實看待差距。 在中階 VPS 上執行的優質開放模型,確實適合摘要、分類、草擬和簡單擷取。對於長篇多步驟推理、大型程式碼庫,以及代理式工具使用,它與前沿託管模型仍有明顯差距,任何提示調校都無法消除這項差距。請根據本機模型擅長的工作選擇它;遇到真正困難的工作,則付費使用託管模型。
使用 LiteLLM 執行自己的閘道
這就是許多人正在尋找的「自行託管 OpenRouter」。閘道位於您的應用程式與所有模型供應商之間。您的應用程式只需持有一組指向您伺服器的金鑰。實際的供應商金鑰只會儲存在該伺服器上。您可以限制每組金鑰的支出、將不同應用程式路由至不同模型,並在單一位置記錄每個請求。
LiteLLM 是常見選擇,因為它提供與 OpenAI 相容的 API,並可透過相同端點代理 Anthropic、Ollama 及大多數其他供應商。請使用設定檔在 Docker 中執行。
model_list:
- model_name: claude
litellm_params:
model: anthropic/claude-sonnet-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: local
litellm_params:
model: ollama/qwen3:8b
api_base: http://127.0.0.1:11434將內容儲存為 litellm_config.yaml,然後啟動 proxy。它會監聽 port 4000。
docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
-e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
-e LITELLM_MASTER_KEY=sk-1234 \
-p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
--config /app/config.yamlLITELLM_MASTER_KEY 是管理員憑證,因此請像處理 root 密碼一樣妥善保護,且不要使用範例值正式部署。呼叫 proxy 的方式與呼叫託管 API 完全相同。
curl http://localhost:4000/v1/chat/completions \
-H 'Authorization: Bearer sk-1234' \
-H 'Content-Type: application/json' \
-d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'正常回應會是包含 choices 陣列的標準 JSON。401 表示 Authorization 標頭與您的主金鑰不相符。顯示模型名稱的 400 表示請求中的 model 與設定檔中的任何 model_name 都不相符。
建立這個閘道而不是直接呼叫 Anthropic 的原因,是為了限制支出。請為每個應用程式建立個別的虛擬金鑰,並為每組金鑰設定自己的預算。
curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'該金鑰最多可支出一百美元,並只能存取一個模型。其他資源一律無法存取。當代理程式在凌晨三點發生異常時,影響範圍只會是一組金鑰,而不是整個帳戶。這種模式及其監控方式,是 在 VPS 上控制代理程式成本 的主題。如果您仍在考慮是否要按 token 付費,API 與訂閱方案的成本比較 會逐步說明相關計算。
請注意閘道不會做什麼。它不會讓 Claude 在本機執行,也不會阻止 Anthropic 取得您的提示。請求仍會離開您的伺服器並傳送至供應商。您獲得的是對金鑰、支出、路由和記錄的控制權。
在自己的 VPS 上執行 Claude Code
第三個願望最容易實現。Claude Code 是用戶端。只要安裝 Node.js,就能在該環境中執行,並透過 HTTPS 與 API 通訊。將它部署在您擁有的伺服器上,表示即使關閉筆記型電腦,代理程式仍會繼續工作;此外,代理程式造成的影響範圍也會限制在可重建的主機,而不是您的主要電腦。
npm install -g @anthropic-ai/claude-code
claude --version請在 tmux 中執行它,這樣 SSH 連線中斷時,不會終止長時間執行的工作。相關設定(包括工作階段處理)請參閱 在 VPS 上使用 tmux 執行 Claude Code。請為代理程式建立專用的非特權使用者,並在授予它對任何重要資料的寫入權限前,閱讀 在伺服器上執行 Claude Code 的安全規則。
這是自行代管代理程式,而不是自行代管模型。這一點需要明確區分,因為人們常將兩者混為一談。您擁有該程序、檔案系統、網路輸出流量及日誌的控制權。推論服務仍由 Anthropic 提供。
每個選項實際需要付出的成本
價格會變動,因此請將以下內容視為費用概況,而非報價。截至 2026 年 7 月,Claude Sonnet 5 的輸入 token 費用為每百萬個 $3,輸出 token 費用為每百萬個 $15;Claude Opus 5 則為 $5 和 $25。Local model 不收取每個 token 的費用,但您仍須支付伺服器每月的成本,無論是否使用該伺服器,費用都會持續產生。
損益平衡點比一般預期更低。具備足夠記憶體以執行實用 open model 的 VPS,每月都需要實際支付費用,而且大多數時間處於閒置狀態。如果您的使用量有尖峰,hosted API 通常較便宜。如果使用量持續穩定,或資料不得離開您的網路,local model 在這兩方面通常都更具優勢。
多數團隊最後採用的方案,都是務實的混合模式。在本機執行 open model,處理高流量、低難度的工作。將困難的請求轉送至 hosted frontier model。在兩者前方加入 gateway,讓應用程式不必知道請求使用哪個模型,也能在不修改應用程式程式碼的情況下調整兩者的分工界線。這種架構是「self hosted Claude」的實際做法;不同於字面上的版本,它確實存在。如果您也想自行執行整個 agent stack,自架 AI agents 的整理 介紹了目前可用的選項。
FAQ
我可以下載 Claude 的模型權重並在本機執行嗎?
不可以。Anthropic 從未發布任何 Claude 模型的權重,也沒有允許自行託管的授權。網路上任何宣稱可下載的「Claude 模型」,不是使用誤導性名稱的其他模型,就是會呼叫 API 的包裝程式。如果它需要 API key,就不是本機執行。
最接近 Claude 的開放模型是哪一個?
沒有完全相同的模型,而且領先者每隔幾個月就會變動。值得測試的開放權重模型系列包括 Llama、Qwen、Mistral、Gemma 和 DeepSeek。在摘要、分類和簡單程式碼編輯方面,具備 8 到 14 billion parameters 的優質開放模型確實很有用。在長篇多步驟推理和代理式工具使用方面,與代管的 frontier model 仍有很大差距。請使用自己的提示進行測試,不要只相信排行榜。
LiteLLM 算是自行託管的 OpenRouter 嗎?
就路由和金鑰管理而言,功能上是。LiteLLM 在你的伺服器上執行,提供單一 OpenAI 相容端點,並代理至 Anthropic、Ollama 和大多數其他提供者。你可以設定每個金鑰的支出上限、模型路由,並在單一位置查看日誌。但它不會提供本機推論:傳送至 Claude 的要求仍會經過網路傳送至 Anthropic。
在自己的伺服器上執行 Claude Code,能讓我的程式碼保持私密嗎?
不能。Claude Code 會將讀取到的檔案內容傳送至 Anthropic API,無論該程序實際在哪裡執行。VPS 提供的是代理程式隔離,而不是內容隱私。請為它建立專用的非特權使用者,避免它存取認證資料和無關的儲存庫,並將它能讀取的所有內容視為會離開該伺服器的資料。