SSD Nodes Learn 8GB de RAM — $66/ano
Guias Matt ConnorPor Matt Connor · Atualizado 2026-08-02

É possível hospedar o Claude por conta própria?

Não há pesos públicos do Claude: nenhum servidor seu pode executá-lo. Veja alternativas auto-hospedadas, como modelos abertos, gateway de API e Claude Code.

É possível hospedar o Claude por conta própria? Não, e este é o motivo

Você não pode hospedar o Claude por conta própria. A Anthropic não publica os pesos do modelo. Portanto, não existe um arquivo para baixar, um container para executar ou uma licença que permita disponibilizá-lo no seu próprio hardware. Toda solicitação ao Claude é enviada para a API da Anthropic ou para um parceiro hospedado, como Amazon Bedrock, Google Vertex AI ou Microsoft Foundry. Executá-lo em uma máquina que você possui não é um problema de configuração. O artefato simplesmente não existe fora da Anthropic.

Essa é a resposta curta. A resposta mais completa é que a maioria das pessoas que fazem essa pergunta não quer realmente os pesos. Elas querem uma destas três coisas, todas viáveis em um servidor sob seu controle: um modelo capaz executado localmente, um gateway que armazene suas chaves de API e limite seus gastos, ou um agente de programação que fique no próprio servidor, em vez de no laptop. Este guia aborda as três opções, com os comandos.

O que normalmente significa "Claude auto-hospedado"

O tráfego de buscas por "Claude auto-hospedado" representa alguns objetivos diferentes, e cada um exige uma resposta distinta.

Algumas pessoas querem privacidade. Elas não querem que os prompts saiam da rede. Somente um modelo local de pesos abertos resolve isso, porque qualquer solicitação ao Claude é, por definição, uma solicitação à Anthropic.

Algumas pessoas querem controlar os custos. Elas temem que um agente descontrolado consuma créditos rapidamente. Um gateway resolve esse problema e funciona com o Claude, para que você mantenha a qualidade do modelo.

Algumas pessoas querem independência de um laptop. Elas querem um agente que continue funcionando enquanto fecham a tampa. Uma VPS resolve isso, e o Claude Code funciona nela sem problemas.

Algumas pessoas usam a expressão "OpenRouter auto-hospedado". Isso também é um gateway, e a resposta usual é o LiteLLM.

Identifique em qual caso você se enquadra, porque a configuração adequada é diferente em cada situação.

Hospede um modelo aberto com Ollama

Se o requisito for que nenhum prompt saia do seu servidor, execute um modelo com pesos abertos. As famílias que são realmente utilizáveis hoje em um servidor alugado são Llama, Qwen, Mistral, Gemma e DeepSeek. Todas publicam pesos que você pode baixar e executar.

Ollama é a forma mais rápida de começar. O script de instalação é uma única linha e configura um serviço systemd no Ubuntu.

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama

systemctl status ollama deve exibir active (running). Em seguida, baixe um modelo e interaja com ele.

ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."

O primeiro pull baixa vários gigabytes, portanto o modelo precisa caber na RAM ou na memória da GPU antes de responder. Uma regra aproximada para modelos quantizados: um modelo com 8 bilhões de parâmetros precisa de cerca de 6 GB livres, um modelo com 14 bilhões de parâmetros precisa de cerca de 10 GB, e um modelo com 70 bilhões de parâmetros precisa de mais memória do que a maioria dos planos de VPS de uso geral oferece. Se o servidor tiver pouca memória, o processo será encerrado pelo kernel e você verá Error: llama runner process has terminated, com uma linha de falta de memória em dmesg. Verifique free -h antes de culpar o modelo.

Ollama também fornece uma API HTTP em 127.0.0.1:11434, o que permite que outros softwares a utilizem, em vez de servir apenas como um brinquedo de chat.

curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'

Mantenha essa porta vinculada a localhost. Uma porta do Ollama aberta em um IP público fornece uma GPU gratuita para qualquer pessoa que a encontre. A configuração completa, incluindo a unidade systemd, a detecção da GPU e a colocação de um proxy reverso na frente, está descrita em o guia para executar Ollama em um VPS. Se você atender mais de um usuário ao mesmo tempo, leia primeiro a comparação entre Ollama e vLLM, pois o design de fluxo único do Ollama se torna o gargalo muito antes de o hardware atingir seu limite.

Seja honesto sobre a diferença. Um bom modelo aberto em um VPS de porte médio é realmente útil para resumir, classificar, redigir e fazer extrações simples. Em tarefas longas de raciocínio em várias etapas, em bases de código grandes e no uso agentivo de ferramentas, ele não se aproxima de um modelo hospedado de ponta, e nenhuma quantidade de ajuste de prompt elimina essa diferença. Escolha o modelo local para as tarefas em que ele é bom e pague pelo modelo hospedado quando a dificuldade for real.

Execute seu próprio gateway com LiteLLM

Este é o "OpenRouter auto-hospedado" que as pessoas procuram. Um gateway fica entre seus aplicativos e cada provedor de modelos. Seus aplicativos usam uma única chave, apontada para o seu servidor. As chaves reais dos provedores ficam somente nesse servidor. Você pode limitar os gastos por chave, encaminhar aplicativos diferentes para modelos diferentes e registrar todas as solicitações em um único lugar.

LiteLLM é a escolha comum porque oferece uma API compatível com OpenAI e atua como proxy para Anthropic, Ollama e a maioria dos outros provedores pelo mesmo endpoint. Execute-o no Docker com um arquivo de configuração.

model_list:
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local
    litellm_params:
      model: ollama/qwen3:8b
      api_base: http://127.0.0.1:11434

Salve isso como litellm_config.yaml e inicie o proxy. Ele escuta na porta 4000.

docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
  -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
  -e LITELLM_MASTER_KEY=sk-1234 \
  -p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
  --config /app/config.yaml

LITELLM_MASTER_KEY é a credencial de administrador. Trate-a como uma senha de root e não use o valor de exemplo em produção. Chame o proxy exatamente como chamaria uma API hospedada.

curl http://localhost:4000/v1/chat/completions \
  -H 'Authorization: Bearer sk-1234' \
  -H 'Content-Type: application/json' \
  -d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'

Uma resposta saudável é um JSON normal com um array choices. Um 401 indica que o cabeçalho Authorization não corresponde à sua chave mestra. Um 400 que identifica o modelo indica que o model na sua solicitação não corresponde a nenhum model_name no arquivo de configuração.

O motivo para criar isso em vez de chamar a Anthropic diretamente é o limite de gastos. Emita uma chave virtual separada para cada aplicativo, cada uma com seu próprio orçamento.

curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'

Essa chave pode gastar cem dólares e acessar um modelo, e nada mais. Quando um agente se comporta mal às três da manhã, o impacto fica limitado a uma chave, em vez de afetar toda a sua conta. Esse padrão, junto com o monitoramento associado, é o tema de manter os custos de agentes sob controle em um VPS. Se você ainda está decidindo se vale a pena pagar por token, a comparação de custos entre API e assinatura apresenta os cálculos.

Observe o que o gateway não faz. Ele não torna o Claude local e não oculta seus prompts da Anthropic. As solicitações ainda saem do seu servidor e chegam ao provedor. O que você obtém é controle sobre chaves, gastos, encaminhamento e logs.

Execute o Claude Code no seu próprio VPS

O terceiro desejo é o mais fácil de atender. Claude Code é um cliente. Ele é executado onde você instalar Node.js e se comunica com a API por HTTPS. Instalá-lo em um servidor que você controla permite que o agente continue trabalhando depois que você desligar o laptop. Também limita o raio de impacto do agente a uma máquina que você pode recriar, em vez de afetar sua máquina principal.

npm install -g @anthropic-ai/claude-code
claude --version

Execute-o dentro de tmux para que uma conexão SSH interrompida não encerre um trabalho longo. Essa configuração, incluindo o gerenciamento da sessão, é abordada em como executar o Claude Code em um VPS com tmux. Dê ao agente um usuário próprio sem privilégios. Leia também as regras de segurança para executar o Claude Code em um servidor antes de conceder acesso de escrita a qualquer dado importante.

Isso é hospedar o agente por conta própria, não o modelo. É importante ser preciso nesse ponto, porque as pessoas costumam confundir os dois. Você controla o processo, o sistema de arquivos, o tráfego de saída da rede e os logs. A Anthropic ainda controla a inferência.

Quanto cada opção realmente custa

Os preços variam, portanto use estes valores como referência, não como cotação. Em julho de 2026, o Claude Sonnet 5 custa $3 por milhão de tokens de entrada e $15 por milhão de tokens de saída. O Claude Opus 5 custa $5 e $25, respectivamente. Um modelo local não tem custo por token. Em vez disso, você paga o custo mensal do servidor, que continua funcionando mesmo quando não é usado.

O ponto de equilíbrio é mais baixo do que muitos esperam. Uma VPS com memória suficiente para executar um modelo aberto útil custa dinheiro todos os meses e fica ociosa na maior parte do tempo. Se o seu uso ocorrer em picos, a API hospedada geralmente será mais barata. Se o uso for constante ou se os seus dados não puderem sair da rede, o modelo local será melhor nos dois aspectos.

A resposta mista é a que a maioria das equipes acaba adotando. Execute um modelo aberto localmente para o trabalho de alto volume e baixa dificuldade. Encaminhe as solicitações difíceis para um modelo de fronteira hospedado. Coloque um gateway na frente dos dois para que as aplicações não precisem saber qual modelo está sendo usado e para que você possa alterar a divisão entre eles sem modificar o código da aplicação. Essa arquitetura é a versão prática de "Claude auto-hospedado" e, ao contrário da versão literal, ela existe. Se você também quiser executar toda a pilha de agentes por conta própria, o resumo dos agentes de IA auto-hospedados apresenta as opções disponíveis.

FAQ

Posso baixar os pesos do modelo Claude e executá-los localmente?

Não. A Anthropic nunca lançou os pesos de nenhum modelo Claude, e não existe uma licença que permita a hospedagem própria. Qualquer coisa anunciada online como um "modelo Claude" baixável é outro modelo com um nome enganoso ou um wrapper que chama a API. Se precisa de uma chave de API, não é local.

Qual é o modelo aberto mais próximo do Claude?

Não existe uma correspondência exata, e os líderes mudam a cada poucos meses. As famílias de pesos abertos que vale a pena testar são Llama, Qwen, Mistral, Gemma e DeepSeek. Para sumarização, classificação e edições simples de código, um bom modelo aberto com 8 a 14 bilhões de parâmetros é realmente útil. Em raciocínio de várias etapas e uso agentivo de ferramentas, a diferença em relação a um modelo de fronteira hospedado ainda é grande. Teste com seus próprios prompts em vez de confiar em um ranking.

O LiteLLM é um OpenRouter hospedado por você?

Funcionalmente, sim, na parte de roteamento e gerenciamento de chaves. O LiteLLM é executado no seu servidor, oferece um endpoint compatível com OpenAI e atua como proxy para Anthropic, Ollama e a maioria dos outros provedores. Você obtém limites de gastos por chave, roteamento de modelos e um único local para ler os logs. O que ele não oferece é inferência local: as solicitações ao Claude ainda passam pela Anthropic.

Executar o Claude Code no meu próprio servidor mantém meu código privado?

Não. O Claude Code envia à API da Anthropic o conteúdo dos arquivos que lê, independentemente de onde o processo esteja sendo executado. O que um VPS oferece é isolamento do agente, não privacidade do conteúdo. Dê a ele um usuário dedicado sem privilégios, mantenha-o afastado de credenciais e repositórios não relacionados e trate tudo o que ele puder ler como conteúdo que sai do servidor.