SSD Nodes Learn Hosting plans →
Guias Matt ConnorPor Matt Connor · Atualizado 2026-08-24

É possível alojar o Claude por conta própria?

Os pesos do Claude não são públicos: nenhum servidor seu pode executá-lo. Veja o que pode alojar, com modelos abertos, gateway de API e Claude Code.

É possível alojar o Claude por conta própria? Não, e este é o motivo

Não é possível alojar o Claude por conta própria. A Anthropic não publica os pesos do modelo. Por isso, não existe um ficheiro para descarregar, um contentor para executar ou uma licença que permita servi-lo a partir do seu próprio hardware. Cada pedido ao Claude é enviado para a API da Anthropic ou para um parceiro alojado, como Amazon Bedrock, Google Vertex AI ou Microsoft Foundry. Executá-lo numa máquina sua não é um problema de configuração. O artefacto simplesmente não existe fora da Anthropic.

Essa é a resposta curta. A resposta mais completa é que a maioria das pessoas que faz esta pergunta não quer realmente os pesos. Quer uma de três coisas, todas possíveis num servidor sob o seu controlo: um modelo capaz a ser executado localmente, um gateway que armazene as suas chaves de API e limite os custos, ou um agente de programação que funcione no seu próprio servidor em vez de no portátil. Este guia aborda as três opções, com os comandos.

O que normalmente significa "Claude auto-hospedado"

As pesquisas por "Claude auto-hospedado" correspondem a vários objetivos diferentes, e cada um exige uma resposta própria.

Algumas pessoas querem privacidade. Não querem que os prompts saiam da sua rede. Apenas um modelo local de pesos abertos resolve esse problema, porque qualquer pedido ao Claude é, por definição, um pedido à Anthropic.

Algumas pessoas querem controlar os custos. Preocupam-se com um agente descontrolado a consumir créditos rapidamente. Um gateway resolve esse problema e funciona com o Claude, permitindo manter a qualidade do modelo.

Algumas pessoas querem deixar de depender de um portátil. Querem um agente que continue a trabalhar enquanto fecham a tampa. Um VPS resolve esse problema, e o Claude Code funciona nele sem problemas.

Algumas pessoas procuram um "OpenRouter auto-hospedado". Isso também é um gateway, e a resposta habitual é o LiteLLM.

Identifique qual destes casos se aplica a si, porque a implementação correta é diferente em cada situação.

Alojar um modelo aberto com Ollama

Se for necessário que nenhum prompt saia do seu servidor, execute um modelo de pesos abertos. As famílias que são realmente utilizáveis hoje num servidor alugado são Llama, Qwen, Mistral, Gemma e DeepSeek. Todas disponibilizam pesos que pode descarregar e executar.

Ollama é a forma mais rápida de começar. O script de instalação é uma única linha e configura um serviço systemd no Ubuntu.

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama

systemctl status ollama deve apresentar active (running). Em seguida, descarregue um modelo e interaja com ele.

ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."

O primeiro pull descarrega vários gigabytes, por isso o modelo tem de caber na RAM ou na memória da GPU antes de poder responder. Uma regra aproximada para modelos quantizados: um modelo com 8 mil milhões de parâmetros precisa de cerca de 6 GB livres, um modelo com 14 mil milhões precisa de cerca de 10 GB, e um modelo com 70 mil milhões precisa de mais memória do que a maioria dos planos VPS de uso geral disponibiliza. Se o servidor tiver pouca memória, o processo é terminado pelo kernel e verá Error: llama runner process has terminated, com uma linha de falta de memória em dmesg. Consulte free -h antes de atribuir o problema ao modelo. Esse mesmo limite de memória também determina quanto de um prompt longo o modelo lê efetivamente, porque Ollama trunca silenciosamente tudo o que ultrapassa uma janela predefinida relativamente pequena. Por isso, aumentar num_ctx e dimensionar a cache KV é a primeira verificação a fazer quando documentos longos são resumidos apenas pela metade.

Ollama também disponibiliza uma API HTTP em 127.0.0.1:11434, o que o torna útil para outros programas, e não apenas para conversas.

curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'

Se o primeiro pedido depois de um período sem atividade demorar trinta segundos e o seguinte responder imediatamente, não há nenhuma falha: Ollama descarrega o modelo após cinco minutos de inatividade, e mantê-lo residente com keep_alive elimina esse tempo adicional de carregamento.

Mantenha essa porta associada a localhost. Uma porta Ollama aberta num IP público fornece uma GPU gratuita a qualquer pessoa que a encontre. A configuração completa, incluindo a unidade systemd, a deteção da GPU e a colocação de um reverse proxy à frente, é apresentada no guia para executar Ollama num VPS. Se servir mais do que um utilizador ao mesmo tempo, leia primeiro a comparação entre Ollama e vLLM, porque o desenho de fluxo único do Ollama se torna o gargalo muito antes de o hardware atingir o limite.

Seja realista quanto à diferença. Um bom modelo aberto num VPS de capacidade média é realmente útil para resumir, classificar, redigir e fazer extrações simples. Em raciocínio longo com várias etapas, em bases de código grandes e no uso de ferramentas por agentes, não se aproxima de um modelo de fronteira alojado, e nenhuma quantidade de ajuste de prompts elimina essa diferença. Escolha o modelo local para as tarefas em que é bom e pague pelo modelo alojado quando a dificuldade for real.

Execute o seu próprio gateway com LiteLLM

Este é o "OpenRouter autoalojado" que muitas pessoas procuram. Um gateway fica entre as suas aplicações e cada fornecedor de modelos. As suas aplicações usam uma única chave, apontada para o seu servidor. As chaves reais dos fornecedores ficam apenas nesse servidor. Pode limitar a despesa por chave, encaminhar aplicações diferentes para modelos diferentes e registar todos os pedidos num único local.

LiteLLM é a escolha habitual porque disponibiliza uma API compatível com OpenAI e funciona como proxy para Anthropic, Ollama e a maioria dos outros fornecedores através do mesmo endpoint. Execute-o no Docker com um ficheiro de configuração.

model_list:
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local
    litellm_params:
      model: ollama/qwen3:8b
      api_base: http://127.0.0.1:11434

Guarde isso como litellm_config.yaml e inicie o proxy. Ele escuta na porta 4000.

docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
  -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
  -e LITELLM_MASTER_KEY=sk-1234 \
  -p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
  --config /app/config.yaml

LITELLM_MASTER_KEY é a credencial de administração. Trate-a como uma palavra-passe de root e não utilize o valor de exemplo em produção. Chame o proxy exatamente como chamaria uma API alojada.

curl http://localhost:4000/v1/chat/completions \
  -H 'Authorization: Bearer sk-1234' \
  -H 'Content-Type: application/json' \
  -d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'

Uma resposta normal indica que o serviço está saudável e contém um JSON válido com um array choices. Um 401 significa que o cabeçalho Authorization não corresponde à sua chave principal. Um 400 que identifica o modelo significa que model no seu pedido não corresponde a nenhum model_name no ficheiro de configuração.

A razão para criar isto em vez de chamar diretamente a Anthropic é o limite de despesa. Emita uma chave virtual separada para cada aplicação, com o seu próprio orçamento.

curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'

Essa chave pode gastar cem dólares e aceder a um modelo, sem acesso a mais nada. Quando um agente se comporta de forma inesperada às três da manhã, o impacto fica limitado a uma chave, em vez de afetar toda a sua conta. Esse padrão, juntamente com a monitorização associada, é explicado em manter os custos de agentes sob controlo num VPS. Se ainda está a decidir se deve pagar por token, a comparação de custos entre a API e a subscrição explica os cálculos.

Tenha em atenção o que o gateway não faz. Ele não torna o Claude local e não oculta os seus prompts da Anthropic. Os pedidos continuam a sair do seu servidor para o fornecedor. O que obtém é controlo sobre as chaves, a despesa, o encaminhamento e os logs.

Executar o Claude Code no seu próprio VPS

O terceiro desejo é o mais fácil de realizar. O Claude Code é um cliente. É executado onde instalar o Node.js e comunica com a API por HTTPS. Instalá-lo num servidor que controla significa que o agente continua a trabalhar depois de desligar o portátil. Também significa que o impacto de um comprometimento fica limitado a um sistema que pode reconstruir, em vez de afetar a sua máquina principal.

npm install -g @anthropic-ai/claude-code
claude --version

Execute-o dentro de tmux para que uma ligação SSH interrompida não termine um trabalho longo. Essa configuração, incluindo a gestão da sessão, é abordada em executar o Claude Code num VPS com tmux. Dê ao agente o seu próprio utilizador sem privilégios. Leia também as regras de segurança para executar o Claude Code num servidor antes de lhe conceder acesso de escrita a dados importantes.

Isto é alojar o agente por conta própria, não o modelo. É importante ser preciso sobre isso, porque estas duas coisas são frequentemente confundidas. Você controla o processo, o sistema de ficheiros, o tráfego de saída da rede e os logs. A Anthropic continua a controlar a inferência.

O custo real de cada opção

Os preços variam, por isso considere estes valores como uma referência de proporções, não como uma cotação. Em julho de 2026, o Claude Sonnet 5 custa $3 por milhão de tokens de entrada e $15 por milhão de tokens de saída. O Claude Opus 5 custa $5 e $25, respetivamente. Um modelo local não tem custo por token. Em vez disso, o custo corresponde ao preço mensal do servidor, que continua a ser cobrado mesmo quando não o utiliza.

O ponto de equilíbrio é mais baixo do que muitas pessoas esperam. Uma VPS com memória suficiente para executar um modelo aberto útil custa dinheiro todos os meses e fica inativa durante a maior parte do tempo. Se o uso for irregular, a API alojada costuma ser mais barata. Se o uso for constante ou se os seus dados não puderem sair da rede, o modelo local vence nos dois critérios.

A resposta mista é a opção mais comum entre as equipas. Execute localmente um modelo aberto para tarefas de grande volume e baixa dificuldade. Encaminhe os pedidos complexos para um modelo frontier alojado. Coloque um gateway à frente dos dois para que as aplicações não precisem de saber qual modelo está a ser utilizado e para poder alterar a divisão entre eles sem modificar o código da aplicação. Essa arquitetura é a versão prática de "self hosted Claude" e, ao contrário da versão literal, existe. Se também quiser executar toda a stack de agentes localmente, o resumo dos agentes de IA self-hosted apresenta as opções disponíveis.

FAQ

Posso descarregar os pesos dos modelos Claude e executá-los localmente?

Não. A Anthropic nunca disponibilizou os pesos de nenhum modelo Claude e não existe uma licença que permita alojá-los por conta própria. Tudo o que é anunciado online como um "modelo Claude" descarregável é outro modelo com um nome enganador ou um wrapper que chama a API. Se precisar de uma chave de API, não é local.

Qual é o modelo aberto mais próximo do Claude?

Não existe uma correspondência exata, e os líderes mudam a cada poucos meses. As famílias de pesos abertos que vale a pena testar são Llama, Qwen, Mistral, Gemma e DeepSeek. Para resumir, classificar e fazer edições simples de código, um bom modelo aberto com 8 a 14 mil milhões de parâmetros é realmente útil. Em raciocínio longo com várias etapas e utilização agentic de ferramentas, a diferença para um modelo de fronteira alojado continua a ser grande. Teste com os seus próprios prompts em vez de confiar num leaderboard.

O LiteLLM é um OpenRouter alojado por conta própria?

Funcionalmente, sim, no que diz respeito ao encaminhamento e à gestão de chaves. O LiteLLM é executado no seu servidor, disponibiliza um endpoint compatível com OpenAI e funciona como proxy para Anthropic, Ollama e a maioria dos outros fornecedores. Obtém limites de gastos por chave, encaminhamento de modelos e um único local para consultar os logs. O que não obtém é inferência local: os pedidos para o Claude continuam a ser enviados para a Anthropic.

Executar o Claude Code no meu próprio servidor mantém o meu código privado?

Não. O Claude Code envia para a API da Anthropic o conteúdo dos ficheiros que lê, independentemente do local onde o processo esteja a ser executado. Um VPS fornece isolamento do agente, não privacidade do conteúdo. Dê-lhe um utilizador dedicado sem privilégios, impeça o acesso a credenciais e a repositórios não relacionados e trate tudo o que ele consegue ler como conteúdo que sai do servidor.