¿Puedes alojar Claude por tu cuenta? La respuesta real
No puedes ejecutar Claude en tu servidor: Anthropic no publica sus pesos. Descubre qué sí puedes alojar, desde modelos abiertos hasta un gateway y Claude Code.
¿Puedes alojar Claude por tu cuenta? No, y este es el motivo
No puedes alojar Claude por tu cuenta. Anthropic no publica los pesos del modelo, por lo que no existe ningún archivo que descargar, ningún contenedor que ejecutar ni ninguna licencia que permita servirlo desde tu propio hardware. Cada solicitud a Claude se envía a la API de Anthropic o a un socio con servicio alojado, como Amazon Bedrock, Google Vertex AI o Microsoft Foundry. Ejecutarlo en una máquina propia no es un problema de configuración. El artefacto simplemente no existe fuera de Anthropic.
Esa es la respuesta breve. La respuesta más extensa es que la mayoría de las personas que hacen esta pregunta en realidad no necesitan los pesos. Necesitan una de estas tres cosas, todas posibles en un servidor bajo su control: un modelo capaz que se ejecute localmente, una puerta de enlace que almacene sus claves de API y limite su gasto, o un agente de programación que funcione en su propio equipo en lugar de su portátil. Esta guía cubre las tres opciones, con los comandos.
Qué suele significar "Claude autohospedado"
El tráfico de búsqueda de "Claude autohospedado" refleja varias necesidades distintas, y cada una requiere una respuesta diferente.
Algunas personas buscan privacidad. No quieren que las indicaciones salgan de su red. Solo un modelo local de pesos abiertos resuelve esto, porque cualquier solicitud a Claude es, por definición, una solicitud a Anthropic.
Algunas personas buscan controlar los costos. Les preocupa que un agente descontrolado consuma todos los créditos. Una puerta de enlace resuelve ese problema y funciona con Claude, por lo que se conserva la calidad del modelo.
Algunas personas quieren independizarse de una laptop. Quieren un agente que siga funcionando mientras cierran la tapa. Una VPS resuelve ese problema, y Claude Code funciona correctamente en ella.
Algunas personas buscan la expresión "OpenRouter autohospedado". Eso también es una puerta de enlace, y la respuesta habitual es LiteLLM.
Determina cuál de estos casos es el tuyo, porque la implementación adecuada es diferente en cada uno.
Alojar un modelo abierto con Ollama
Si el requisito es que ningún prompt salga de su servidor, ejecute un modelo de pesos abiertos. Las familias que se pueden usar realmente hoy en un servidor alquilado son Llama, Qwen, Mistral, Gemma y DeepSeek. Todas publican pesos que puede descargar y ejecutar.
Ollama es la forma más rápida de empezar. El script de instalación ocupa una sola línea y configura un servicio de systemd en Ubuntu.
curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollamasystemctl status ollama debería mostrar active (running). Después, descargue un modelo y úselo.
ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."La primera ejecución de pull descarga varios gigabytes, por lo que el modelo debe caber en la RAM o en la memoria de la GPU antes de poder responder. Como regla aproximada para modelos cuantizados: un modelo de 8 billion parameters necesita unos 6 GB libres, uno de 14 billion parameters necesita unos 10 GB y uno de 70 billion parameters necesita más memoria de la que ofrecen la mayoría de los planes VPS de propósito general. Si el servidor no tiene suficiente memoria, el kernel termina el proceso y aparece Error: llama runner process has terminated, junto con una línea de falta de memoria en dmesg. Compruebe free -h antes de atribuir el problema al modelo.
Ollama también ofrece una API HTTP en 127.0.0.1:11434. Esto permite que otro software la use, en lugar de limitarla a un chat.
curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'Mantenga ese puerto enlazado a localhost. Un puerto de Ollama abierto en una IP pública proporciona una GPU gratuita a cualquiera que lo encuentre. La configuración completa, incluida la unidad de systemd, la detección de GPU y la colocación de un proxy inverso delante, se explica en la guía para ejecutar Ollama en un VPS. Si va a atender a más de un usuario a la vez, lea primero la comparación entre Ollama y vLLM, porque el diseño de un único flujo de Ollama se convierte en el cuello de botella mucho antes que el hardware.
Sea realista sobre la diferencia. Un buen modelo abierto en un VPS de tamaño medio resulta realmente útil para resumir, clasificar, redactar y realizar extracciones sencillas. En tareas de razonamiento con varios pasos, bases de código grandes y uso de herramientas por agentes, no se acerca a un modelo alojado de vanguardia, y ningún ajuste de prompts elimina esa diferencia. Elija el modelo local para las tareas que realiza bien y pague por el modelo alojado cuando la dificultad sea real.
Ejecute su propio gateway con LiteLLM
Este es el "OpenRouter autohospedado" que muchas personas buscan. Un gateway se sitúa entre sus aplicaciones y cada proveedor de modelos. Sus aplicaciones usan una sola clave, dirigida a su servidor. Las claves reales de los proveedores solo se almacenan en ese servidor. Puede limitar el gasto por clave, dirigir distintas aplicaciones a modelos diferentes y registrar todas las solicitudes en un solo lugar.
LiteLLM es la opción habitual porque ofrece una API compatible con OpenAI y actúa como proxy para Anthropic, Ollama y la mayoría de los demás proveedores mediante el mismo endpoint. Ejecútelo en Docker con un archivo de configuración.
model_list:
- model_name: claude
litellm_params:
model: anthropic/claude-sonnet-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: local
litellm_params:
model: ollama/qwen3:8b
api_base: http://127.0.0.1:11434Guarde eso como litellm_config.yaml e inicie el proxy. Escucha en el puerto 4000.
docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
-e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
-e LITELLM_MASTER_KEY=sk-1234 \
-p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
--config /app/config.yamlLITELLM_MASTER_KEY es la credencial de administración, así que trátela como una contraseña de root y no use el valor de ejemplo en producción. Llame al proxy exactamente como llamaría a una API alojada.
curl http://localhost:4000/v1/chat/completions \
-H 'Authorization: Bearer sk-1234' \
-H 'Content-Type: application/json' \
-d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'Una respuesta correcta es JSON normal con un array choices. Un 401 indica que el encabezado Authorization no coincide con su clave maestra. Un 400 que nombra el modelo indica que model en su solicitud no coincide con ningún model_name del archivo de configuración.
La razón para crear esto en lugar de llamar directamente a Anthropic es el límite de gasto. Emita una clave virtual independiente por aplicación, cada una con su propio presupuesto.
curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'Esa clave puede gastar cien dólares y acceder a un modelo, pero a ningún otro. Cuando un agente falla a las tres de la mañana, el alcance del incidente se limita a una clave en lugar de afectar a toda su cuenta. Ese patrón, junto con la monitorización asociada, es el tema de mantener bajo control los costes de los agentes en un VPS. Si todavía está decidiendo si pagar por token, la comparación de costes entre la API y la suscripción explica los cálculos.
Tenga en cuenta lo que el gateway no hace. No convierte Claude en un servicio local ni oculta sus prompts a Anthropic. Las solicitudes siguen saliendo de su servidor hacia el proveedor. Lo que obtiene es control sobre las claves, el gasto, el enrutamiento y los registros.
Ejecutar Claude Code en su propio VPS
El tercer deseo es el más fácil de conceder. Claude Code es un cliente. Se ejecuta donde instale Node.js y se comunica con la API mediante HTTPS. Instalarlo en un servidor que administra significa que el agente sigue funcionando después de apagar el portátil. También significa que el alcance de una posible intrusión se limita a un sistema que puede reconstruir, en lugar de afectar a su equipo principal.
npm install -g @anthropic-ai/claude-code
claude --versionEjecútelo dentro de tmux para que una desconexión de SSH no termine un trabajo largo. Esta configuración, incluida la gestión de sesiones, se explica en ejecutar Claude Code en un VPS con tmux. Asigne al agente su propio usuario sin privilegios. Lea las reglas de seguridad para ejecutar Claude Code en un servidor antes de concederle acceso de escritura a cualquier recurso importante.
Esto es alojar el agente por cuenta propia, no el modelo. Es importante distinguir ambos conceptos, porque suelen confundirse. Usted administra el proceso, el sistema de archivos, las conexiones de salida de red y los registros. Anthropic sigue administrando la inferencia.
Lo que realmente cuesta cada opción
Los precios cambian, así que considérelos una referencia general, no una cotización. En julio de 2026, Claude Sonnet 5 tiene un precio de $3 por millón de tokens de entrada y $15 por millón de tokens de salida. Claude Opus 5 cuesta $5 y $25, respectivamente. Un modelo local no tiene coste por token. En su lugar, cuesta lo que cueste el servidor al mes, tanto si lo usa como si no.
El punto de equilibrio es más bajo de lo que se suele pensar. Un VPS con memoria suficiente para ejecutar un modelo abierto útil cuesta dinero real cada mes y permanece inactivo la mayor parte del tiempo. Si el uso es intermitente, la API alojada suele ser más barata. Si el uso es constante o los datos no pueden salir de la red, el modelo local gana en ambos aspectos.
La respuesta mixta es la que adopta la mayoría de los equipos. Ejecute un modelo abierto localmente para el trabajo de gran volumen y baja dificultad. Envíe las solicitudes complejas a un modelo avanzado alojado. Coloque un gateway delante de ambos para que las aplicaciones no necesiten saber cuál utilizan y para poder cambiar el límite entre ellos sin modificar el código de las aplicaciones. Esta arquitectura es la versión práctica de "Claude autoalojado" y, a diferencia de la versión literal, existe. Si también quiere ejecutar toda la pila de agentes por su cuenta, el resumen de los agentes de IA autoalojados explica qué opciones hay disponibles.
FAQ
¿Puedo descargar los pesos del modelo de Claude y ejecutarlos localmente?
No. Anthropic nunca ha publicado los pesos de ningún modelo de Claude y no existe ninguna licencia que permita alojarlo de forma autónoma. Todo lo que se anuncie en Internet como un "modelo de Claude" descargable es otro modelo con un nombre engañoso o un envoltorio que llama a la API. Si necesita una clave de API, no es local.
¿Cuál es el modelo abierto más parecido a Claude?
No existe una coincidencia exacta y los modelos líderes cambian cada pocos meses. Las familias de pesos abiertos que merece la pena probar son Llama, Qwen, Mistral, Gemma y DeepSeek. Para resumir, clasificar y realizar ediciones de código sencillas, un buen modelo abierto de 8 a 14 mil millones de parámetros resulta realmente útil. En el razonamiento extenso de varios pasos y el uso de herramientas por agentes, la diferencia con un modelo de vanguardia alojado sigue siendo grande. Pruebe sus propios prompts en lugar de confiar en una tabla de clasificación.
¿LiteLLM es un OpenRouter autohospedado?
Funcionalmente sí, en lo que respecta al enrutamiento y la gestión de claves. LiteLLM se ejecuta en su servidor, ofrece un endpoint compatible con OpenAI y actúa como proxy para Anthropic, Ollama y la mayoría de los demás proveedores. Obtiene límites de gasto por clave, enrutamiento de modelos y un único lugar para consultar los logs. Lo que no proporciona es inferencia local: las solicitudes a Claude siguen viajando a Anthropic.
¿Ejecutar Claude Code en mi propio servidor mantiene mi código privado?
No. Claude Code envía el contenido de los archivos que lee a la API de Anthropic, independientemente de dónde se esté ejecutando el proceso. Lo que proporciona un VPS es aislamiento del agente, no privacidad del contenido. Asígnele un usuario dedicado sin privilegios, manténgalo alejado de las credenciales y de los repositorios no relacionados, y trate todo lo que pueda leer como contenido que sale del servidor.