SSD Nodes Learn Hosting plans →
Guías Matt ConnorPor Matt Connor · Actualizado 2026-08-23

¿Se puede alojar Claude por cuenta propia? La respuesta

Los pesos de Claude no son públicos: ningún servidor propio puede ejecutarlo. Descubre qué sí puedes alojar: modelos abiertos, una pasarela y Claude Code.

¿Puedes alojar Claude por tu cuenta? No, y esta es la razón

No puedes alojar Claude por tu cuenta. Anthropic no publica los pesos del modelo, por lo que no existe ningún archivo que descargar, ningún contenedor que ejecutar ni ninguna licencia que permita servirlo desde tu propio hardware. Cada solicitud a Claude se envía a la API de Anthropic o a un proveedor asociado con servicio alojado, como Amazon Bedrock, Google Vertex AI o Microsoft Foundry. Ejecutarlo en una máquina de tu propiedad no es un problema de configuración. El artefacto simplemente no existe fuera de Anthropic.

Esta es la respuesta breve. La respuesta más completa es que la mayoría de las personas que hacen esta pregunta no necesitan realmente los pesos. Necesitan una de estas tres cosas, todas posibles en un servidor bajo su control: un modelo capaz que se ejecute localmente, una puerta de enlace que almacene sus claves de API y limite su gasto, o un agente de programación que resida en su propio equipo en lugar de su portátil. Esta guía cubre las tres, con los comandos.

Qué suele significar «Claude autohospedado»

El tráfico de búsqueda de «Claude autohospedado» refleja varios objetivos distintos, y cada uno requiere una respuesta diferente.

Algunas personas buscan privacidad. No quieren que las solicitudes salgan de su red. Para conseguirlo, hace falta un modelo local de pesos abiertos, porque cualquier solicitud a Claude se envía por definición a Anthropic.

Otras buscan controlar los costes. Les preocupa que un agente descontrolado consuma todos los créditos. Un gateway resuelve ese problema y funciona con Claude, por lo que se conserva la calidad del modelo.

Otras quieren independencia respecto a un portátil. Quieren que el agente siga funcionando mientras cierran la tapa. Un VPS resuelve ese problema, y Claude Code funciona correctamente en él.

Algunas buscan «OpenRouter autohospedado». Eso también es un gateway, y la respuesta habitual es LiteLLM.

Determine cuál de estos casos es el suyo, porque la implementación adecuada es diferente en cada caso.

Alojar un modelo abierto con Ollama

Si el requisito es que ningún prompt salga del servidor, ejecute un modelo de pesos abiertos. Las familias que actualmente se pueden usar de forma práctica en un servidor alquilado son Llama, Qwen, Mistral, Gemma y DeepSeek. Todas publican pesos que puede descargar y ejecutar.

Ollama es la forma más rápida de empezar. El script de instalación ocupa una sola línea y configura un servicio systemd en Ubuntu.

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama

systemctl status ollama debería mostrar active (running). Después, descargue un modelo y hable con él.

ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."

La primera pull descarga varios gigabytes. Por tanto, el modelo debe caber en la RAM o en la memoria de la GPU antes de poder responder. Como regla aproximada para modelos cuantizados: un modelo de 8 billion parameters necesita unos 6 GB libres, uno de 14 billion parameters unos 10 GB, y uno de 70 billion parameters necesita más memoria de la que ofrecen la mayoría de los planes VPS de propósito general. Si al servidor le falta memoria, el kernel termina el proceso y aparece Error: llama runner process has terminated, junto con una línea de falta de memoria en dmesg. Compruebe free -h antes de atribuir el problema al modelo. Ese mismo presupuesto de memoria también determina cuánto de un prompt largo lee realmente el modelo, porque Ollama trunca silenciosamente todo lo que supera una ventana predeterminada moderada. Por eso, aumentar num_ctx y dimensionar la caché KV es lo primero que debe comprobar cuando los documentos largos vuelven resumidos a medias.

Ollama también ofrece una API HTTP en 127.0.0.1:11434. Esto permite que otro software la utilice, en lugar de limitarla a una interfaz de chat.

curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'

Si la primera petición después de un periodo de inactividad tarda treinta segundos y la siguiente responde al instante, no hay ningún fallo: Ollama descarga el modelo de la memoria tras cinco minutos de inactividad, y mantenerlo residente con keep_alive elimina ese tiempo de recarga.

Mantenga ese puerto enlazado a localhost. Un puerto de Ollama abierto en una IP pública proporciona una GPU gratuita a cualquiera que lo encuentre. La configuración completa, incluida la unidad systemd, la detección de GPU y la colocación de un reverse proxy delante, se explica en la guía para ejecutar Ollama en un VPS. Si va a atender a más de un usuario a la vez, lea primero la comparación entre Ollama y vLLM, porque el diseño de un único flujo de Ollama se convierte en el cuello de botella mucho antes que el hardware.

Sea realista sobre la diferencia. Un buen modelo abierto en un VPS de tamaño medio resulta realmente útil para resumir, clasificar, redactar y realizar extracciones sencillas. En tareas de razonamiento largo y de varios pasos, sobre bases de código grandes y en el uso de herramientas por agentes, no se acerca a un modelo alojado de vanguardia. Ningún ajuste del prompt elimina esa diferencia. Elija el modelo local para las tareas que realiza bien y pague por el modelo alojado cuando la dificultad lo justifique.

Ejecute su propio gateway con LiteLLM

Este es el «OpenRouter autohospedado» que muchas personas buscan. Un gateway se sitúa entre sus aplicaciones y cada proveedor de modelos. Sus aplicaciones usan una sola clave, apuntada a su servidor. Las claves reales de los proveedores sólo están en ese servidor. Puede limitar el gasto por clave, dirigir distintas aplicaciones a diferentes modelos y registrar todas las solicitudes en un solo lugar.

LiteLLM es una opción habitual porque ofrece una API compatible con OpenAI y actúa como proxy para Anthropic, Ollama y la mayoría de los demás proveedores mediante el mismo endpoint. Ejecútelo en Docker con un archivo de configuración.

model_list:
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local
    litellm_params:
      model: ollama/qwen3:8b
      api_base: http://127.0.0.1:11434

Guárdelo como litellm_config.yaml e inicie el proxy. Escucha en el puerto 4000.

docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
  -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
  -e LITELLM_MASTER_KEY=sk-1234 \
  -p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
  --config /app/config.yaml

LITELLM_MASTER_KEY es la credencial de administración, así que trátela como una contraseña de root y no use el valor de ejemplo en producción. Llame al proxy exactamente igual que llamaría a una API alojada.

curl http://localhost:4000/v1/chat/completions \
  -H 'Authorization: Bearer sk-1234' \
  -H 'Content-Type: application/json' \
  -d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'

Una respuesta correcta es un JSON normal con un array choices. Un 401 indica que la cabecera Authorization no coincide con su clave maestra. Un 400 que nombra el modelo indica que model de su solicitud no coincide con ningún model_name del archivo de configuración.

El motivo para construir esto en lugar de llamar directamente a Anthropic es el límite de gasto. Emita una clave virtual independiente para cada aplicación, cada una con su propio presupuesto.

curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'

Esa clave puede gastar cien dólares y acceder a un modelo, y a nada más. Si un agente se comporta mal a las tres de la madrugada, el alcance del incidente se limita a una clave en lugar de afectar a toda la cuenta. Este patrón, junto con la monitorización asociada, es el tema de mantener bajo control los costes de los agentes en un VPS. Si todavía está decidiendo si pagar por token, la comparación de costes entre la API y la suscripción desarrolla los cálculos.

Tenga en cuenta lo que el gateway no hace. No convierte Claude en un servicio local ni oculta sus prompts a Anthropic. Las solicitudes siguen saliendo de su servidor hacia el proveedor. Lo que obtiene es control sobre las claves, el gasto, el enrutamiento y los registros.

Ejecute Claude Code en su propio VPS

El tercer deseo es el más fácil de conceder. Claude Code es un cliente. Se ejecuta donde instale Node.js y se comunica con la API mediante HTTPS. Instalarlo en un servidor propio permite que el agente siga funcionando después de apagar su portátil. Además, el radio de impacto del agente queda limitado a un sistema que puede reconstruir, en lugar de afectar a su máquina principal.

npm install -g @anthropic-ai/claude-code
claude --version

Ejútelo dentro de tmux para que una conexión SSH interrumpida no detenga un trabajo largo. Esta configuración, incluido el manejo de sesiones, se explica en ejecutar Claude Code en un VPS con tmux. Asigne al agente un usuario sin privilegios propio. Lea las reglas de seguridad para ejecutar Claude Code en un servidor antes de concederle acceso de escritura a cualquier recurso importante.

Esto significa alojar el agente por su cuenta, no el modelo. Es importante precisar esta diferencia porque suelen confundirse. Usted controla el proceso, el sistema de archivos, las conexiones de red salientes y los registros. Anthropic sigue controlando la inferencia.

Lo que realmente cuesta cada opción

Los precios cambian, así que considérelos una referencia y no un presupuesto. En julio de 2026, Claude Sonnet 5 tiene un precio de $3 por millón de tokens de entrada y $15 por millón de tokens de salida, mientras que Claude Opus 5 cuesta $5 y $25, respectivamente. Un modelo local no cuesta nada por token. En su lugar, tiene el coste mensual del servidor, que se ejecuta tanto si lo usa como si no.

El punto de equilibrio es más bajo de lo que muchos esperan. Un VPS con memoria suficiente para ejecutar un modelo abierto útil cuesta dinero real cada mes y permanece inactivo la mayor parte del tiempo. Si el uso es irregular, la API alojada suele ser más barata. Si el uso es constante o los datos no pueden salir de la red, el modelo local suele ser mejor en ambos aspectos.

La respuesta mixta es la que adopta la mayoría de los equipos. Ejecute localmente un modelo abierto para las tareas de gran volumen y baja dificultad. Encamine las solicitudes complejas a un modelo de frontera alojado. Coloque un gateway delante de ambos para que las aplicaciones no necesiten saber cuál usan y para poder cambiar el reparto entre ellos sin modificar el código de las aplicaciones. Esta arquitectura es la versión práctica de "Claude autoalojado" y, a diferencia de la versión literal, existe. Si también quiere ejecutar por su cuenta toda la pila de agentes, el resumen de agentes de IA autoalojados explica qué opciones están disponibles.

FAQ

¿Puedo descargar los pesos del modelo de Claude y ejecutarlos localmente?

No. Anthropic nunca ha publicado los pesos de ningún modelo de Claude y no existe ninguna licencia que permita alojarlos por cuenta propia. Todo lo que se anuncia en Internet como un «modelo de Claude» descargable es otro modelo con un nombre engañoso o un wrapper que llama a la API. Si necesita una API key, no es local.

¿Cuál es el modelo abierto más parecido a Claude?

No existe una equivalencia exacta y los modelos líderes cambian cada pocos meses. Las familias de pesos abiertos que merece la pena probar son Llama, Qwen, Mistral, Gemma y DeepSeek. Para resumir, clasificar y hacer ediciones de código sencillas, un buen modelo abierto de 8 a 14 billion parameters resulta realmente útil. En razonamiento prolongado de varios pasos y uso de herramientas por agentes, la diferencia con un modelo frontier alojado sigue siendo grande. Pruebe sus propios prompts en lugar de confiar en una tabla de clasificación.

¿LiteLLM es un OpenRouter autohospedado?

Desde el punto de vista funcional, sí, en lo que respecta al enrutamiento y la gestión de claves. LiteLLM se ejecuta en su servidor, ofrece un endpoint compatible con OpenAI y actúa como proxy para Anthropic, Ollama y la mayoría de los demás proveedores. Obtiene límites de gasto por clave, enrutamiento de modelos y un único lugar para consultar los registros. Lo que no ofrece es inferencia local: las solicitudes a Claude siguen viajando a Anthropic.

¿Ejecutar Claude Code en mi propio servidor mantiene mi código privado?

No. Claude Code envía a la API de Anthropic el contenido de los archivos que lee, independientemente de dónde se ejecute el proceso. Un VPS le proporciona aislamiento del agente, no privacidad del contenido. Asígnele un usuario dedicado sin privilegios, manténgalo alejado de las credenciales y de los repositorios no relacionados, y trate todo lo que pueda leer como contenido que sale del servidor.