Instalar Agentlas OS en un VPS Linux paso a paso
Guía para desplegar Agentlas OS v1.2.0 en un VPS. Aprende a configurar el almacenamiento de estados, conectar el backend con Ollama y optimizar el consumo de recursos en reposo.
Qué es realmente Agentlas OS
Agentlas OS es un entorno de ejecución de agentes de código abierto que almacena agentes especializados en el disco como paquetes y ensambla un orquestador temporal para cada tarea. Se aloja de forma autónoma instalándolo en su propia cuenta de usuario en un VPS Linux. No es un servicio. No hay ningún daemon, ningún puerto a la escucha, ninguna interfaz web ni ninguna imagen de contenedor en el repositorio.
Esa última frase determina todo lo demás en esta página. La mayoría de los sistemas multi-agente ejecutan un proceso supervisor que permanece activo y mantiene a los agentes. Agentlas invierte esto: los especialistas son archivos en reposo y el orquestador solo existe mientras se ejecuta una tarea. El resultado práctico es que un centro inactivo le cuesta espacio en disco, no memoria.
El proyecto denomina a su núcleo abierto Hephaestus, y ese es el nombre que verá en comandos, rutas y variables de entorno. El repositorio es agentlas-ai/Agentlas-OS, tiene licencia Apache-2.0 y está escrito principalmente en Python.
¿Qué tan reciente es este proyecto, honestamente?
El repositorio se creó el 4 de junio de 2026. Al 12 de agosto de 2026, tiene aproximadamente diez semanas de antigüedad, con cerca de 1,150 estrellas y 112 forks. Es un proyecto joven para utilizarlo en entornos de producción.
La cadencia de versiones es más importante que la antigüedad. La versión v1.1.103 se publicó el 8 de agosto de 2026 y la v1.2.0 se lanzó el 12 de agosto de 2026. Esto representa más de cien versiones etiquetadas en la serie 1.1, varias de ellas en un mismo día, publicadas mediante automatización. Un proyecto que avanza a esa velocidad puede cambiar su comportamiento entre un martes y un jueves.
Por lo tanto, fije la versión. El instalador lee una variable de entorno para este propósito, y toda la guía a continuación la utiliza. Una instalación sin fijar de un proyecto que publica varias veces al día le entregará lo que sea que estuviera disponible en main en esa hora.
Requisitos en el VPS
Los requisitos son mínimos porque no hay procesos ejecutándose en segundo plano.
- Un VPS Linux. Ubuntu 24.04 es una base adecuada. El instalador detecta el sistema operativo con
uname -sy selecciona la rama para Linux (no macOS), por lo que se admite cualquier servidor sin interfaz gráfica. curl,tarygiten el servidor, además de un intérprete de Python funcional.- Conectividad HTTPS saliente hacia
raw.githubusercontent.comygithub.com. El instalador descarga un archivo de la release y verifica su SHA-256; por tanto, un servidor sin acceso a Internet no puede realizar la instalación. - Un host harness, que es el agente de programación que se comunica con el modelo. Se admiten adaptadores para Claude Code, Codex, opencode, goose y Hermes.
No necesita privilegios de root. El instalador solo escribe en su directorio personal y en ~/.local/bin; además, emite una advertencia en lugar de abortar si una ruta no tiene permisos de escritura. Si aún está seleccionando el servidor, ejecutar un agente de programación en un VPS cubre la configuración de la imagen base y el acceso sobre el cual se instala esto.
Instalar la versión fijada
El archivo README del proveedor documenta una línea única que redirige un script desde main directamente a bash. Descárguelo y léalo primero. Escribe en su configuración de shell y en cada arnés de agente que encuentra, por lo que merece diez segundos de su atención.
curl -fsSL -o install-all-runtimes.sh \
https://raw.githubusercontent.com/agentlas-ai/Agentlas-OS/main/scripts/install-all-runtimes.sh
less install-all-runtimes.sh
HEPHAESTUS_REF=v1.2.0 bash install-all-runtimes.shHEPHAESTUS_REF es el valor de fijación. Dentro del script, la línea es version="${HEPHAESTUS_REF:-v1.2.0}", por lo que dejarla sin definir le proporciona la versión v1.2.0 hoy y algo distinto la próxima semana. Defínala explícitamente y su reconstrucción en octubre instalará lo que probó en agosto.
Una limitación honesta: la URL del script anterior sigue a main, mientras que HEPHAESTUS_REF fija la carga útil del entorno de ejecución que descarga el script. Son dos cosas distintas. Para fijar ambas, obtenga el script desde la etiqueta en lugar de main reemplazando main por v1.2.0 en dicha URL.
Una ejecución exitosa imprime las rutas donde escribió, incluyendo estas dos líneas:
Installed runner: /home/you/.agentlas/runtime/current/bin/hephaestus
Installed shell commands in /home/you/.local/bin (add ~/.local/bin to PATH to use them)Esa segunda línea es la que la gente omite. En un equipo Ubuntu recién instalado, ~/.local/bin suele estar ausente de PATH, por lo que cada comando hep-* falla con command not found aunque la instalación haya tenido éxito. Corríjalo y confirme:
echo 'export PATH="$HOME/.local/bin:$PATH"' >> ~/.bashrc
source ~/.bashrc
hep-global statushep-global status informa lo que el enrutador global instaló y qué arneses detectó. Si se ejecuta, su PATH es correcto.
Dónde reside el estado
Todo es un archivo dentro de su directorio personal, lo que simplifica las copias de seguridad y la migración.
~/.agentlas/runtime/v1.2.0/contiene el entorno de ejecución, con~/.agentlas/runtime/current/como enlace simbólico a la versión activa. Dos versiones fijadas pueden coexistir.~/.local/bin/contiene los wrappers del shell:hephaestus,hep-build,hep-network,hep-search,hep-storm,hep-cloudyhep-upload.~/.agentlas/networking/memory/contiene la memoria persistente:playbook-registry.json,playbook-candidates.jsonlymemory-events.jsonl.~/.agentlas/networking/hub-agents/<slug>/memory/experience.sqlitecontiene la experiencia por agente, delimitada por propietario.<project>/.agentlas/ontology-runtime.sqlitecontiene el estado por proyecto, por lo que viaja con el repositorio en lugar de quedarse en el servidor.~/.cache/agentlas/pythoncontiene la caché de Python en Linux. macOS utiliza una ruta distinta, que es la rama que el instalador selecciona conuname.
La documentación de la memoria especifica claramente que los secretos, las credenciales sin procesar y las transcripciones completas no deben incluirse en ningún ámbito de memoria. Los valores de las credenciales permanecen en archivos locales ignorados por git, y los registros de memoria solo almacenan nombres y rutas. Realice copias de seguridad de ~/.agentlas y de sus directorios de proyecto .agentlas para poder reconstruir el entorno en un nuevo VPS.
Qué modelos de backend puede utilizar
Este es el detalle que redefine toda la configuración: Agentlas no llama a una API de modelos. Lo hace el arnés (harness) anfitrión.
El documento de arquitectura describe adaptadores de tiempo de ejecución que traducen un núcleo a cada arnés, y establece que el tiempo de ejecución anfitrión posee las credenciales del modelo. Agentlas aporta dos superficies que un arnés recoge: un archivo AgentSkills y un servidor MCP (model context protocol) que se comunica a través de stdio. Por lo tanto, la pregunta "¿qué modelos admite Agentlas?" es en realidad "¿qué modelos admite su arnés?", y la respuesta es cualquier modelo al que puedan acceder Claude Code, Codex, opencode, goose o Hermes.
El registro del servidor MCP se ve así en una configuración TOML al estilo de Codex:
[mcp_servers.hephaestus-network]
command = "~/.agentlas/runtime/current/bin/hephaestus"
args = ["mcp", "serve"]El mismo servidor se registra automáticamente en ~/.cursor/mcp.json, ~/.config/goose/config.yaml y en las configuraciones de los otros arneses durante la instalación. Si está conectando varios de estos en un mismo equipo, ejecutar servidores MCP en un VPS cubre el modelo de stdio y de procesos con mayor profundidad.
Apuntar a un endpoint de Ollama autohospedado
Debido a que el harness gestiona la conexión con el modelo, apuntar Agentlas a modelos locales significa apuntar su harness a Ollama. Ollama añadió un subcomando launch en la v0.15 exactamente para esto, y sigue estando disponible en la v0.32.9 a fecha de 11 de agosto de 2026. Esto configura un harness existente para trabajar con modelos locales sin necesidad de establecer variables de entorno:
ollama pull qwen3-coder:30b
ollama launch opencodeSustituya claude, codex o droid por opencode dependiendo del harness que haya instalado. A continuación, dirija una petición a través del runtime local:
~/.agentlas/runtime/current/bin/hephaestus route "summarise the failing tests" --runtime ollamaUna ruta exitosa devuelve una decisión en formato JSON que nombra al agente o equipo seleccionado, junto con un receipt_id. Si no devuelve nada útil, la causa habitual es la longitud del contexto. La documentación de Agentlas solicita un modelo con al menos 64k de contexto para sesiones con un enrutamiento intensivo y menciona qwen3-coder, gemma3 y deepseek-r1 como ejemplos. La propia guía de Ollama para herramientas de programación establece el mismo límite mínimo de 64k. Las decisiones de enrutamiento incluyen el inventario de agentes en el prompt, por lo que un modelo con 8k o 32k de contexto truncará el inventario y realizará una mala selección.
Una advertencia que el eslogan no le dirá. Ollama, Gemma y DeepSeek no tienen su propio sistema de plugins o comandos, por lo que los comandos de barra /agentlas no existen en ellos. En una configuración con modelos locales, usted controla el sistema a través del servidor MCP y el comando hephaestus route. Se trata de una reducción real de la superficie de ataque, y es el intercambio honesto por mantener los pesos en su propia máquina.
El coste en RAM de un centro de especialistas inactivos
Nada. Esa es la respuesta completa, y puede comprobarlo en lugar de darlo por sentado.
Los especialistas de centro integrados llegan como artefactos de paquete, no como procesos. Un especialista es un agent.md más un directorio .agentlas/ de JSON: routing-card.json para disparadores y capacidades, memory-map.json para límites de escritura y mode-map.json para definir si se ejecuta en solitario o en equipo. Hephaestus Network se describe como un planificador en proceso sin servicio en segundo plano. Entre tareas, compruébelo usted mismo:
pgrep -af hephaestus
systemctl --user list-units --type=service | grep -i agentlas
du -sh ~/.agentlasLos dos primeros comandos no muestran nada en un equipo inactivo, porque no hay nada residente. El tercero muestra el único coste que un centro estacionado le impone, que es el de disco, y este crece con el número de especialistas que mantenga además del modelo de incrustación incluido que el entorno de ejecución distribuye.
Por lo tanto, la cuestión de la memoria es totalmente una cuestión sobre la ráfaga, y la ráfaga es su arnés más su backend de modelo. Si el arnés se comunica con una API alojada, el coste residente es un proceso de unos pocos cientos de megabytes. Si aloja los pesos usted mismo, los pesos son la factura:
The data behind this chart
[
{
"label": "Hosted API model",
"weights_gb": 0
},
{
"label": "gemma3:4b",
"weights_gb": 3.3
},
{
"label": "gemma3:12b",
"weights_gb": 8.1
},
{
"label": "gemma3:27b",
"weights_gb": 17
},
{
"label": "qwen3-coder:30b",
"weights_gb": 19
}
]Esos son los tamaños de descarga publicados en la biblioteca de modelos de Ollama, no mediciones de una ejecución de referencia, y la caché KV para un contexto de 64k se suma a cada cifra superior a cero. El modelo que la documentación de Agentlas menciona primero, qwen3-coder:30b, necesita 19 GB de pesos antes del contexto, e incluso la variante de 27B de Gemma requiere 17 GB. Frente a esas cifras, la capa de Agentlas en sí misma no aparece en el presupuesto.
Cómo se compara esto con ejecutar un solo arnés
Ejecute un solo arnés contra una API alojada y su VPS mantendrá un único proceso. Añada Agentlas y mantendrá el mismo proceso, además de archivos. El orquestador no es un programa adicional de larga duración; es un prompt más extenso ensamblado a partir de los paquetes en disco y luego descartado.
El coste que sí varía es el contexto, no la memoria. Un orquestador que incorpora varias tarjetas especializadas y sus metadatos de enrutamiento consume más tokens por tarea que un arnés básico; en una API alojada, esto se traduce en dinero en lugar de RAM. En pesos locales, se traduce en tiempo, ya que un prompt más largo implica un prefill más extenso en la CPU o una mayor carga en la GPU.
Por este motivo, el consejo de dimensionamiento para un equipo como este depende de la decisión sobre el modelo y no del framework de agentes. Dimensionamiento de RAM y CPU para un VPS de agentes de programación analiza esto en detalle, y la conclusión sigue siendo válida aquí: elija el plan para el backend que pretende ejecutar y añada un par de gigabytes de margen para el arnés. Si, por el contrario, desea comparar el diseño de supervisor siempre activo, el arnés multi-agente Omnigent mantiene su coordinador residente, lo cual supone el intercambio opuesto y se refleja directamente en la memoria en reposo.
Modos de fallo y cadenas que verá
hep-build: command not found justo después de una instalación limpia. El instalador escribió en ~/.local/bin, que no está en PATH en una imagen predeterminada de Ubuntu. Lo indicó en su última línea y la línea se desplazó fuera de la vista. Añada el export mostrado arriba.
Cambios de comportamiento tras reconstruir el equipo. No definió HEPHAESTUS_REF, por lo que el instalador utilizó por defecto la etiqueta vigente ese día. Fije la versión y regístrela junto a sus otros números de versión.
El enrutamiento selecciona al especialista incorrecto en un modelo local. La ventana de contexto del modelo es demasiado pequeña para el inventario de agentes. Cambie a un modelo con 64k o más y ajuste la longitud de contexto de Ollama para que coincida, ya que el valor predeterminado es inferior al que requieren las herramientas de programación.
ollama launch no se reconoce. El subcomando se introdujo en Ollama v0.15. Los paquetes antiguos de un repositorio de distribución son anteriores, por lo que debe instalar una versión actual de Ollama.
La instalación escribe en entornos que no esperaba. El script detecta y configura cada entorno que encuentra, escribiendo en ~/.claude/, ~/.codex/, ~/.gemini/, ~/.cursor/ y otros. En un servidor de compilación compartido, lea el script antes de ejecutarlo y tenga claro cuáles de esos directorios le interesan.
¿Debería ejecutar esto ya?
Un proyecto de diez semanas de antigüedad con lanzamientos automatizados varias veces al día no es apto para una carga de trabajo en producción. La arquitectura es genuinamente interesante, la licencia es Apache-2.0 y el diseño basado en archivos implica que desinstalar consiste simplemente en borrar dos directorios. Estos hechos hacen que sea barato probarlo, pero costoso depender de él.
Una postura sensata por ahora: fije la versión v1.2.0, ejecútelo en una máquina que pueda reconstruir, mantenga ~/.agentlas en sus copias de seguridad y vuelva a leer el registro de cambios antes de modificar la versión fijada. Para un análisis más amplio de qué otras opciones existen en este ámbito y cuál es el nivel de madurez de cada una, el resumen de agentes de IA autohospedados es el mejor punto de partida, y el autohospedaje de un agente Hermes en un VPS cubre uno de los entornos que Agentlas adapta.
FAQ
¿Se ejecuta Agentlas OS como un servidor en mi VPS?
No. No existe ningún daemon, ningún puerto a la escucha ni ninguna imagen de contenedor en el repositorio. El instalador escribe un entorno de ejecución en ~/.agentlas/runtime/ y envoltorios de comandos en ~/.local/bin; además, Hephaestus Network es un planificador en proceso en lugar de un servicio en segundo plano. Puede confirmar esto en un equipo inactivo: pgrep -af hephaestus no imprime nada y no hay ninguna unidad de systemd que habilitar. El alojamiento propio aquí significa que el código y el estado están en su máquina, no que haya un servicio escuchando.
¿Cuánta RAM consume un hub de especialistas inactivos?
Ninguna, porque los especialistas inactivos no son procesos. Un especialista es un archivo agent.md más un directorio .agentlas/ que contiene routing-card.json, memory-map.json y metadatos similares, por lo que un hub estacionado solo consume espacio en disco. Mídalo con du -sh ~/.agentlas. La memoria se consume solo mientras se ejecuta una tarea, y lo que la consume es su proceso de control (harness) y su backend de modelo, no la capa de Agentlas.
¿Qué modelos puedo usar y puedo apuntar a mi propio Ollama?
Agentlas no llama a las API de modelos por sí mismo. El harness anfitrión posee las credenciales y la conexión, por lo que los modelos compatibles son todos aquellos que admita su harness. Para pesos locales, ejecute ollama launch opencode (sustituyendo claude, codex o droid), lo cual configura el harness contra su servidor Ollama sin necesidad de variables de entorno. Utilice un modelo con al menos 64k de contexto, como qwen3-coder o gemma3, porque los prompts de enrutamiento transportan el inventario de agentes y se truncan gravemente en ventanas más pequeñas.
¿Qué versión debo instalar y por qué es importante fijar la versión aquí?
Instale la v1.2.0, la versión etiquetada vigente el 12 de agosto de 2026, configurando HEPHAESTUS_REF=v1.2.0 antes de ejecutar el instalador. El valor predeterminado del script es version="${HEPHAESTUS_REF:-v1.2.0}", que sigue cualquier etiqueta que los mantenedores publiquen a continuación. Fijar la versión es más importante de lo habitual porque el proyecto publicó más de cien versiones en su serie 1.1, varias de ellas en el mismo día, por lo que una reconstrucción sin fijar realizada semanas después no le proporcionará el sistema que usted probó.