Cómo crear un agente de IA tipo OpenClaw
Aprenda a construir un agente de IA self-hosted para ejecutar comandos de shell. Analizamos su arquitectura y cómo evitar fallos como el CVE-2026-32922.
Qué es realmente OpenClaw
OpenClaw es un agente de IA personal self-hosted. Se ejecuta en su propio servidor, se conecta a las aplicaciones de chat que ya utiliza y puede ejecutar comandos de shell, controlar un navegador, leer y escribir archivos, y actuar según los mensajes que se le envíen. Tiene una licencia MIT, es local-first y cuenta con más de 380,000 estrellas en GitHub a mediados de 2026, lo que lo convierte en uno de los proyectos más populares de la plataforma. Detrás de la apariencia, es un conjunto pequeño de componentes conectados de forma lógica. Este post analiza esos componentes para que comprenda cómo se construye una herramienta así y dónde están los puntos críticos.
Una advertencia previa, ya que define cada decisión de diseño a continuación. En marzo de 2026, OpenClaw tuvo nueve vulnerabilidades de seguridad reveladas en cuatro días, incluyendo un fallo crítico de escalada de privilegios con una calificación de 9.9 sobre 10 (CVE-2026-32922). El proyecto está diseñado para ser reforzado por usted, el operador. Un agente que puede ejecutar cualquier comando es tan seguro como la máquina donde se ejecuta y los límites que se le impongan. Tenga esto en cuenta durante la lectura.
El daemon de gateway: un proceso, mantenido privado
En el centro hay un único proceso de larga duración, generalmente llamado gateway. Es el plano de control. Recibe mensajes, decide qué hacer, ejecuta las herramientas y envía las respuestas. Todo lo demás se conecta a él.
El dato más importante sobre el gateway es dónde escucha. Por defecto, OpenClaw lo vincula a la dirección loopback, 127.0.0.1, por lo que no es accesible desde internet a menos que usted decida exponerlo. Déjelo ahí. Este es el único proceso que ejecuta comandos de forma continua, por lo que un gateway expuesto otorga a cualquier persona que lo encuentre un acceso remoto a su servidor. Cuando necesite acceder desde su laptop, hágalo mediante una VPN o un túnel SSH en lugar de abrir un puerto. Nadie puede atacar un puerto al que no puede acceder.
Conectores de canal: recibir un mensaje y enviar una respuesta
Un agente personal solo es útil si puede hablar con él desde las aplicaciones que ya utiliza. Eso es lo que hacen los conectores de canal. Cada uno se comunica con una plataforma, como Telegram, WhatsApp, Slack o Discord, utilizando la API de bot o los webhooks de dicha plataforma.
La estructura es la misma para todos. El conector registra un bot en la plataforma, recibe su mensaje entrante (ya sea mediante polling o recibiendo un webhook enviado por la plataforma), entrega ese mensaje al gateway y publica la respuesta del gateway a través de la misma API. El conector es una capa de traducción ligera. Convierte "ha llegado un mensaje de Telegram" en "aquí hay texto para el agente" y viceversa. Construir uno propio consiste principalmente en leer la documentación de la API de una plataforma y mapear su formato de mensaje al del gateway.
El cerebro y el bucle de herramientas
Dentro del gateway está la parte que lo convierte en un agente en lugar de un chatbot. Es un bucle.
Llega un mensaje. El gateway lo envía a un modelo de lenguaje junto con una lista de herramientas que el modelo tiene permitido usar. El modelo lee el mensaje y decide: responder directamente o llamar a una herramienta. Si llama a una herramienta, el gateway la ejecuta, captura el resultado y envía el resultado de vuelta al modelo. El modelo analiza el resultado y decide de nuevo. Esto se repite hasta que el modelo no tiene más tareas y genera una respuesta final.
Ese bucle es la idea central de un agente, y es el mismo bucle ya sea que el agente viva en una app de chat o en una terminal. Para saber cómo se conectan las herramientas a ese bucle de forma estándar, conectar herramientas mediante el Model Context Protocol es una buena lectura siguiente, y para la parte del modelo, ejecutar el modelo en su propio hardware completa la otra mitad.
El conjunto de herramientas es el objetivo, y el peligro
Las herramientas son lo que hace que OpenClaw sea potente. Una herramienta que ejecuta un comando de shell, una herramienta que controla un navegador, una herramienta que lee y escribe archivos. Si se da acceso al bucle anterior a esas herramientas, puede hacer casi cualquier cosa que usted pueda hacer con un teclado. Ese alcance es el producto completo, y es también el riesgo completo.
Un agente que puede ejecutar cualquier comando, actuando según instrucciones que llegan desde una app de chat, representa una superficie de ataque amplia. Una instrucción maliciosa, un ataque de prompt-injection oculto en una página web que la herramienta del navegador visite, o un bug como los fallos de marzo de 2026 pueden convertir "lee mi calendario" en "borra mis archivos". Por tanto, los límites no son extras opcionales. Ejecute el agente como un usuario dedicado y sin privilegios, sin sudo, para que un compromiso no pueda escalar privilegios. Proteja las herramientas peligrosas tras un paso de aprobación para que el agente pregunte antes de realizar una acción destructiva. Use sandboxing para la ejecución de herramientas para contener un comando descontrolado. Aísle la API key del modelo para que una filtración no entregue su cuenta a un atacante.
Antes de exponer cualquier cosa que ejecute comandos de shell, trabaje los conceptos básicos deliberadamente. Genere una lista de verificación para su propio equipo aquí, y luego sígala paso a paso:
El tema del usuario sin privilegios se trata a fondo en ejecutar servicios como un usuario sin privilegios, y la guía completa de configuración segura para el proyecto real está en ejecutar OpenClaw de forma segura en un VPS.
Memoria como archivos de texto plano
La mayoría de la gente espera que la memoria de un agente resida en una base de datos. La de OpenClaw no es así. Almacena la memoria como archivos Markdown simples en el disco, y esa elección merece ser replicada.
Los archivos son sencillos. No hay esquemas que migrar, ni servicios que mantener en ejecución, ni lenguajes de consulta que aprender. Son inspeccionables: puede abrir la carpeta y leer exactamente lo que el agente cree sobre usted, corregir una nota errónea editando un archivo o borrar un recuerdo eliminando uno. Además, son portátiles, porque mover el agente a un nuevo servidor es solo cuestión de copiar un directorio. Para un agente personal de un solo usuario, una carpeta de archivos de texto es suficiente y mantiene todo el sistema fácil de entender.
Habilidades: una forma portátil de añadir capacidades
Más allá de las herramientas integradas, OpenClaw utiliza un formato de habilidad portátil para que la comunidad pueda extender sus capacidades sin cambiar su núcleo. Una habilidad es un paquete autónomo de instrucciones y, a veces, código que enseña al agente una nueva tarea. El agente carga una habilidad cuando la tarea lo requiere.
El valor de un formato como este es que las capacidades se pueden compartir. Alguien escribe una habilidad para una tarea específica, la publica y otros la instalan. Si construye su propio agente, definir un formato de extensión pequeño y claro desde el principio le evitará tener que programar cada capacidad directamente en el núcleo más adelante.
Traiga su propio modelo
OpenClaw es agnóstico al modelo. No incluye su propio modelo de lenguaje. En su lugar, se conecta al que usted elija, que puede ser una API alojada o un modelo que usted ejecute.
Esa división es importante para el coste, la privacidad y el control. Una API alojada le ofrece los modelos más potentes sin necesidad de gestionar hardware, con un precio por token y con sus prompts saliendo de su servidor. Un modelo auto-alojado, servido con algo como Ollama, mantiene cada mensaje en su propio equipo y solo cuesta el hardware y la energía, con el inconveniente de ejecutar un modelo más pequeño o lento. Mucha gente combina ambos. Si desea mantener un agente totalmente privado, auto-alojar el modelo en su VPS es la pieza que cierra esa última brecha, y Hermes Agent es otro agente auto-alojado que merece la comparación.
¿Debería construir uno?
Puede construir todo esto. Las partes no son exóticas: un daemon, algunos conectores de chat, un bucle de modelo y herramientas, una carpeta de Markdown y un formato de plugins. Entenderlas es realmente útil, porque desmitifica cada agente que utilice y le indica exactamente dónde reside el peligro.
Pero para la mayoría de la gente, la respuesta honesta es ejecutar la versión real y reforzarla en lugar de reinventarla. OpenClaw ya resolvió los conectores, el bucle y el formato de habilidades, y ha pasado por un escrutinio de seguridad real. Es mejor dedicar su esfuerzo a la parte que realmente le corresponde a usted: la configuración y el refuerzo en su propio servidor. Construya uno pequeño para aprender. Ejecute y asegure el real para usarlo.
Los fundamentos generales se encuentran en construir su propio agente de IA en un VPS, y construir un agente con Claude muestra las mismas ideas utilizando un modelo específico como cerebro.
FAQ
¿Es difícil construir un agente como OpenClaw?
Las partes individuales no son difíciles. Un proceso gateway, un conector de chat, un bucle de modelo y herramientas, y una carpeta de archivos son sencillos por separado. Lo difícil es hacerlo de forma segura. Un agente que ejecuta comandos de shell desde mensajes de chat es una superficie de seguridad seria; configurar correctamente el sandboxing, los permisos y el usuario sin privilegios requiere más trabajo que conectar las funciones entre sí.
¿Por qué OpenClaw almacena la memoria como archivos Markdown en lugar de una base de datos?
Porque para un agente personal de un solo usuario, los archivos son suficientes y mucho más simples. No hay un servicio de base de datos que ejecutar, la memoria es fácil de leer y corregir manualmente, y mover el agente a otro servidor es solo copiar un directorio. Una base de datos es útil a gran escala, no aquí.
¿Cuál es la parte más peligrosa de un agente de IA personal?
Las herramientas que le permiten actuar: ejecutar comandos de shell, controlar un navegador y escribir archivos. Esa es la razón para construirlo y la razón por la que puede perjudicarle. El evento de seguridad de OpenClaw de marzo de 2026 (nueve problemas en cuatro días, incluyendo uno crítico con calificación de 9.9) es el argumento más claro para tratar la capa de herramientas con cuidado: ejecute como un usuario sin privilegios, limite las acciones destructivas y use sandboxing para la ejecución.
¿Necesito mi propio modelo de lenguaje para construir uno?
No. Los agentes como OpenClaw son agnósticos al modelo, por lo que puede conectar el que elija. Puede ser una API alojada para obtener los modelos más potentes, o un modelo que usted ejecute para tener privacidad total. El auto-alojamiento con Ollama mantiene cada mensaje en su propio servidor a costa de ejecutar un modelo más pequeño.