Cómo aprender agentes de IA desde cero
Aprende agentes de IA en seis etapas: conceptos, bucle propio, herramientas, memoria, diseño del bucle y seguridad, con un proyecto práctico en cada paso.
La ruta en seis etapas
Para aprender sobre agentes de IA desde cero, recorra seis etapas en orden: los conceptos, su primer bucle, las herramientas, la memoria, el diseño del bucle y la seguridad. En cada etapa construirá algo con sus propias manos. Saltarse etapas es la causa más común de que las personas se queden bloqueadas, porque un framework oculta precisamente la parte que necesitaba ver.
Un agente de IA es un bucle alrededor de un modelo de lenguaje al que se permite llamar a herramientas. Esa frase resume todo el tema. Todo lo demás son detalles sobre lo que entra en el bucle, lo que pueden tocar las herramientas y cómo detener el bucle cuando algo falla. Si puede explicar el bucle a otra persona, ha aprendido el concepto. Si sólo puede nombrar frameworks, todavía no lo ha aprendido.
El plan siguiente presupone que aprende mediante la práctica. Lea una etapa, construya algo pequeño, provóquelo un fallo de forma intencionada y continúe. Una etapa que sólo ha leído es una etapa que todavía no ha completado.
Qué necesita realmente antes de la etapa 1
La lista de requisitos previos es corta y más breve de lo que sugieren la mayoría de las páginas de cursos.
- Puede leer y escribir Python o TypeScript con el nivel necesario para crear un script de cincuenta líneas.
- Se desenvuelve con soltura en un shell de Linux: instalar un paquete, editar un archivo y leer un registro.
- Tiene una clave de API para un modelo alojado o una máquina que pueda ejecutar un modelo local.
Esa es toda la lista. No necesita conocimientos teóricos de aprendizaje automático ni haber entrenado un modelo. El trabajo con agentes no implica gradientes ni datos de entrenamiento. Una tarjeta gráfica sólo es necesaria si decide ejecutar el modelo por su cuenta. Es una habilidad independiente que puede aprender más adelante en alojar Ollama en un VPS para ejecutar un LLM localmente.
Lo que suele subestimarse es la parte relacionada con el shell. Los agentes fallan por permisos, rutas, variables de entorno y procesos que terminan sin mostrar mensajes. Si un traceback sobre PATH o un modo de archivo hace que cierre el terminal, dedique primero un fin de semana a los fundamentos de Linux. Le ahorrará un mes más adelante.
Etapa 1: qué es un agente y qué no es
Empiece con una llamada a la API y sin bucle. Envíe un prompt, muestre la respuesta y revise los recuentos de tokens de la respuesta. Ahora entiende la unidad de coste y la unidad de latencia.
Después, aprenda a usar herramientas, que es la única idea realmente nueva de todo este campo. Describa una función al modelo mediante un nombre, una descripción y un esquema JSON (notación de objetos de JavaScript) para sus entradas. El modelo no ejecuta nada. Responde con una solicitud estructurada: llame a run_command con estos argumentos. Su código ejecuta la función, envía el resultado como un mensaje y vuelve a consultar al modelo. El modelo es un planificador que lee texto y escribe texto. Su código es el que puede ejecutar acciones. El código de su lado de ese intercambio tiene un nombre cuando empieza a comparar diseños: es el armazón del agente, el bucle, las herramientas y los permisos que rodean a un modelo que no tiene ninguno propio.
Un chatbot termina después de una respuesta. Un agente repite ese intercambio hasta que el modelo deja de solicitar herramientas. Esa repetición es toda la diferencia. Por eso también difieren los modos de fallo. Un chatbot proporciona una respuesta incorrecta una vez. Un agente actúa varias veces basándose en una respuesta incorrecta antes de que alguien lo detecte.
Fase 2: escriba el bucle usted mismo, una vez
No empiece con un framework. Escriba unas treinta líneas de Python para que la estructura sea suya.
sudo apt update && sudo apt install -y python3-venv
python3 -m venv ~/agent
source ~/agent/bin/activate
pip install anthropic
export ANTHROPIC_API_KEY=your-key-hereimport subprocess
import anthropic
client = anthropic.Anthropic()
tools = [{
"name": "run_command",
"description": "Run a read only shell command and return its output.",
"input_schema": {
"type": "object",
"properties": {"command": {"type": "string"}},
"required": ["command"],
},
}]
messages = [{"role": "user", "content": "How much disk space is free here?"}]
while True:
response = client.messages.create(
model="claude-opus-5",
max_tokens=4096,
tools=tools,
messages=messages,
)
if response.stop_reason != "tool_use":
break
messages.append({"role": "assistant", "content": response.content})
results = []
for block in response.content:
if block.type == "tool_use":
done = subprocess.run(
block.input["command"], shell=True,
capture_output=True, text=True, timeout=10,
)
results.append({
"type": "tool_result",
"tool_use_id": block.id,
"content": done.stdout or done.stderr,
})
messages.append({"role": "user", "content": results})
print(next(b.text for b in response.content if b.type == "text"))Ejecútelo con python3 agent.py. Una ejecución correcta imprime un párrafo que indica sus sistemas de archivos y el espacio libre, porque el modelo solicitó df -h, su código lo ejecutó y la segunda pasada convirtió esa tabla en una frase. Si no imprime nada, el bucle terminó antes de recibir un bloque de texto. Añada print(response.stop_reason) dentro del bucle y observe cómo cambian los valores.
Ahora rómpalo deliberadamente. Elimine la línea tool_use_id y lea el error, porque la API rechaza un resultado de herramienta sin un ID coincidente y este es el error más común entre principiantes. Haga una pregunta que requiera dos comandos y observe cómo el bucle se ejecuta dos veces. Haga una pregunta imposible y observe si el proceso se detiene o gira indefinidamente.
Una advertencia sobre este ejemplo. Pasa directamente la salida del modelo a un shell mediante shell=True. Esto puede aceptarse en una máquina de pruebas que pueda reconstruir, pero es incorrecto en cualquier otro entorno. La fase 6 corrige este problema. Los conceptos del bucle se explican con más detalle en cómo crear su propio agente de IA en un VPS.
Etapa 3: herramientas que el agente aún no tenía
Tu herramienta run_command funciona, pero un agente real necesita herramientas que accedan a recursos externos al servidor: un sistema de tickets, una base de datos o un repositorio. Escribir un wrapper específico para cada servicio y para cada agente no escala.
El Model Context Protocol (MCP) es la solución que la industria ha adoptado. Un servidor MCP expone un conjunto de herramientas mediante un transporte estándar, y cualquier agente compatible con MCP puede utilizarlas sin código de integración personalizado. El servidor de referencia para el sistema de archivos se ejecuta con un único comando:
npx -y @modelcontextprotocol/server-filesystem /home/you/projectsPara ello, Node debe estar instalado, y el argumento de directorio es la única ruta que el servidor puede tocar. Este es el modelo de seguridad en su forma más simple: el servidor decide el límite, no el modelo. Si configuras un cliente para usarlo, tu agente obtiene capacidades de lectura y escritura de archivos que tú no tuviste que programar. La ejecución correcta de estos servidores, con una cuenta de servicio y una explicación de las opciones de transporte, se trata en ejecutar servidores MCP en un VPS para agentes de programación con IA. Para disponer de un segundo servidor que apunte a datos reales en lugar de un directorio temporal, alojar openGym, un registro de entrenamientos incluye uno de solo lectura. Así puedes practicar cómo hacer preguntas sobre tu propio historial de entrenamiento sin dar al agente nada que pueda modificar.
La lección de esta etapa es que el diseño de herramientas es el trabajo real. Una descripción imprecisa hace que el modelo tenga que adivinar. Una herramienta que devuelve cuarenta mil caracteres contamina la ventana de contexto. Una herramienta que puede eliminar elementos acabará eliminando elementos.
Etapa 4: memoria, que en su mayor parte son archivos
Los principiantes suelen recurrir aquí a una base de datos vectorial. No lo haga, al menos todavía.
Un agente no tiene memoria entre llamadas. Debe reenviar toda la conversación cada vez. Por eso una sesión larga cuesta más por turno que una sesión corta. La memoria se divide en dos problemas. El primero es qué cabe ahora en la ventana de contexto. Se gestiona mediante resúmenes, eliminando las salidas antiguas de las herramientas y almacenando en caché el prefijo estable del prompt. Así paga sólo una fracción de su precio. El segundo es qué sobrevive a un reinicio. Eso es almacenamiento.
Para el segundo problema, un archivo Markdown sencillo que el agente pueda leer y escribir es mejor que una base de datos vectorial para casi cualquier primer proyecto. Asígnele un archivo, indíquele el formato y dígale que lea ese archivo antes de empezar y lo actualice cuando aprenda algo. Obtendrá la mayor parte del beneficio y podrá abrir el archivo para ver qué cree su agente. Recurra a embeddings y recuperación cuando las notas dejen de caber en la ventana de contexto, no antes.
Etapa 5: el bucle es el producto
A estas alturas puede crear un agente que funciona mientras lo supervisa. La etapa 5 consiste en conseguir que funcione sin supervisión.
Cuatro preguntas determinan si es seguro dejar un agente desatendido. ¿Qué lo activa para que no se ejecute sin una condición? ¿Dentro de qué límite opera para que un error tenga un impacto reducido? ¿Cómo se verifica el resultado? Un agente que evalúa su propio trabajo siempre lo aprueba. ¿Qué presupuesto lo detiene, en tokens o en tiempo de reloj? Diseñar estos cuatro elementos de forma deliberada es la disciplina descrita en la ingeniería de bucles y lo que abarca esa definición.
El ejercicio: tome el agente de la etapa 2, asígnele una tarea que requiera cuatro o cinco pasos y añada un límite estricto de iteraciones. Después, quite el límite y observe cómo un bucle sin límite afecta a su factura de tokens. Hágalo una vez con un presupuesto pequeño para no repetirlo por accidente con uno grande.
Etapa 6: seguridad, secretos y costes
Esta etapa no es opcional. Es la última porque no se percibe el riesgo hasta haber construido algo que funciona.
Ejecute el agente con su propio usuario sin privilegios. Nunca lo ejecute como root ni con su propia cuenta. Así, el radio de impacto se limita a un directorio y no a toda la máquina. Mantenga las credenciales fuera del alcance del modelo, porque cualquier elemento que esté en la ventana de contexto puede volver a salir citado mediante una llamada a una herramienta. La solución consiste en usar tokens de corta duración y alcance limitado detrás de un helper, como se describe en mantener los secretos fuera de los agentes de IA. Establezca un límite máximo estricto para el gasto, porque un bucle desatendido factura cada iteración sin que nadie lo supervise. Los límites y el procesamiento por lotes que mantienen el gasto bajo control se explican en controlar el coste de un agente de IA en un VPS siempre activo.
Si el agente se ejecuta dentro de un harness en lugar de un script escrito por usted, parte de esta etapa se configura en vez de programarse. los plugins de DeepSeek Harness que conviene instalar cubren gran parte de lo mismo, con límites de presupuesto, reglas de permisos para herramientas y análisis de inyecciones.
El coste merece una cifra concreta. En julio de 2026, Claude Opus 5 factura $5 por cada millón de tokens de entrada y $25 por cada millón de tokens de salida. Un agente conversacional que reenvía una conversación cada vez más larga puede procesar varios cientos de miles de tokens en una sola tarea. El almacenamiento en caché de prompts y el uso de un modelo más pequeño para los pasos rutinarios cambian mucho más ese cálculo que cualquier ajuste del prompt.
La inyección de prompts también corresponde a esta etapa. Si el agente lee una página web, un gestor de incidencias o un buzón de entrada, la persona que escribió ese texto también está escribiendo instrucciones para el agente. La búsqueda web suele ser la primera herramienta que abre esta puerta. dirigir un agente a su propia instancia de SearXNG muestra conjuntamente la configuración y la superficie de inyección que crea. La defensa no consiste en redactar un prompt de sistema más ingenioso. Consiste en establecer límites, porque un agente que no puede eliminar un repositorio no puede ser manipulado para que lo elimine.
¿Qué ruta debe seguir?
Elija un solo plan de formación y complételo en lugar de probar seis. El repositorio de Microsoft ai-agents-for-beginners es el recurso gratuito más completo: contiene un curso de dieciocho lecciones que superó las 70,000 estrellas en julio de 2026 y se ajusta bien a las etapas anteriores. Las recopilaciones de repositorios de agentes populares sirven para conocer las opciones disponibles, pero son mucho menos útiles como programa de estudio, porque una lista ordenada por estrellas refleja la popularidad y no el orden de aprendizaje.
Cuando necesite un proyecto real para practicar, un agente de programación es el mejor objetivo inicial: la respuesta es inmediata, las herramientas son claras y los errores se pueden deshacer fácilmente. Ejecutar un agente de IA de programación en un VPS explica el proceso completo. Si prefiere estudiar sistemas funcionales en lugar de construirlos desde cero, la comparación de los mejores agentes de IA autoalojados muestra cómo varios proyectos implementan el mismo ciclo de formas diferentes.
¿Cuánto tiempo lleva?
Para alguien que ya programa, las etapas 1 y 2 ocupan una tarde. La etapa 3 lleva un fin de semana, dedicado en su mayor parte a describir las herramientas y no al protocolo. Las etapas 4 y 5 requieren varias semanas de uso real, porque sólo se aprende qué olvida el agente observando cómo lo olvida. La etapa 6 nunca termina del todo, ya que cada nueva capacidad que se le concede vuelve a abrirla.
Dos meses de trabajo constante por las tardes bastan para que la mayoría consiga un agente funcional, acotado y útil. Quienes tardan un año suelen ser quienes siguieron leyendo en lugar de construir.
FAQ
¿Necesito conocer el aprendizaje automático para crear un agente de IA?
No. Crear un agente consiste en llamar a un modelo mediante una API y conectar sus solicitudes de herramientas con funciones reales. Esto es programación de aplicaciones convencional. No es necesario ocuparse del entrenamiento, los gradientes ni los conjuntos de datos. Las capacidades que determinan si el agente funciona son el diseño de esquemas para las herramientas, el manejo de errores y los permisos de Linux. La teoría del aprendizaje automático sólo resulta relevante si después quiere ajustar un modelo, lo que constituye otro trabajo con requisitos diferentes.
¿Debo empezar con un framework como LangChain o CrewAI?
Escriba primero un bucle sin framework y adopte después uno. Un framework sustituye las treinta líneas de la etapa 2 por un objeto de configuración. Esto resulta práctico cuando ya sabe qué sustituye, pero puede resultar confuso antes de ese momento. Cuando el agente se comporta de forma incorrecta, debe analizar directamente la lista de mensajes y los resultados de las herramientas. Esto es mucho más difícil si nunca los ha visto. Después de crear un bucle propio, un framework le ahorra tiempo en lugar de ocultar el mecanismo.
¿Cuánto cuesta aprender sobre agentes de IA?
Menos de lo que espera la mayoría de las personas, si establece límites. Una clave de API alojada y un VPS pequeño cubren todo lo necesario en estas seis etapas. El riesgo real no es la tarifa por hora. Es un bucle sin límite que factura cada iteración mientras duerme. Establezca un límite de gasto estricto en su cuenta de API desde el primer día, añada un límite de iteraciones a cada bucle que escriba y use un modelo más barato para las tareas rutinarias. Ejecutar el modelo localmente elimina el coste de los tokens y lo sustituye por un requisito de hardware.
¿Cuál es la diferencia entre un agente de IA y un chatbot?
Un chatbot responde una vez. Un agente repite un ciclo: el modelo solicita una herramienta, el código la ejecuta, el resultado se devuelve y el modelo decide qué hacer después. Esa repetición permite que un agente complete una tarea con varios pasos. También explica por qué los agentes necesitan límites que los chatbots no necesitan. Una respuesta incorrecta de un chatbot es un párrafo incorrecto. Una respuesta incorrecta de un agente es un párrafo incorrecto más todo lo que haya hecho al respecto.