Diferencias entre agente de IA, LLM y asistente
Un LLM necesita RAM; un asistente añade chat, cuenta e historial; un agente suma herramientas, bucle y credenciales, por lo que requiere un equipo siempre encendido.
¿Cuál es la diferencia entre un agente de IA, un LLM y un asistente de IA?
Un agente de IA, un LLM y un asistente de IA son tres capas de una misma pila. Para distinguirlos, pregunte qué necesita cada uno de un servidor. Un LLM (modelo de lenguaje grande) es un archivo de pesos que necesita RAM y capacidad de cómputo. Un asistente es ese modelo integrado en una interfaz de chat, con una cuenta e historial guardado, casi siempre en hardware de otra persona. Un agente es un asistente que también tiene herramientas y un bucle de ejecución. Además, conserva credenciales. Por eso necesita ejecutarse en una máquina que permanezca encendida.
La mayoría de los textos sobre esta cuestión se detienen en las definiciones. Las definiciones sólo importan porque cada capa genera costes diferentes. Una consume RAM. La siguiente requiere una URL pública y TLS (seguridad de la capa de transporte). La última requiere credenciales. Cuando un agente utiliza una credencial, debe rotarla.
Un LLM son pesos, y los pesos necesitan RAM
Un LLM es un archivo de números. Se descarga, un runtime lo carga en memoria y responde una solicitud cada vez. El contrato es limitado: entra texto y sale texto. El modelo no tiene memoria entre llamadas, reloj, acceso a la red ni forma de abrir un archivo. Todo lo que un LLM parece recordar lo ha incluido en su contexto el programa que lo llama.
El número que determina el plan de VPS es el tamaño de ese archivo, porque permanece completamente en memoria mientras se ejecuta el modelo. Con la cuantización de 4 bits que Ollama distribuye de forma predeterminada, calcule aproximadamente 0.6 GB por cada mil millones de parámetros. Después, añada uno o dos gigabytes para la ventana de contexto y el propio runtime.
The data behind this chart
[
{
"label": "qwen3:4b",
"download_gb": 2.5,
"ram_gb_needed": 6
},
{
"label": "qwen3:8b",
"download_gb": 5.2,
"ram_gb_needed": 8
},
{
"label": "qwen3:14b",
"download_gb": 9.3,
"ram_gb_needed": 12
},
{
"label": "qwen3:32b",
"download_gb": 20.0,
"ram_gb_needed": 24
}
]La compilación qwen3:8b ocupa 5.2 GB en disco y necesita aproximadamente 8 GB de RAM para ejecutarse sin usar swap. Un VPS de 4 GB no puede cargar qwen3:14b, que ocupa 9.3 GB antes de introducir una sola palabra. La fila más grande, qwen3:32b, necesita aproximadamente 24 GB, lo que en la mayoría de las listas de precios corresponde a otro plan y otra factura mensual.
Caber en memoria es una cuestión. La velocidad es otra. En un VPS que sólo usa CPU, el cuello de botella es el ancho de banda de memoria y no la velocidad de reloj. Por eso, un modelo que cabe puede responder a sólo unos pocos tokens por segundo. Esto es aceptable para una tarea que se ejecuta durante la noche, pero resulta incómodo para un chat. Una GPU aumenta esa cifra aproximadamente un orden de magnitud y también aumenta el importe, así que decida basándose en una medición: compare el rendimiento del VPS con la carga de trabajo que piensa ejecutar y lea cuándo un VPS con GPU justifica su precio. Para ejecutar los pesos, empiece por Ollama en su propio VPS.
Un asistente es un LLM más una interfaz de chat
Un asistente es la capa de producto que rodea a un modelo. ChatGPT y Claude son asistentes: un modelo, una ventana de chat, una cuenta, conversaciones guardadas y un límite de solicitudes. Casi nada de eso se ejecuta en hardware que usted controle. Por eso, un asistente alojado cuesta una suscripción y 0 GB de RAM local.
La versión autohospedada es un frontend como Open WebUI conectado a un Ollama local o a una API alojada. El frontend es un software pequeño. Calcule aproximadamente 1 GB de memoria residente para la interfaz de chat, además de lo que necesite el modelo. A diferencia de un modelo independiente, necesita una URL pública y un certificado porque querrá acceder desde un teléfono: emita el certificado con Certbot y Nginx, o termine TLS en Traefik delante de varias aplicaciones. Si todavía está eligiendo un frontend, compare las alternativas a Open WebUI.
Un asistente responde. No actúa. Cuando escribe un comando de shell, una persona lo lee y decide si lo pega. Esa persona es una capa de seguridad, y un agente es lo que la elimina.
Un agente añade herramientas y un bucle
Un agente es un asistente que puede llamar a funciones y leer sus resultados. Dos partes realizan el trabajo. La primera es una herramienta: una descripción de una función que el modelo puede solicitar, junto con el código que la ejecuta. La segunda es el bucle: el programa llama al modelo, el modelo solicita una herramienta, el programa la ejecuta, añade la salida a la conversación y vuelve a llamar al modelo. El proceso se repite hasta que el modelo indica que ha terminado o se alcanza un límite.
El bucle es código normal, y uno básico cabe en menos de cien líneas. Lo que lo convierte en un agente es que las herramientas contienen credenciales reales, por lo que el bucle puede cambiar algo fuera de sí mismo. Ese único hecho determina todas las decisiones de alojamiento siguientes. Habilidades de agente y servidores MCP (protocolo de contexto del modelo) son dos formas de proporcionar más herramientas a un agente sin reescribir el bucle.
- Sobrevive a la sesión. Un chat termina cuando cierra la pestaña. Una ejecución del agente puede tardar veinte minutos y debe sobrevivir a la suspensión del portátil, por lo que debe ejecutarse en un equipo que permanezca encendido, iniciado por un servicio o temporizador de systemd que lo vuelva a iniciar después de un reinicio.
- Contiene secretos. Una clave de API, una clave SSH o una contraseña de base de datos. Una instrucción maliciosa oculta en la entrada puede hacer que el agente use cualquier dato que pueda leer, por lo que debe mantener los secretos fuera del alcance del agente.
- Su coste crece con el bucle, no con la pregunta. Cada paso vuelve a enviar toda la conversación como entrada, por lo que una ejecución de diez pasos paga diez veces por esa transcripción. Por eso los tokens de entrada dominan el coste de un agente y por eso necesita un límite estricto para el gasto de cada ejecución.
- Puede equivocarse de una forma que escriba datos. Una respuesta incorrecta en un chat sólo requiere volver a leerla. Un
deleteincorrecto dentro de un bucle puede eliminar el directorio. Ejecútelo como un usuario con los privilegios mínimos que le permitan funcionar y, en el caso de los agentes de programación, ejecútelo en un entorno aislado antes de darle acceso a su repositorio.
Qué necesita cada capa del equipo
The data behind this chart
[
{
"label": "LLM (weights you host)",
"ram_gb": 8,
"gpu": "helps a lot",
"public_url": "no",
"credentials": "none"
},
{
"label": "Assistant (chat surface)",
"ram_gb": 1,
"gpu": "no",
"public_url": "yes",
"credentials": "one login"
},
{
"label": "Agent (tools and a loop)",
"ram_gb": 2,
"gpu": "no",
"public_url": "only for webhooks",
"credentials": "several"
}
]Lea atentamente la columna de RAM, porque no incluye el modelo. Una interfaz de chat y un entorno de ejecución de agentes son programas pequeños. Si el agente llama a un modelo alojado, 2 GB de RAM son suficientes para ejecutarlo, y un plan económico es una opción válida, no una solución de compromiso. Si coloca los pesos en el mismo equipo, la línea del modelo de 8 GB domina todas las demás.
Las otras columnas importan más de lo que suele pensarse. Sólo la capa del modelo se acelera con una GPU. Sólo la capa del asistente necesita normalmente una URL pública, porque un navegador debe acceder a ella; un agente sólo la necesita cuando algo externo debe llamarlo, por ejemplo mediante un webhook. Además, un agente almacena several credenciales, y esa es la diferencia real entre un agente y una ventana de chat. Una ventana de chat puede equivocarse. Un agente puede equivocarse y actuar a partir de ese error.
¿Necesita una GPU para ejecutar un agente de IA?
No, a menos que también aloje los pesos del modelo en el mismo equipo. El bucle del agente realiza peticiones HTTP, analiza JSON y ejecuta llamadas a subprocesos. La CPU permanece casi inactiva mientras espera a la red. La cuestión de la GPU es, en realidad, una cuestión de la capa del LLM.
Por tanto, separe la decisión. Si el texto no puede salir de su equipo, pague la memoria necesaria para alojar un modelo y, para obtener una velocidad utilizable, una GPU para ejecutarlo. Si sólo quiere la automatización, pague el modelo por token y destine el presupuesto a la disponibilidad y las copias de seguridad. La mayoría de los agentes autoalojados en 2026 llaman a un modelo alojado y, por eso, son más baratos de ejecutar.
¿Puede alojar un agente de IA por su cuenta?
Sí. El agente es la capa que más merece alojarse por cuenta propia, porque el bucle es donde se encuentran sus datos y sus credenciales. Un VPS pequeño con 2 GB de RAM, un gestor de servicios y acceso de salida a la red puede ejecutar un agente real. Siga la ruta para crear uno propio en un VPS si quiere controlar el bucle, o implemente uno de los agentes autohospedados listos para usar si prefiere empezar con algo ya terminado.
Alojar el asistente por cuenta propia es sencillo: consiste en un contenedor y un certificado. Alojar el modelo por cuenta propia es la parte costosa, y es lo que muchas personas abandonan después de ver cómo los tokens salen lentamente de una CPU. Aloje los pesos por cuenta propia cuando los datos no puedan salir del servidor o cuando el volumen de uso haga que el precio por token resulte elevado. En los demás casos, deje que el agente llame a una API y mantenga las partes importantes en local.
¿ChatGPT es un agente de IA?
Un producto de chat se convierte en un agente en el momento en que puede llamar a una herramienta y actuar según el resultado sin pedirle permiso primero. Según este criterio, los asistentes alojados con navegación, ejecución de código o conectores son agentes. Para usted, la diferencia está en dónde se ejecuta el ciclo y qué credenciales utiliza. En un producto alojado, ambos elementos pertenecen al proveedor. En su propio servidor, ambos le pertenecen a usted, junto con la responsabilidad por todo lo que haga el ciclo a las tres de la mañana.
Reactivo, con planificación y multiagente
Las recopilaciones suelen enumerar siete tipos de agentes. La mayoría de esas categorías son marketing. Dos distinciones cambian el código que escribe y una cambia el coste. Un agente reactivo llama a una herramienta, lee la respuesta y responde. Un agente con planificación escribe primero un plan y después lo ejecuta. Esto funciona mejor en tareas largas y consume más tokens, porque el plan se vuelve a enviar en cada paso. Una configuración multiagente permite que un agente inicie otros agentes. También multiplica el consumo de tokens y los modos de fallo, por lo que sólo compensa cuando las subtareas son realmente independientes, como buscar en cuatro fuentes a la vez. Empiece con un agente reactivo. Añada planificación cuando las ejecuciones sean largas. Use multiagente sólo como último recurso. Para obtener una visión más amplia, consulte qué merece la pena aprender sobre los agentes de IA en 2026.
Cómo saber en qué capa se está ejecutando realmente
En el servidor, compruebe qué procesos ocupan la memoria.
free -h
ps -eo rss,comm --sort=-rss | head -5Si la primera línea muestra que ollama o llama-server ocupa varios gigabytes de RSS (resident set size, la memoria que realmente ocupa un proceso), usted aloja el modelo. Si ningún proceso supera unos cientos de megabytes y la factura de su API sigue aumentando, usted aloja un agente o un asistente y alquila el modelo. Si esa lista está vacía porque todo ocurre en una pestaña del navegador, usted es cliente de un asistente. Es una situación adecuada hasta que necesite software que actúe en su nombre.
¿Cuál quieres ejecutar?
- Para mantener el texto privado, ejecuta el modelo: aloja un LLM de forma local con Ollama y, cuando un usuario se convierta en diez, compara los tiempos de ejecución con Ollama frente a vLLM.
- Para controlar todo el ciclo y las herramientas, crea el agente: crea tu propio agente de IA en un VPS.
- Para tener algo funcionando esta misma tarde, implementa uno ya terminado de los agentes autoalojados que merece la pena ejecutar.
- Si todavía no hay un servidor detrás de nada de esto, empieza por lo que ofrece realmente un VPS.
FAQ
¿Un agente de IA es sólo un LLM con pasos adicionales?
Los pasos adicionales son el producto. Un LLM convierte texto en texto y no hace nada más. Un agente lo rodea de herramientas que puede invocar y de un bucle que las sigue invocando. Esas herramientas tienen credenciales, por lo que la salida puede modificar un archivo, una base de datos o un servicio activo. Por eso, un agente necesita una máquina encendida de forma permanente, un gestor de servicios y una política de secretos. Un LLM sólo necesita memoria suficiente para mantener sus pesos mientras responde.
¿Necesito una GPU para ejecutar un agente de IA?
No para el agente. El bucle realiza peticiones HTTP, procesa JSON y ejecuta subprocesos. Cualquier CPU puede gestionar estas tareas mientras espera a la red. Sólo necesita una GPU si aloja los pesos del modelo por su cuenta y quiere obtener más de unos pocos tokens por segundo. Un agente que invoca un modelo alojado funciona correctamente en un VPS pequeño sin GPU.
¿Cuánta RAM necesita un VPS para un agente de IA?
Aproximadamente 2 GB cuando el agente invoca un modelo alojado, porque sólo mantiene el runtime, sus dependencias y una base de datos local pequeña. Añada el modelo si aloja los pesos: qwen3:8b por sí solo necesita alrededor de 8 GB. Por tanto, un servidor todo en uno parte de esa cifra y aumenta según el modelo que elija.
¿Puedo alojar mi propio asistente de IA y mantener privadas mis conversaciones?
Sí, con una salvedad que lo determina todo. Un frontend alojado por usted, como Open WebUI, mantiene las cuentas y el historial en su servidor. Las conversaciones sólo permanecen privadas si el modelo que hay detrás también es local. Si conecta el mismo frontend a una API alojada, el texto sale de su servidor con cada mensaje. En ese caso conserva el historial, pero no la privacidad.
¿Cuál es la diferencia entre un agente de IA y un chatbot?
Un chatbot responde y se detiene. Un agente decide qué hacer a continuación, invoca una herramienta, lee el resultado y vuelve a decidir hasta completar el trabajo o alcanzar un límite. La prueba práctica es la siguiente: si el software puede modificar algo sin que una persona pulse un botón entre la respuesta y la acción, es un agente. Por tanto, necesita el alojamiento y las medidas de protección asociados.