SSD Nodes Learn 🎉 VPS da $4.99/mese
Guide Matt ConnorDi Matt Connor · Aggiornato 2026-08-07

Agente AI, LLM o assistente AI: differenze e risorse

Un LLM richiede RAM, un assistente aggiunge chat e cronologia, un agente usa strumenti, credenziali e un ciclo di esecuzione su una macchina sempre accesa.

Che differenza c'è tra un agente AI, un LLM e un assistente AI?

Un agente AI, un LLM e un assistente AI sono tre livelli dello stesso stack. Per distinguerli, chiediti quali risorse ciascuno richiede da un server. Un LLM (large language model) è un file di pesi che richiede RAM e capacità di calcolo. Un assistente è quel modello integrato in un'interfaccia di chat, con un account e una cronologia salvata, quasi sempre sull'hardware di qualcun altro. Un agente è un assistente che dispone anche di strumenti e di un ciclo di esecuzione. Inoltre conserva credenziali, ed è questo che ne impone l'esecuzione su una macchina sempre accesa.

La maggior parte degli articoli su questo argomento si limita alle definizioni. Le definizioni contano solo perché ogni livello comporta costi diversi. Il primo richiede RAM. Il successivo richiede un URL pubblico e TLS (transport layer security). L'ultimo richiede credenziali. Una credenziale utilizzata da un agente è una credenziale che ora devi ruotare.

Un modello LLM è composto da pesi, che richiedono RAM

Un modello LLM è un file contenente numeri. Lo scarichi, un runtime lo carica in memoria e il modello risponde a una richiesta alla volta. Il contratto è limitato: entra testo ed esce testo. Il modello non conserva memoria tra una chiamata e l’altra, non ha un orologio, non può accedere alla rete e non può aprire file. Tutto ciò che un LLM sembra ricordare viene inserito nel suo contesto dal programma che lo chiama.

La dimensione del file determina il piano VPS necessario, perché il file completo resta in memoria durante l’esecuzione del modello. Con la quantizzazione a 4 bit distribuita per impostazione predefinita da Ollama, considera circa 0.6 GB per miliardo di parametri, quindi aggiungi uno o due gigabyte per la finestra di contesto e il runtime.

ChartQwen3 download size and the RAM the box needs (published sizes, ollama.com, August 2026)
The data behind this chart
[
  {
    "label": "qwen3:4b",
    "download_gb": 2.5,
    "ram_gb_needed": 6
  },
  {
    "label": "qwen3:8b",
    "download_gb": 5.2,
    "ram_gb_needed": 8
  },
  {
    "label": "qwen3:14b",
    "download_gb": 9.3,
    "ram_gb_needed": 12
  },
  {
    "label": "qwen3:32b",
    "download_gb": 20.0,
    "ram_gb_needed": 24
  }
]

La build qwen3:8b occupa 5.2 GB su disco e richiede circa 8 GB di RAM per funzionare senza ricorrere allo swapping. Una VPS da 4 GB non riesce a caricare qwen3:14b, che occupa 9.3 GB prima ancora che tu inserisca una sola parola. La riga più grande, qwen3:32b, richiede circa 24 GB, che nella maggior parte dei listini corrispondono a un piano diverso e a un costo mensile diverso.

Entrare in memoria è una questione. La velocità è un’altra. Su una VPS che usa soltanto la CPU, il collo di bottiglia è la larghezza di banda della memoria, non la frequenza di clock. Perciò un modello che entra in memoria può comunque rispondere a pochi token al secondo. Questo può essere accettabile per un’attività eseguita durante la notte, ma è poco pratico per una chat. Una GPU aumenta questo valore di circa un ordine di grandezza e aumenta anche il costo. Decidi quindi sulla base di una misurazione: esegui il benchmark della VPS con il carico di lavoro che prevedi di utilizzare e leggi quando una VPS con GPU giustifica il costo. Per eseguire i pesi, inizia da Ollama sulla tua VPS.

Un assistant è un LLM con un'interfaccia di chat

Un assistant è il livello applicativo che circonda un modello. ChatGPT e Claude sono assistant: un modello, una finestra di chat, un account, conversazioni salvate e un limite di frequenza. Quasi nulla di tutto questo viene eseguito su hardware sotto il tuo controllo, perciò un assistant ospitato richiede un abbonamento e 0 RAM.

La versione self-hosted è un front end come Open WebUI, collegato a un Ollama locale o a un'API ospitata. Il front end è un software di dimensioni ridotte. Considera circa 1 GB di RAM residente per l'interfaccia di chat, oltre alla memoria richiesta dal modello. A differenza di un modello isolato, richiede un URL pubblico e un certificato, perché vuoi raggiungerlo da un telefono: genera il certificato con Certbot e Nginx, oppure termina TLS con Traefik davanti a diverse applicazioni. Se stai ancora scegliendo un front end, confronta le alternative a Open WebUI.

Un assistant risponde. Non esegue azioni. Quando genera un comando shell, una persona lo legge e decide se incollarlo. Quella persona è un livello di sicurezza; un agent è ciò che lo rimuove.

Un agente aggiunge strumenti e un ciclo

Un agente è un assistente che può chiamare funzioni e leggerne i risultati. Il lavoro è svolto da due componenti. La prima è uno strumento: una descrizione di una funzione che il modello può richiedere, più il codice che la esegue realmente. La seconda è il ciclo: il programma chiama il modello, il modello richiede uno strumento, il programma lo esegue, aggiunge l'output alla conversazione e chiama di nuovo il modello. Il processo continua finché il modello non indica di aver terminato oppure finché non viene raggiunto un limite.

Il ciclo è semplice codice applicativo e una versione di base può essere contenuta in meno di cento righe. Ciò che lo rende un agente è il fatto che gli strumenti utilizzano credenziali reali, quindi il ciclo può modificare risorse esterne. Questo aspetto determina tutte le decisioni di hosting descritte di seguito. Competenze dell'agente e server MCP (model context protocol) sono due modi per fornire all'agente altri strumenti senza riscrivere il ciclo.

Cosa richiede ogni livello dal server

ChartWhat each layer asks of a server you own
The data behind this chart
[
  {
    "label": "LLM (weights you host)",
    "ram_gb": 8,
    "gpu": "helps a lot",
    "public_url": "no",
    "credentials": "none"
  },
  {
    "label": "Assistant (chat surface)",
    "ram_gb": 1,
    "gpu": "no",
    "public_url": "yes",
    "credentials": "one login"
  },
  {
    "label": "Agent (tools and a loop)",
    "ram_gb": 2,
    "gpu": "no",
    "public_url": "only for webhooks",
    "credentials": "several"
  }
]

Leggi con attenzione la colonna della RAM, perché il modello è escluso dal calcolo. Un frontend di chat e un runtime per agenti sono entrambi programmi di piccole dimensioni. Se l'agente usa un modello ospitato, per eseguirlo bastano 2 GB di RAM e un piano economico è una scelta effettiva, non un compromesso. Se invece memorizzi i pesi sullo stesso server, la riga del modello da 8 GB incide più di tutto il resto.

Le altre colonne sono più importanti di quanto si pensi. Solo il livello del modello diventa più veloce con una GPU. Solo il livello dell'assistente richiede normalmente un URL pubblico, perché un browser deve raggiungerlo; a un agente serve soltanto quando qualcosa dall'esterno deve chiamarlo, ad esempio tramite un webhook. Inoltre, un agente conserva several credenziali: questa è la differenza sostanziale rispetto a una finestra di chat. Una finestra di chat può fornire una risposta errata. Un agente può fornire una risposta errata e poi agire di conseguenza.

È necessaria una GPU per eseguire un agente AI?

No, a meno che non ospitiate anche i pesi del modello sulla stessa macchina. Il ciclo dell'agente consiste in richieste HTTP, analisi di JSON e chiamate a processi secondari. Durante l'attesa della rete, la CPU resta quasi inattiva. La domanda sulla GPU riguarda in realtà il livello LLM.

Separate quindi le due decisioni. Se il testo non può lasciare il vostro server, dovete acquistare memoria sufficiente per contenere un modello e, per ottenere una velocità utilizzabile, una GPU per eseguirlo. Se vi interessa soltanto l'automazione, utilizzate un modello ospitato e pagate in base ai token; destinate invece il budget all'alta disponibilità e ai backup. Nel 2026, la maggior parte degli agenti self-hosted chiama un modello ospitato e, per questo motivo, ha costi di gestione inferiori.

Puoi gestire autonomamente un agente AI?

Sì. L'agente è il componente che conviene di più gestire autonomamente, perché il ciclo operativo è il punto in cui risiedono i tuoi dati e le tue credenziali. Un piccolo VPS con 2 GB di RAM, un gestore dei servizi e accesso alla rete in uscita può eseguire un agente reale. Scegli il percorso per crearlo autonomamente su un VPS se vuoi gestire direttamente il ciclo operativo, oppure distribuisci uno degli agenti self-hosted pronti all'uso se preferisci partire da una soluzione già completa.

Gestire autonomamente l'assistente è semplice: servono un container e un certificato. Gestire autonomamente il modello è la parte costosa, ed è il motivo per cui molti abbandonano dopo aver visto i token essere elaborati lentamente dalla CPU. Gestisci autonomamente i pesi quando i dati non possono lasciare il server o quando il volume di utilizzo rende oneroso il prezzo per token. In caso contrario, lascia che l'agente chiami un'API e mantieni localmente le parti più importanti.

ChatGPT è un agente di intelligenza artificiale?

Un prodotto di chat diventa un agente nel momento in cui può chiamare uno strumento e agire sul risultato senza chiedere prima la tua autorizzazione. Secondo questo criterio, gli assistenti in hosting con funzioni di navigazione web, esecuzione del codice o connettori sono agenti. Per te, la differenza riguarda il luogo in cui viene eseguito il ciclo e le credenziali utilizzate. In un prodotto in hosting, entrambi appartengono al fornitore. Sul tuo server, entrambi appartengono a te, insieme alla responsabilità per qualunque azione il ciclo esegua alle tre di notte.

Agenti reattivi, con pianificazione e multi-agente

I riepiloghi elencano spesso sette tipi di agenti. La maggior parte di queste categorie ha valore soprattutto commerciale. Due distinzioni cambiano il codice da scrivere e una cambia i costi. Un agente reattivo chiama uno strumento, legge la risposta e risponde. Un agente con pianificazione scrive prima un piano e poi lo esegue passo dopo passo. Questo approccio è più efficace per le attività lunghe, ma utilizza più token perché il piano viene inviato nuovamente a ogni passaggio. Un'architettura multi-agente consente a un agente di avviarne altri. Allo stesso tempo, moltiplica il consumo di token e le modalità di errore. Conviene quindi utilizzarla solo quando le sottoattività sono realmente indipendenti, ad esempio per cercare contemporaneamente in quattro fonti. Inizia con un agente reattivo. Aggiungi la pianificazione quando le esecuzioni diventano lunghe. Utilizza il multi-agente solo come ultima opzione. Per una panoramica più ampia, consulta cosa vale la pena imparare sugli agenti AI nel 2026.

Come capire su quale livello si sta realmente eseguendo

Sul server, verificare quali processi occupano la memoria.

free -h
ps -eo rss,comm --sort=-rss | head -5

Se la prima riga è ollama o llama-server e occupa diversi gigabyte di RSS (resident set size, ovvero la memoria effettivamente occupata da un processo), si sta eseguendo il modello sul proprio server. Se nessun processo supera qualche centinaio di megabyte e il costo dell'API continua ad aumentare, si sta eseguendo un agent o un assistant e si sta utilizzando il modello a noleggio. Se l'elenco è vuoto perché tutto avviene in una scheda del browser, si è utenti di un assistant. È una scelta adeguata finché non serve un software che agisca per conto dell'utente.

Quale vuoi eseguire?

FAQ

Un agente AI è solo un LLM con qualche passaggio in più?

I passaggi aggiuntivi sono il prodotto. Un LLM trasforma il testo in testo e non fa altro. Un agente lo integra con strumenti che può chiamare e con un ciclo che continua a chiamarli; questi strumenti dispongono di credenziali, quindi l’output può modificare un file, un database o un servizio attivo. Per questo un agente richiede una macchina sempre accesa, un service manager e una policy per i secret, mentre a un LLM serve soltanto memoria sufficiente per mantenere i propri pesi durante la risposta.

Serve una GPU per eseguire un agente AI?

Non per l’agente. Il ciclo esegue richieste HTTP, gestisce JSON e chiama subprocess, operazioni che qualsiasi CPU può gestire mentre attende la rete. Serve una GPU solo se ospiti direttamente i pesi del modello e vuoi ottenere più di pochi token al secondo. Un agente che chiama un modello in hosting funziona senza problemi su un piccolo VPS, anche senza GPU.

Quanta RAM richiede un VPS per un agente AI?

Circa 2 GB quando l’agente chiama un modello in hosting, perché deve contenere solo il runtime, le relative dipendenze e un piccolo database locale. Se ospiti anche i pesi, devi aggiungere il modello: qwen3:8b da solo richiede circa 8 GB. Un sistema all-in-one parte quindi da quel valore e cresce in base al modello scelto.

Posso eseguire autonomamente un assistente AI e mantenere private le mie conversazioni?

Sì, con una condizione decisiva. Un frontend self-hosted come Open WebUI mantiene account e cronologia sul server. Le conversazioni restano private solo se anche il modello sottostante è locale. Se colleghi lo stesso frontend a un’API in hosting, il testo lascia comunque il server a ogni messaggio: conservi la cronologia, ma non la privacy.

Qual è la differenza tra un agente AI e un chatbot?

Un chatbot risponde e si ferma. Un agente decide cosa fare dopo, chiama uno strumento, legge il risultato e decide di nuovo, finché il lavoro non è completato o un limite non lo interrompe. Il criterio pratico è questo: se il software può modificare qualcosa senza che una persona prema un pulsante tra la risposta e l’azione, è un agente e richiede l’hosting e le misure di protezione associati.