AI agent、LLM 與 AI assistant 有什麼不同?
LLM 需要 RAM 載入權重,AI assistant 提供聊天介面,AI agent 進一步加入工具、迴圈與憑證,因此必須部署在持續運作的主機上。
AI agent、LLM 與 AI assistant 有何差異?
AI agent、LLM 與 AI assistant 是同一個堆疊中的 3 個層次。區分它們的方法,是確認各自需要伺服器提供什麼。LLM(large language model)是由權重組成的檔案,需要 RAM 與運算資源。AI assistant 是將該模型包裝在聊天介面中,具備帳號與已儲存的歷史記錄,幾乎總是在他人的硬體上執行。AI agent 則是在 AI assistant 的基礎上加入工具與迴圈,並持有憑證;因此必須部署在持續運作的機器上。
多數關於這個問題的文章只停留在定義。定義之所以重要,是因為每個層次的計費方式不同。第一個需要 RAM。下一個需要公開 URL 與 TLS(transport layer security)。最後一個需要憑證,而 agent 使用過的憑證,就必須進行輪替。
LLM 是權重,而權重需要 RAM
LLM 是由數字組成的檔案。您下載模型後,由執行環境將其載入記憶體,再逐一處理請求。它的介面很單純:輸入文字,輸出文字。模型在不同呼叫之間沒有記憶,也沒有時鐘、網路存取權限或開啟檔案的能力。LLM 看似能「記住」的所有內容,都是由呼叫它的程式貼入其 context 的。
決定 VPS 方案的數字,是該檔案的大小,因為模型執行期間必須整個放在記憶體中。以 Ollama 預設採用的 4-bit quantisation 計算,每 1 billion 個參數約需 0.6 GB,再為 context window 和執行環境額外預留 1 或 2 GB。
The data behind this chart
[
{
"label": "qwen3:4b",
"download_gb": 2.5,
"ram_gb_needed": 6
},
{
"label": "qwen3:8b",
"download_gb": 5.2,
"ram_gb_needed": 8
},
{
"label": "qwen3:14b",
"download_gb": 9.3,
"ram_gb_needed": 12
},
{
"label": "qwen3:32b",
"download_gb": 20.0,
"ram_gb_needed": 24
}
]qwen3:8b build 在磁碟上佔用 5.2 GB,且需要約 8 GB RAM 才能在不使用 swap 的情況下執行。4 GB VPS 無法載入 qwen3:14b;該模型在您輸入第一個字之前,就已需要 9.3 GB。這裡容量最大的列 qwen3:32b 約需 24 GB,這在多數價目表中代表不同的方案,也代表不同的每月費用。
能否放入記憶體是一個問題。速度則是另一個問題。在僅使用 CPU 的 VPS 上,瓶頸是記憶體頻寬,而不是時脈速度,因此即使模型放得下,仍可能只能以每秒數個 token 的速度回應。對於整夜執行的工作,這樣的速度可以接受;但用於聊天時會令人不便。GPU 可將這項數值提高約一個數量級,費用也會隨之增加,因此請根據測量結果決定:使用預計執行的工作負載對 VPS 進行 benchmark,並閱讀GPU VPS 何時值得其費用。若要先讓權重執行起來,請從在自己的 VPS 上使用 Ollama開始。
助理是 LLM 加上聊天介面
助理是圍繞模型建立的產品層。ChatGPT 和 Claude 都是助理,包含模型、聊天視窗、帳戶、已儲存的對話及速率限制。這些功能幾乎都不在你能控制的硬體上執行,因此託管式助理需要訂閱費用,卻不會占用本機 RAM。
自架版本通常是 Open WebUI 這類前端,連接本機 Ollama 或託管式 API。前端本身是小型軟體。聊天介面常駐約需 1 GB 記憶體,另加模型所需的資源。它需要而純模型不需要的是公開 URL 和憑證,因為你會想從手機存取:使用 Certbot 和 Nginx 申請憑證,或在多個應用程式前方由 Traefik 終止 TLS。如果你仍在選擇前端,請比較 Open WebUI 的替代方案。
助理會回答問題,但不會執行操作。它產生 shell 命令時,必須由人員閱讀命令,再決定是否貼上執行。這個人員是安全防護層,而 agent 的作用就是移除這一層。
代理程式會加入工具與迴圈
代理程式是一種可呼叫函式並讀取結果的助理。這項工作由兩個部分組成。第一個部分是工具:模型可要求呼叫的函式描述,以及實際執行該函式的程式碼。第二個部分是迴圈:您的程式呼叫模型,模型要求使用工具,您的程式執行該工具,將輸出附加至對話中,再次呼叫模型。這個流程會持續執行,直到模型表示已完成,或達到限制為止。
迴圈只是一般程式碼,基本實作不到 100 行。真正讓它成為代理程式的原因,是工具使用了實際憑證,因此迴圈可以修改自身以外的系統。這項特性決定了下方所有代管方式。代理程式技能 和 MCP(模型上下文協定)伺服器是兩種在不重寫迴圈的情況下,為代理程式提供更多工具的方式。
- 它的執行時間可能超過您的工作階段。關閉分頁後,聊天就會結束。代理程式執行一次可能需要 20 分鐘,也應在筆電進入睡眠後繼續執行,因此應將它放在持續開機的主機上,並由 systemd 服務或計時器啟動,以便在重新開機後恢復執行。
- 它會持有機密資料,例如 API key、SSH key 或資料庫密碼。代理程式能讀取的任何內容,都可能因輸入中隱藏的惡意指令而被使用,因此請讓機密資料離開代理程式的存取範圍。
- 它的成本會隨迴圈增加,而不是只取決於您的問題。每個步驟都會將完整對話重新作為輸入傳送,因此執行 10 個步驟時,該逐字稿會計費 10 次。這就是為什麼輸入 token 會占代理程式費用的大部分,以及為什麼您需要為單次執行設定明確的費用上限。
- 它可能以會寫入資料的方式出錯。聊天中的錯誤答案只需要重新閱讀。迴圈中的錯誤刪除則可能刪除整個目錄。請以仍具備必要權限的最低權限使用者執行;對於程式碼代理程式,請先在提供 repository 存取權前進行沙箱隔離。
盒子各層需要的資源
The data behind this chart
[
{
"label": "LLM (weights you host)",
"ram_gb": 8,
"gpu": "helps a lot",
"public_url": "no",
"credentials": "none"
},
{
"label": "Assistant (chat surface)",
"ram_gb": 1,
"gpu": "no",
"public_url": "yes",
"credentials": "one login"
},
{
"label": "Agent (tools and a loop)",
"ram_gb": 2,
"gpu": "no",
"public_url": "only for webhooks",
"credentials": "several"
}
]請仔細閱讀 RAM 欄位,因為該欄位不包含模型。聊天前端與 agent runtime 都是小型程式。如果 agent 呼叫託管模型,執行它只需 2 GB RAM,此時選擇較便宜的方案是實際可行的做法,而不是妥協。若將模型權重放在同一台盒子上,8 GB 的模型需求就會凌駕其他所有需求。
其他欄位的重要性往往超出預期。只有模型層會因 GPU 而加速。只有 assistant 層通常需要公開 URL,因為瀏覽器必須連線到它;agent 只有在外部系統需要呼叫進來時才需要,例如 webhook。此外,agent 會持有 several 組憑證,這才是它與聊天視窗之間的實質差異。聊天視窗可能出錯。agent 可能出錯,接著還會依據錯誤結果採取行動。
執行 AI agent 需要 GPU 嗎?
不需要,除非您也在同一台機器上託管模型權重。agent loop 由 HTTP 請求、JSON 解析與 subprocess 呼叫組成,等待網路回應時 CPU 幾乎處於閒置狀態。GPU 的問題其實取決於 LLM 層。
因此,請分開評估。如果文字資料不能離開您的主機,就需要支付足以容納模型的記憶體成本;若要維持可用的速度,還需要 GPU 來執行模型。如果您只需要自動化功能,則按 token 租用模型,將預算投入正常運作時間與備份。2026 年大多數自架 agent 都會呼叫託管模型,因此執行成本較低。
可以自行代管 AI agent 嗎?
可以,而且 agent 是最值得自行代管的層,因為資料與憑證都存在於這個迴圈中。只要一台配備 2 GB RAM、服務管理器及對外網路存取能力的小型 VPS,就能執行真正的 agent。如果想自行掌控整個迴圈,請採用 在 VPS 上自行建置的方式;如果想從完成品開始,則可 部署現成的自行代管 agent。
自行代管 assistant 很簡單:只需要一個容器和一張憑證。自行代管 model 才是成本高的部分;看到 token 從 CPU 中緩慢產生後,許多人就會放棄。當資料不能離開這台主機,或使用量讓按 token 計費變得昂貴時,才自行代管 weights。否則,讓 agent 呼叫 API,並將重要部分留在本機。
ChatGPT 是 AI agent 嗎?
只要聊天產品能呼叫工具,並在未先徵求您同意的情況下根據結果採取行動,就會成為 agent。依此標準,具備瀏覽、程式碼執行或連接器功能的代管助理都是 agent。對您而言,差異在於這個迴圈在哪裡執行,以及使用誰的憑證。使用代管產品時,這兩者都屬於供應商。在您自己的伺服器上,這兩者都屬於您;迴圈在凌晨 3 點執行任何操作時,相關責任也由您承擔。
反應式、規劃式與多代理程式
各種整理文章常列出 7 種代理程式。其中多數分類只是行銷用語。真正會改變程式碼的有 2 項區分,會改變費用的則有 1 項。
反應式代理程式會呼叫工具、讀取回應,然後直接回覆。規劃式代理程式會先撰寫計畫,再依計畫執行。這種方式在長時間執行的工作中較穩定,但會耗用更多 tokens,因為每個步驟都會重新傳送計畫。
多代理程式架構允許一個代理程式啟動其他代理程式。這會同時增加 token 用量與失敗模式,因此只有在子工作確實彼此獨立時才值得採用,例如同時搜尋 4 個來源。
先從反應式代理程式開始。執行時間變長時,再加入規劃。最後才考慮多代理程式。若要了解更完整的範圍,請參閱 2026 年值得了解的 AI 代理程式內容。
實際執行在哪一層的判斷方法
在伺服器上,查看哪些程序占用記憶體。
free -h
ps -eo rss,comm --sort=-rss | head -5如果最上方的程序是 ollama 或 llama-server,並且占用數 GB 的 RSS(resident set size,程序實際占用的記憶體),表示你正在託管模型。如果沒有任何程序超過數百 MB,但 API 帳單持續增加,表示你正在託管 agent 或 assistant,並租用模型。如果清單為空,因為所有工作都在瀏覽器分頁中完成,表示你是 assistant 的客戶。這是很合適的使用方式,直到你需要能代表你執行工作的軟體為止。
要執行哪一個?
- 若要讓文字保持私密,請執行模型:使用 Ollama 自架 LLM;當使用者從 1 人增加到 10 人後,再比較 Ollama 與 vLLM 的執行效能。
- 若要自行掌控流程與工具,請建置代理程式:在 VPS 上建置自己的 AI 代理程式。
- 若希望今天晚上就能使用,請從 值得執行的自架代理程式 中部署已完成的方案。
- 如果目前還沒有伺服器支援上述任何方案,請先從 VPS 實際能提供什麼 開始。
FAQ
AI agent 只是多做幾個步驟的 LLM 嗎?
多出的步驟就是產品本身。LLM 只能將文字轉成文字。Agent 則在 LLM 外圍加入可呼叫的工具,以及持續呼叫這些工具的迴圈;而這些工具帶有憑證,因此其輸出可以修改檔案、資料庫或運作中的服務。這也是 agent 需要持續開機的機器、服務管理程式與 secrets 政策,而 LLM 只需要足夠的記憶體在回應時容納其權重。
執行 AI agent 需要 GPU 嗎?
執行 agent 不需要。這個迴圈只會發出 HTTP 請求、處理 JSON 並呼叫 subprocess;在等待網路回應時,任何 CPU 都能處理這些工作。只有在自行託管模型權重,且希望模型每秒產生超過少量 token 時,才需要 GPU。呼叫託管模型的 agent,即使使用完全沒有 GPU 的小型 VPS,也能順暢執行。
AI agent 需要多少 RAM 的 VPS?
agent 呼叫託管模型時,約需 2 GB,因為它只需容納 runtime、相依套件與小型本機資料庫。若自行託管模型權重,還須額外加入模型所需的記憶體:僅 qwen3:8b 就約需 8 GB。因此,整合所有元件的主機至少要從這個數值開始,並隨所選模型而增加。
我可以自行託管 AI 助理並保護對話隱私嗎?
可以,但有一項關鍵條件。Open WebUI 等自託管前端會將帳戶與歷史記錄保留在你的伺服器上。只有在背後使用的模型也在本機執行時,對話內容才會維持私密。若將相同前端指向託管 API,每則訊息的文字仍會離開你的主機,因此你保留的是歷史記錄,而不是隱私。
AI agent 與 chatbot 有什麼差異?
Chatbot 回覆後就停止。Agent 會決定下一步、呼叫工具、讀取結果,再次做出決定,直到工作完成或達到限制為止。實務上的判斷方式是:如果軟體能在回答與執行動作之間不需要人類按下按鈕,就修改某項內容,那就是 agent;它也需要相應的託管環境與防護措施。