SSD Nodes Learn 🎉 VPS $4.99/月起
指南 Matt Connor作者: Matt Connor · 更新于 2026-08-07

AI Agent、LLM 和 AI 助手有什么区别?

LLM 是需要 RAM 的权重文件,AI 助手增加聊天界面,Agent 增加工具、循环和凭据。本文解释三者的服务器、联网与安全要求,以及为什么 Agent 需要持续在线的机器。

AI agent、LLM 和 AI assistant 有什么区别?

AI agent、LLM 和 AI assistant 是同一技术栈的三个层级。区分它们的方法,是看每一层需要服务器提供什么。LLM(large language model,大语言模型)是一个权重文件,需要 RAM 和计算资源。assistant 是封装在聊天界面中的模型,带有账户和保存的历史记录,几乎总是运行在他人的硬件上。agent 则是在 assistant 的基础上增加工具和循环机制,并持有凭据;因此它必须运行在一台持续在线的机器上。

关于这个问题的大多数文章都会停留在定义上。但定义之所以重要,是因为每一层的成本不同。第一层消耗 RAM。下一层需要公网 URL 和 TLS(transport layer security,传输层安全)。最后一层需要凭据;agent 使用过某个凭据后,您就必须轮换该凭据。

LLM 是权重,权重需要 RAM

LLM 是一个数字文件。您下载该文件,运行时将其加载到内存中,然后一次处理一个请求。它的接口范围很窄:输入文本,输出文本。模型在两次调用之间不会保留记忆,也没有时钟、网络访问权限或打开文件的能力。LLM 看起来能够“记住”的所有内容,都是调用它的程序预先写入其上下文的。

决定 VPS 方案的数字是该文件的大小,因为模型运行期间需要将整个文件保留在内存中。Ollama 默认发布的 4-bit 量化模型,每 1 billion 个参数大约需要 0.6 GB 内存;此外还要为上下文窗口和运行时额外预留 1 到 2 GB。

ChartQwen3 download size and the RAM the box needs (published sizes, ollama.com, August 2026)
The data behind this chart
[
  {
    "label": "qwen3:4b",
    "download_gb": 2.5,
    "ram_gb_needed": 6
  },
  {
    "label": "qwen3:8b",
    "download_gb": 5.2,
    "ram_gb_needed": 8
  },
  {
    "label": "qwen3:14b",
    "download_gb": 9.3,
    "ram_gb_needed": 12
  },
  {
    "label": "qwen3:32b",
    "download_gb": 20.0,
    "ram_gb_needed": 24
  }
]

qwen3:8b构建版本在磁盘上占用 5.2 GB,运行时大约需要 8 GB RAM 才能避免交换。4 GB VPS 无法加载 qwen3:14b;该模型在您输入任何内容之前就已经占用 9.3 GB。这里最大的模型是 qwen3:32b,大约需要 24 GB。大多数价目表会将其归入不同的方案,对应不同的月费。

能否装入内存是一个问题。运行速度是另一个问题。在仅使用 CPU 的 VPS 上,瓶颈通常是内存带宽,而不是时钟速度。因此,即使模型能够装入内存,每秒仍可能只能生成几个 token。对于可以运行一整晚的任务,这样的速度可以接受;用于聊天则体验较差。GPU 通常可以将这一数值提高约一个数量级,但费用也会增加。因此应根据测量结果做决定:使用计划运行的工作负载对 VPS 进行基准测试,并阅读GPU VPS 何时值得其价格。如果要让模型权重正常运行,请先阅读在您自己的 VPS 上运行 Ollama

助手是 LLM 加聊天界面

助手是围绕模型构建的产品层。ChatGPT 和 Claude 都是助手:包含模型、聊天窗口、账户、已保存的对话和速率限制。其中几乎没有任何部分运行在您控制的硬件上,因此托管助手需要订阅费用,但不占用您的 RAM。

自托管版本可以使用 Open WebUI 这样的前端,并连接本地 Ollama 或托管 API。前端本身是小型软件。聊天界面常驻内存预计需要约 1 GB,此外还要满足模型的内存需求。与裸模型不同,前端需要公网 URL 和证书,因为您需要从手机访问它:使用 Certbot 和 Nginx 申请证书,或者在多个应用前使用 Traefik 终止 TLS。如果您还在选择前端,请比较 Open WebUI 的替代方案

助手负责回答问题,但不会执行操作。它生成 shell 命令后,由人员阅读命令并决定是否粘贴执行。人员是安全层,而 agent 会移除这一层。

代理会添加工具并运行循环

代理是一种可以调用函数并读取结果的助手。两部分共同完成这项工作。第一部分是工具:其中包含模型可以请求调用的函数描述,以及实际执行该函数的代码。第二部分是循环:程序调用模型,模型请求使用工具,程序运行该工具,将输出追加到对话中,然后再次调用模型。这个过程会持续,直到模型表示已完成,或达到限制条件。

循环本身只是普通代码,基本实现不到 100 行。工具携带真实凭据后,循环就可以修改自身之外的内容,这才使它成为代理。这个事实决定了下面所有托管方式。代理技能MCP(模型上下文协议)服务器 是在不重写循环的情况下,为代理提供更多工具的两种方式。

  • 它的运行时间可能超过您的会话。关闭标签页后,聊天就会结束。代理运行可能持续 20 分钟,而且应在笔记本进入睡眠后继续运行,因此应将其部署在持续运行的服务器上,并由 systemd 服务或计时器启动,以便在重启后恢复运行。
  • 它会持有机密信息。例如 API key、SSH key 和数据库密码。代理能够读取的任何内容,都可能被输入中隐藏的恶意指令诱导使用,因此应让机密信息远离代理的访问范围
  • 它的成本随循环增长,而不是随您的问题增长。每一步都会将完整对话重新作为输入发送,因此运行 10 步就要为该对话记录支付 10 次费用。这就是为什么输入 token 会占代理费用的主要部分,以及为什么应设置单次运行可消耗费用的硬性上限
  • 它可能以会写入数据的方式出错。聊天中的错误回答只需重新阅读即可。循环中的错误删除可能会删除整个目录。应将其作为仍具备完成任务所需权限的最低权限用户运行;对于编码代理,在让它访问您的代码仓库前,应先将其置于沙箱中

盒子对各层的要求

ChartWhat each layer asks of a server you own
The data behind this chart
[
  {
    "label": "LLM (weights you host)",
    "ram_gb": 8,
    "gpu": "helps a lot",
    "public_url": "no",
    "credentials": "none"
  },
  {
    "label": "Assistant (chat surface)",
    "ram_gb": 1,
    "gpu": "no",
    "public_url": "yes",
    "credentials": "one login"
  },
  {
    "label": "Agent (tools and a loop)",
    "ram_gb": 2,
    "gpu": "no",
    "public_url": "only for webhooks",
    "credentials": "several"
  }
]

请仔细查看 RAM 列,因为其中不包含模型。聊天前端和 agent 运行时都是小型程序。如果 agent 调用托管模型,运行它只需 2 GB RAM,选择低价方案并不是妥协,而是切实可行的答案。将权重放在同一台服务器上后,8 GB 模型这一行的需求就会超过其他所有部分。

其他列的重要性超出许多人的预期。只有模型层会因 GPU 而加速。只有 assistant 层通常需要公网 URL,因为浏览器必须访问它;agent 只有在外部系统需要调用它时才需要公网 URL,例如通过 webhook 调用。agent 还会保存 several 个凭据,这才是它与聊天窗口之间的实际差异。聊天窗口可能给出错误答案。agent 可能出错,然后据此执行操作。

运行 AI 代理需要 GPU 吗?

不需要,除非您还要在同一台机器上托管模型权重。代理循环主要执行 HTTP 请求、JSON 解析和子进程调用;等待网络响应时,CPU 的负载通常接近空闲。是否需要 GPU,实际上取决于 LLM 层。

因此应分别做出决定。如果文本不能离开您的服务器,就需要为存放模型购买足够的内存;为了获得可用的运行速度,还需要使用 GPU 运行模型。如果您只需要自动化功能,则可以按 token 租用模型,把预算用于保证服务在线和备份。2026 年,大多数自托管代理都会调用托管模型,因此运行成本更低。

可以自行托管 AI agent 吗?

可以。agent 最值得自行托管,因为循环运行层保存着您的数据和凭据。配备 2 GB RAM、服务管理器和出站网络访问权限的小型 VPS,就可以运行真正的 agent。如果您希望自行掌控整个循环运行层,可以选择在 VPS 上自行构建;如果您希望从现成方案开始,可以选择部署现成的自行托管 agent

自行托管 assistant 很简单:只需要一个容器和一个证书。自行托管模型的成本较高,而且很多人看到 token 在 CPU 上缓慢生成后就会放弃。只有在数据不能离开服务器,或数据量使按 token 计费的成本难以承受时,才应自行托管模型权重。否则,让 agent 调用 API,并将真正重要的部分保留在本地。

ChatGPT 是 AI agent 吗?

只要聊天产品能够调用工具,并根据结果采取行动而无需先征得您的同意,它就成为 agent。按照这一标准,支持浏览、代码执行或连接器的托管助手都属于 agent。对您而言,区别在于这个循环在哪里运行,以及使用谁的凭据。使用托管产品时,这两者都归供应商所有。运行在您自己的服务器上时,这两者都归您所有;凌晨 3 点该循环执行的任何操作,也由您负责。

响应式、规划式与多智能体

概览文章喜欢列出七种智能体。其中大多数分类只是营销说法。两种区别会改变您编写的代码,另一种会改变费用。响应式智能体调用工具,读取结果,然后回复。规划式智能体会先编写计划,再按计划执行。这种方式更适合长时间运行的任务,但会消耗更多令牌,因为每个步骤都会重新发送计划。多智能体架构允许一个智能体启动其他智能体,同时增加令牌消耗和故障模式。因此,只有在子任务确实相互独立时才值得采用,例如同时搜索四个来源。先使用响应式架构。任务运行时间变长后,再加入规划能力。最后再考虑多智能体架构。如需了解更完整的内容,请参阅 2026 年值得了解的 AI 智能体相关内容

如何判断实际运行在哪一层

在服务器上,查看哪些进程占用内存。

free -h
ps -eo rss,comm --sort=-rss | head -5

如果顶部进程是 ollamallama-server,并且其 RSS(resident set size,进程实际占用的内存)达到数 GB,那么模型运行在你的服务器上。如果没有进程超过几百 MB,但 API 账单持续增加,那么你运行的是代理或助手,并且租用了模型。如果列表为空,因为所有操作都在浏览器标签页中完成,那么你是助手的用户。在需要软件代表你执行操作之前,这也是一种合理的使用方式。

您想运行哪一种?

FAQ

AI agent 只是增加了几个步骤的 LLM 吗?

这些额外步骤才是产品本身。LLM 只能将文本转换为文本。Agent 在 LLM 外围加入可调用的工具,以及持续调用这些工具的循环;这些工具还会携带凭据,因此输出结果可以修改文件、数据库或正在运行的服务。这就是为什么 agent 需要一台持续运行的机器、服务管理器和密钥策略,而 LLM 在回答问题时只需要足够的内存来保存模型权重。

运行 AI agent 需要 GPU 吗?

运行 agent 本身不需要。这个循环只涉及 HTTP 请求、JSON 处理和子进程调用;CPU 在等待网络响应时即可处理这些任务。只有在自行托管模型权重,并且希望模型生成速度超过每秒几个 token 时,才需要 GPU。调用托管模型的 agent 在完全没有 GPU 的小型 VPS 上也能稳定运行。

AI agent 需要多少 RAM 的 VPS?

如果 agent 调用托管模型,大约需要 2 GB,因为它只需保存运行时、依赖项和一个小型本地数据库。如果自行托管模型权重,还需额外计算模型占用的内存:仅 qwen3:8b 就需要约 8 GB,因此一体化服务器至少需要从这个容量开始,并且会随着所选模型的大小增加。

我可以自行托管 AI assistant,并确保对话保持私密吗?

可以,但有一个决定性前提。Open WebUI 这类自托管前端会将账户和历史记录保存在您的服务器上。只有当前端背后的模型也在本地运行时,对话内容本身才会保持私密。如果将同一个前端指向托管 API,每条消息中的文本仍会离开您的服务器。因此,您保留了历史记录,但无法保留隐私。

AI agent 与 chatbot 有什么区别?

Chatbot 回复后就会停止。Agent 会决定下一步操作、调用工具、读取结果,然后再次做出决定,直到任务完成或达到限制。实际判断标准是:如果软件可以在回答和执行之间不需要人工按按钮,就修改某项内容,那么它就是 agent,并且需要相应的托管环境和安全控制。