Zanus AI与自建私有AI服务器:哪个更划算?
Zanus AI私有AI设备按报价销售,需6 kW供电且硬件价格未公开。本文估算租用GPU服务器搭建同类技术栈的成本,并说明何时API更值得购买。
截至 September 2026,Zanus AI 销售的产品
Zanus AI 销售面向企业的私有 AI 服务器。大多数搜索背后的问题,是自行构建同类私有 AI 服务器需要多少成本。简而言之:这是一台无需编程的设备,按报价定价,交付时已完成配置,并且完全可以在没有互联网连接的情况下运行。自行构建的版本则是租用 GPU(图形处理器)服务器,在推理服务器、聊天界面、向量存储和智能体框架后运行开放权重 LLM(大型语言模型);同时需要一名能够运行 Linux 的人员。选择哪种方式取决于 4 个因素:由谁负责工程实施、数据允许存储在哪里、是否能够为 6 kW 的设备供电,以及实际每天使用多少 token。
本文关于 Zanus 的全部信息均来自 zanusai.com,内容以 September 2026 读取的信息为准。该公司自称为“一家总部位于 Florida 州 Pompano Beach、专注于高科技 AI 解决方案和工程的私营美国 C-Corp”,其官网页面将该地点归入 Fort Lauderdale 大都会区。公司称其硬件和软件“在 USA 设计和组装”。
该产品分为 3 层。Front Office AI 是“客户交互的 AI 员工”:支持电话、网页聊天、报价和预订。Back Office AI 是“企业运行所依托的 AI 操作系统”,其描述为“15+ 个模块。无需编程。内置完成。”页面列出的模块包括向量存储、AI 聊天、客户、供应商、日历、任务、自动化、网页聊天机器人和 API(应用程序接口)。对于“我们需要开发人员吗?”这一问题,页面的回答是“不需要”。第三层 Private On-Premises AI 是部署在企业办公场所 Zanus 硬件上的同一套系统。它运行“Zanus OS”,销售形式为“完全归企业所有:硬件 + 永久软件许可证”,并且“支持物理隔离网络”,在设备与互联网隔离时通过 USB 接收更新。
关于模型,服务器页面称该设备运行“领先的开放权重系列”,这些模型会“在配置时与客户共同选择并确定规模”;用户还可以“随时替换或添加模型:新权重可直接下载”。页面没有说明具体模型系列、GPU、RAM 或存储容量,仅提到“RAID 10 NVMe”。关于供电,设备需要“标准 50A 电路 @ 115/220V”,满负载时最大功耗为“6 kW”;页面称该设备运行安静,适合办公环境,无需服务器机房。关于价格,该设备“按 RFQ”(报价请求)定价,依据“GPU 内存(模型)、RAM/上下文容量和每日 token 数量”确定规格。硬件没有公开价格。截至 September 2026,托管 Front Office 方案列出了固定年费,价格从每年 $4,900 到 $49,900 不等;但这些方案是在 Zanus 数据中心运行的云租户,并不是该设备。设备交付周期约为 3 周,交付时完成配置。
以上就是公开规格。下文没有补充公开信息,也没有对未公开内容进行推测。
自己搭建同一台私有 AI 服务器的样子
该设备将 4 项可自行租用和组装的组件打包在一起:GPU、用于加载开放权重模型的推理服务器、供用户使用的聊天界面,以及配合自动化层将文档转换为答案的向量存储。Linux 部分一个下午即可完成。业务模块需要数周,这一差距才是两种路径的真正区别。
先选择服务器。仅使用 CPU、内存为 16 GB 到 32 GB 的 VPS(虚拟专用服务器)可以运行 7B 和 8B 模型,供 1 到 2 人同时使用;在让任何人依赖它之前,应先以每秒生成的 token 数进行测量。租用配备 24 GB VRAM(显卡上的内存)的 GPU,可以足够快地运行 8B 模型,并以 4-bit 量化运行最大约 30B 的模型;48 GB 到 80 GB 属于 70B 级别。不同显卡可容纳哪些模型,请参阅不同内存容量下可自行托管哪些 AI 模型。
安装推理服务器。Ollama 的 Linux 安装只需一行命令,完整步骤见在 VPS 上运行 Ollama 以自行托管 LLM:
curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl status ollama
ollama -vsystemctl status ollama 应显示为 active (running)。在没有 GPU 的机器上,安装程序会输出 WARNING: No NVIDIA/AMD GPU detected. Ollama will run in CPU-only mode. 并继续运行。这样适合测试,但对用户而言速度较慢。
拉取模型并访问 API。该服务仅在回环地址的 11434 端口上监听:
ollama pull qwen3:8b
curl http://127.0.0.1:11434/api/generate \
-d '{"model":"qwen3:8b","prompt":"Reply with one word: ready","stream":false}'正常响应是一个包含 response 字段和 "done":true 的 JSON 对象。如果响应为 {"error":"model requires more system memory (6.4 GiB) than is available (3.8 GiB)"},并显示你自己的两个数值,则表示模型权重无法装入 RAM。此时应选择更小的模型或更低的量化级别。
添加聊天界面。Open WebUI 通常是首选。如果 Ollama 与 Open WebUI 运行在同一台主机上,其 README 提供了一个命令:
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui --restart always \
ghcr.io/open-webui/open-webui:main访问服务器地址的 3000 端口,创建第一个账户(该账户会成为管理员),然后打开模型列表。如果列表为空,原因是上面的回环绑定:在容器内,host.docker.internal 解析为主机的 Docker 网桥地址,而 Ollama 只监听 127.0.0.1,因此连接被拒绝。docker logs open-webui 会显示 Cannot connect to host host.docker.internal:11434。通过 systemd 覆盖配置修复:
sudo systemctl edit ollama[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"sudo systemctl daemon-reload
sudo systemctl restart ollama0.0.0.0 表示所有网络接口,包括公网接口。从此时起,除非防火墙阻止 11434 端口,否则该 API 可从互联网访问;同时 API 本身没有密码保护,因此在加载任何公司文档之前,请先保护 Ollama API 端点。如果 Open WebUI 过于占用资源,可以使用更轻量的 Open WebUI 替代方案,它们访问同一个端口。
添加向量存储。Qdrant 以一个容器运行。将其绑定到回环地址,因为只有服务器上的应用需要访问它:
docker run -d --name qdrant --restart always \
-p 127.0.0.1:6333:6333 -p 127.0.0.1:6334:6334 \
-v qdrant_storage:/qdrant/storage \
qdrant/qdrant
curl http://127.0.0.1:6333/collections在全新安装中,该检查会返回 {"result":{"collections":[]},"status":"ok"} 以及一个耗时字段。Open WebUI 内置的文档存储足以应对小型文档库;当代理框架需要直接查询嵌入向量时,再使用 Qdrant。
如果同时使用的人数超过少数几人,可以将 Ollama 替换为 vLLM。vLLM 会在 GPU 上合并多个用户的请求。官方镜像就是完整安装内容:
docker run -d --runtime nvidia --gpus all \
-v ~/.cache/huggingface:/root/.cache/huggingface \
-p 127.0.0.1:8000:8000 --ipc=host \
vllm/vllm-openai:latest --model Qwen/Qwen3-8B如果 Docker 回复 could not select device driver,并提示 GPU 功能不可用,则表示未安装 NVIDIA Container Toolkit,因此 Docker 无法将显卡提供给容器。安装该工具包并重启 Docker,然后再次运行命令。两种服务器分别适用于哪些场景,请参阅Ollama 与 vLLM 的比较。
最后一层就是该设备所称的模块。在租用方案中,它是一个代理框架:从向量存储读取数据,调用模型,对其他系统执行操作,并记录执行内容。候选方案及各自的适用场景见最佳自行托管 AI 代理;如果代理需要跨会话记住用户,自行托管的 Mem0 记忆服务器可以提供此功能。在完成配置之前,这些功能都不存在,而这正是设备方案实际收费的部分。
成本:一次报价对应每月账单
这里没有可填写的 Zanus 编号,编造一个编号没有任何意义。网站说明的是报价的计算依据:模型所需的 GPU 显存、上下文所需的 RAM,以及您每天处理的 token 数量。这些变量也决定租用方案的价格,因此您至少可以据此客观地计算自有方案的成本。
租用方案的成本包括 GPU 的固定月租,以及负责运行它的人员所需的时间。无论显卡处于空闲状态还是满负载运行,月租都不会变化。因此,与按 token 计费的 API 比较时,问题就变成了盈亏平衡计算:用月租除以您原本会使用的 API 的每百万 token 综合价格,所得结果就是每月必须实际通过这台设备处理的 token 数量。达到这一数量后,自购 GPU 才会比购买 token 更便宜。低于这一数量时,API 的成本更低。具体计算方法,以及空闲时间和批处理大小带来的影响,见 GPU VPS 与 API token:盈亏平衡点在哪里。
设备方案的成本结构不同:一次性资本支出、永久软件许可证、电费,以及在报价时根据每天 token 数量完成的容量规划。按当前用量确定的报价同时也是容量上限。用量超过该上限后,您需要重新获取报价;而租用 GPU 只需变更方案。
谁负责工程工作
该设备的宣传重点是:不需要任何人负责。“无需编码,开箱即用。”以及“我们需要开发人员吗?不需要。”这正是它的核心卖点。您仍需推动业务流程变更,因为员工必须学习新工具,还需要有人上传知识库内容并编写电话菜单;但不需要有人了解 systemd unit 是什么。
租用方案需要一名能够独立完成上述所有命令,并持续负责这些工作的人员。具体来说,此人负责操作系统更新、Docker 镜像、防火墙和 TLS(传输层安全)证书、向量存储和聊天记录的备份、模型更新,以及监控工作;监控必须能提示其在内核更新后 GPU 驱动是否出现故障。首次安装应安排 1 天,之后每月安排几个小时。还要为实际业务工作安排时间:租用方案本身不会提供客户表、供应商列表、日历或预约流程。每一项都需要针对现有系统编写集成,或配置一个智能体框架,并在它出现异常行为时负责处理。如果没有员工愿意承担这项工作,那么“无需开发人员”这一答案的价值就超过任何硬件规格。
数据存储在哪里
该设备最有力的卖点在于物理隔离。“您的数据永不离开”和“让数据始终保留在您的办公场所内”描述的是一台即使断开网络仍可使用的设备。对于诊所或律师事务所,如果合同规定数据必须留在本地,这就是决定性因素,没有任何 VPS 能做到这一点。
对于租用方案,应明确说明:VPS 是位于他人数据中心的一台计算机。您的提示词、文档、模型回答和向量索引都会在服务提供商拥有的主机内存中处理,并存放在服务提供商可以实际接触到的磁盘上。VPS 上的“私有 AI”只表示数据不提供给模型供应商,也不暴露在公网中,仅此而已。您的托管服务提供商仍然可以访问它;当客户或审计人员询问数据位于何处时,得到的会是一个城市名称,而不是您办公楼内某个房间的名称。静态加密可以保护被取出的磁盘,但无法保护模型生成回答时存放在内存中的数据。
折中方案是将自有硬件放入租用的机架,或使用不与他人共享的专用服务器。这样既保留租用方案中的模型选择自由和月度成本,又能弥合大部分物理隔离差距。但它也会带回设备方案省去的工作:必须有人负责组装和部署这台机器。
电力与空间
6 kW 的设备不是办公电脑。美国标准墙壁插座使用 15 A 或 20 A 电路;该页面要求 50 A 电路,这与电炉或快速电动汽车充电器使用的电路相同,因此安装时需要电工参与。网站称该设备运行时没有噪声,适合办公环境,并且只有工作时才会达到峰值功耗。网站未公布空闲功耗。
电费是唯一可以直接计算的运行成本,因为它属于算术问题。在 6 kW 功耗下,满负载运行 1 小时会消耗 6 kWh:
The data behind this chart
[
{
"label": "1 h/day at full load",
"kwh_per_month": 180,
"cost_usd_month": 27
},
{
"label": "4 h/day at full load",
"kwh_per_month": 720,
"cost_usd_month": 108
},
{
"label": "8 h/day at full load",
"kwh_per_month": 1440,
"cost_usd_month": 216
},
{
"label": "24 h/day at full load",
"kwh_per_month": "4,320",
"cost_usd_month": 648
}
]每天运行 1 小时的设备,按每 kWh 0.15 USD 计算,每月电费约为 27 USD。全天满负载运行的设备每月消耗 4,320 kWh,电费约为 648 USD。供应商给出的满负载运行成本是“每小时约 $1”,这意味着其电价高于图表中的假设值,因此应使用您自己的电价计算。所有这些电能最终都会以热量的形式离开设备。设备在峰值功耗下每小时会产生约 20,000 BTU(英热单位)的热量,房间的空调必须将这些热量排出。
如果选择租用方案,电力和制冷都包含在租金中,电路由服务商的数据中心负责。代价是您无法查看电表:GPU 方案无论每天运行 1 小时还是 24 小时,费用都相同。
模型选择
设备在配置时会根据您的选择搭载模型,这些模型来自“领先的开放权重模型系列”。页面还说明,新权重可通过下载获得。但公开文档没有说明具体有哪些模型系列、如何在 Zanus OS 内更换模型、是否可以加载供应商列表之外的模型,以及由谁执行更换。因此,请在签署协议前确认这些信息。
租用方案可以运行任何已发布权重且内存足以容纳这些权重的模型。新的开放权重版本发布后,您可以将其对应的 ollama pull 或 Hugging Face 仓库名称传给 vLLM。如果需要特定量化版本或自行微调的模型,则需要自行 将 GGUF 文件导入 Ollama。但反过来也一样:评估工作也由您负责。没有人会根据您的文档或每日 token 用量为您确定合适的模型规格。因此,第一个月通常要用于确认哪个模型在什么速度下已经足够,以及您的内存能够支持 哪种量化方式。
私有 AI 应答服务:作为项目的一个模块
大量“私有 AI 服务器”的需求其实是在寻找电话接待员,因此应单独处理这种情况。
在 Zanus 方案中,电话代理称为 Front Office AI。页面称它“使用您选择的声音,以最多 40 种语言全天候 24/7 接听菜单中的每个来电”,并提供由您编写的 IVR(交互式语音应答)菜单。该产品以托管租户形式销售,最高级别的套餐提供本地部署路径。官方未公布它使用的语音模型和应答延迟。
在租用方案中,语音代理与上面的聊天技术栈是两个独立项目,而且实现难度更高。它需要额外的 4 个部分:电话接入点(SIP 中继,其中 SIP 是会话发起协议),或将音频交给您的电话 API;语音转文本(STT);LLM;以及文本转语音(TTS)。这些部分必须串联起来,让来电者在说完一句话后约 1 秒内听到回复。每个环节都会增加延迟,因此模型必须足够小,GPU 也必须部署在附近。STT 和 TTS 两部分,以及可本地运行的引擎和各自的速度,参见 在 VPS 上自托管语音转文本和文本转语音。电话代理的耗时预计会超过上面的完整聊天技术栈,初版还可能打断来电者。如果您只需要电话接待员,使用设备模块或托管语音产品是更直接的方案,聊天服务器反而会分散注意力。
决策规则
满足以下4个条件时,购买这台设备:合同或监管机构要求数据留在本地;团队中没有人会运行 Linux;您已经安装或将要安装 50 A 电路;页面列出的模块与实际工作相匹配。设备报价相当于不雇用工程师所需承担的成本。签署合同前,要求对方书面提供型号列表和更换流程。
满足以下条件时,租用并自行搭建:有一个人可以负责服务器;经过审核的托管服务商可以存储这些数据;您希望自行选择型号;使用量足够稳定,按照上述盈亏平衡点计算,包月 GPU 的成本低于按 token 计费。模型发布当天,您就能使用所有开放权重模型,并且下个月可以调整账单。您还需要自行完成所有集成工作。
满足以下条件时,使用 API:使用量突发或较小;数据不敏感;没有人愿意运行任何服务;并且您需要在本周内投入使用。在低于盈亏平衡用量时,API 成本更低,而且始终可以更快开始。之后,如果 token 账单或数据策略要求您这样做,再增加自托管层。
FAQ
Zanus AI 实际销售什么?
截至 September 2026,zanusai.com 介绍了 3 个层级。Front Office AI 负责电话、网页聊天、报价和预约。Back Office AI 提供“15+ modules. Zero coding. Built in.” Private On-Premises AI 是运行在 Zanus 硬件上的相同软件,在您的办公场所内通过“Zanus OS”运行。该产品归您完全所有,并支持物理隔离网络。硬件价格需 RFQ。它需要 50 A 电路,最大功耗为 6 kW。公司总部位于 Florida 的 Pompano Beach。
Zanus AI 私有服务器的价格是多少?
硬件没有公开价格。服务器页面显示“Price by RFQ”,并根据 GPU 显存、RAM 和您的每日 tokens 数量确定配置。作为 September 2026 的情况,托管版 Front Office 方案列出固定年费,但这些方案运行在 Zanus 数据中心内,采用订阅模式,因此不能用于确定硬件价格。比较时,应使用相同变量计算租用方案的成本,并根据 API tokens 成本计算盈亏平衡点。
我可以在没有 GPU 的 VPS 上构建私有 AI 服务器吗?
可以,适用于用户数量少且模型较小的情况。仅使用 CPU、配备 16 GB 到 32 GB RAM 的 VPS,可以通过 Ollama 运行 7B 和 8B 模型,速度为每秒几个 tokens,足以测试文档助手。但它不适合团队同时使用,也不适合语音代理,因为后者对响应时间要求较高。在任何人依赖该服务之前,先在您的方案上测量每秒 tokens 数。
在 VPS 上自托管 LLM 真的是私有的吗?
只要防火墙阻止 11434 端口,并将聊天界面置于 TLS 之后,它就不会向模型供应商或公网公开。托管服务商不属于这种情况:其工作人员可以访问磁盘,其宿主机也会在内存中运行模型。如果合同要求数据必须留在您的办公场所,VPS 不符合要求。使用您自己的硬件,无论放在办公室还是租用的机架中,才符合这一要求。
DIY 方案包含电话接待员吗?
不包含开箱即用的电话接待员。语音代理是一个独立项目,需要电话接入点、语音转文本、LLM 和文本转语音,并且必须将这些环节紧密串联,使来电者能在约 1 秒内听到回复。这是租用方案中最难实现的部分,也是设备自带模块或托管语音产品最能节省时间的部分。