Zanus AI 值得買嗎?自建私有 AI 伺服器成本比較
Zanus AI 採 RFQ 報價,設備最高耗電 6 kW。比較租用 GPU 自建私有 AI stack 的成本、所需 Linux 維運,以及何時改用 API 更划算。
截至 2026 年 9 月,Zanus AI 銷售的產品
Zanus AI 銷售供企業使用的私有 AI 伺服器,而多數搜尋這項產品的人真正想知道的是:自行建置相同的私有 AI 伺服器需要多少成本。簡單來說,這台設備是不需撰寫程式碼的盒裝系統,採報價制,交付時已完成設定,而且完全不需要網際網路連線即可執行。自行建置的版本則是租用 GPU(graphics processing unit)伺服器,在推論伺服器後方執行開放權重 LLM(large language models),再搭配聊天介面、向量資料庫與 agent framework;此外,還需要一名能夠管理 Linux 的人員。應選擇哪條路,取決於 4 件事:由誰負責工程工作、資料允許儲存在哪裡、是否能供應 6 kW 電力,以及每天實際使用多少 tokens。
本文所有關於 Zanus 的資訊,均來自 2026 年 9 月閱讀的 zanusai.com。該公司自稱為「一家私人持有的美國 C-Corp,專門提供高科技 AI 解決方案與工程服務,總部位於佛羅里達州 Pompano Beach」;其自有頁面則將所在地標示為大 Fort Lauderdale 地區。該公司表示,其硬體與軟體「均在美國設計與組裝」。
這項產品分為 3 個層級。Front Office AI 是「客戶與之互動的 AI 人力」:包括電話、網頁聊天、報價與預約。Back Office AI 是「公司執行業務所使用的 AI 作業系統」,說明為「15+ 個模組。不需撰寫程式碼。內建完成。」頁面列出的模組包括向量資料庫、AI 聊天、客戶、供應商、行事曆、工作、automations、網頁聊天機器人與 API(application programming interface)。對於「我們需要開發人員嗎?」這個問題,頁面的回答是「不需要」。第三個層級 Private On-Premises AI,是在 Zanus 硬體上、於企業建築內執行的相同系統。它執行「Zanus OS」,以「完全擁有:硬體 + 永久軟體授權」的形式銷售,並且「支援 air-gap」;如果持續與網際網路隔離,則可透過 USB 套用更新。
在模型方面,伺服器頁面表示,這台設備可執行「主要的開放權重系列」,這些模型會「在設定時與您共同選擇並決定規模」,而且可以「隨時替換或新增模型:新的權重只需下載」。頁面沒有說明具體系列、GPU、RAM 或儲存容量,僅提到「RAID 10 NVMe」。在電力方面,設備需要「標準 50A 電路 @ 115/220V」,滿載時最大耗電量為「6 kW max」;頁面並形容這台設備運作安靜、適合辦公室使用,不需要伺服器機房。在價格方面,這台設備採「by RFQ」(request for quotation)報價,依「GPU 記憶體(模型)、RAM/context 與每天 tokens 數量」決定規模。硬體沒有公開價格。截至 2026 年 9 月,託管式 Front Office 方案確實列出每年固定價格,範圍為每年 $4,900 至 $49,900;但那是 Zanus 資料中心中的雲端租戶,不是這台設備。配置完成後,交付時間報價約為 3 週。
以上就是公開規格。下文不會補充未公開的資訊,也不會對此進行推測。
自行建置相同的私有 AI 伺服器
這套設備整合了 4 項你可以自行租用與組裝的元件:GPU、可載入開放權重模型的推論伺服器、供使用者操作的聊天介面,以及搭配自動化層的向量儲存庫,可將文件轉換為答案。Linux 部分一個下午即可完成。業務模組則需要數週,這段差距才是兩種方案的實際差異。
先選擇主機。只有 CPU 的 VPS(virtual private server)搭配 16 GB 至 32 GB RAM,可讓 1 至 2 名使用者同時執行 7B 與 8B 模型,但在讓任何人依賴它之前,應先以每秒 token 數評估速度。配備 24 GB VRAM(顯示卡上的記憶體)的租用 GPU,執行 8B 模型時足以應付小型團隊,也能以 4-bit 裝載約 30B 以下的模型;48 GB 至 80 GB 則屬於 70B 級別。不同記憶體容量可容納哪些模型,請參閱各種記憶體容量可自行代管哪些 AI 模型。
安裝推論伺服器。Ollama 的 Linux 安裝只需一行指令,完整步驟請參閱在 VPS 上執行 Ollama 以自行代管 LLM:
curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl status ollama
ollama -vsystemctl status ollama 應顯示 active (running)。在沒有 GPU 的主機上,安裝程式會輸出 WARNING: No NVIDIA/AMD GPU detected. Ollama will run in CPU-only mode. 後繼續執行。這適合測試,但對使用者而言速度較慢。
下載模型並呼叫 API。服務只在 loopback 位址的 port 11434 上監聽:
ollama pull qwen3:8b
curl http://127.0.0.1:11434/api/generate \
-d '{"model":"qwen3:8b","prompt":"Reply with one word: ready","stream":false}'正常回應是包含 response 欄位與 "done":true 的 JSON 物件。若回應為 {"error":"model requires more system memory (6.4 GiB) than is available (3.8 GiB)"},並帶有你自己的 2 個數值,表示模型權重無法放入 RAM。此時應選擇較小的模型或較小的量化格式。
加入聊天介面。Open WebUI 通常是首選,其 README 為 Ollama 在同一台主機上執行的情況提供一個指令:
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui --restart always \
ghcr.io/open-webui/open-webui:main前往伺服器位址的 port 3000,建立第一個帳號(該帳號會成為 admin),然後開啟模型清單。若清單為空,原因是上述的 loopback 綁定:在容器內,host.docker.internal 會解析為主機的 Docker bridge 位址,而 Ollama 只監聽 127.0.0.1,因此連線會遭拒。docker logs open-webui 會顯示 Cannot connect to host host.docker.internal:11434。使用 systemd override 修正:
sudo systemctl edit ollama[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"sudo systemctl daemon-reload
sudo systemctl restart ollama0.0.0.0 代表所有介面,包括公開介面。從這個階段開始,除非 firewall 封鎖 port 11434,否則 API 可從網際網路存取;而且 API 本身沒有密碼,因此在載入任何公司文件前,請先保護 Ollama API endpoint。如果 Open WebUI 過於笨重,還有較輕量的 Open WebUI 替代方案可連線至相同的 port。
加入向量儲存庫。Qdrant 可在單一容器中執行。請將它綁定至 loopback,因為只有這台主機上的應用程式需要存取它:
docker run -d --name qdrant --restart always \
-p 127.0.0.1:6333:6333 -p 127.0.0.1:6334:6334 \
-v qdrant_storage:/qdrant/storage \
qdrant/qdrant
curl http://127.0.0.1:6333/collections在全新安裝中,檢查結果會回傳 {"result":{"collections":[]},"status":"ok"},以及一個計時欄位。Open WebUI 內建的文件儲存庫已足以應付小型文件庫;當 agent framework 需要直接查詢 embeddings 時,才需要使用 Qdrant。
如果同時使用者超過少數幾人,請將 Ollama 改為 vLLM。vLLM 可在 GPU 上為多名使用者批次處理請求。官方 image 即為完整安裝內容:
docker run -d --runtime nvidia --gpus all \
-v ~/.cache/huggingface:/root/.cache/huggingface \
-p 127.0.0.1:8000:8000 --ipc=host \
vllm/vllm-openai:latest --model Qwen/Qwen3-8B如果 Docker 回應它 could not select device driver GPU capabilities,表示尚未安裝 NVIDIA Container Toolkit,因此 Docker 無法將顯示卡交給容器。請安裝該 toolkit 並重新啟動 Docker,然後再次執行該指令。各伺服器的適用時機請參閱Ollama 與 vLLM 的比較。
最後一層就是這套設備所稱的模組。在租用方案中,這是一個 agent framework:它會從向量儲存庫讀取資料、呼叫模型、對其他系統執行動作,並記錄執行內容。各候選方案及其適用情境,請參閱最佳的自架 AI agent;如果 agent 需要跨工作階段記住使用者,自架 Mem0 記憶伺服器可提供這項功能。在你完成設定前,這些功能都不存在,而這正是你實際為這套設備付費的部分。
成本:將報價與月費比較
這裡沒有可供填寫的 Zanus 數字,捏造一個數字只會造成反效果。網站說明的是報價的估算依據:模型所需的 GPU 記憶體、內容所需的 RAM,以及你每天處理的 token 數量。這些變數同樣決定租用方案的價格,因此至少可以據此建立一個誠實的比較基準。
租用方案的成本包括 GPU 的固定月租,以及負責執行它的人力成本。無論 GPU 閒置或全速運作,月租都不會改變。因此,與按 token 計費的 API 比較時,這會變成損益平衡問題:用月租除以你原本會使用的 API 每 1 百萬 token 的綜合價格,所得結果就是你每月必須實際透過這台設備處理的 token 數量;超過這個數量,擁有 GPU 的成本才會低於租用 token。低於這個數量時,使用 API 的成本較低。計算方式,以及閒置時間與批次大小可能造成的問題,請參閱 GPU VPS 與 API token:損益平衡點在哪裡。
設備方案的成本結構不同,包括一次性的資本支出、永久軟體授權、電費,以及在報價時替你完成的每日 token 數量估算。按照目前用量估算的報價,同時也是容量上限。用量超過這個上限時,就需要重新取得報價;租用 GPU 則只需變更方案。
工程工作由誰負責
這台設備的訴求是無須任何人負責。「零程式撰寫。內建完成。」以及「我們需要開發人員嗎?不需要。」就是其核心。你仍須進行業務流程變更,因為員工必須學習新工具,且有人必須上傳知識並撰寫電話選單;但不必有人知道 systemd unit 是什麼。
租用方案需要一名能在無人協助下執行上述所有命令,並持續負責這些工作的人员。具體而言,這個人要負責作業系統更新、Docker 映像、firewall 與 TLS(transport layer security)憑證、vector store 與 chat history 的備份、model 更新,以及監控 kernel 更新後 GPU driver 損壞的系統。首次安裝預留 1 天,之後每月預留數小時。接著還要納入真正的工作量:租用方案不會附帶 clients table、supplier list、calendar 或 booking flow。每一項都需要針對現有系統撰寫整合,或設定 agent framework,並在系統出現異常行為時負責處理。如果沒有任何員工願意承擔這項工作,「不需要開發人員」這個答案的價值就高於任何硬體規格。
資料存放位置
這台設備最有力的主張在於實體隔離。「資料永遠不離開」以及「讓資料實際留在您的建築物內」,描述的是一台即使從網路拔除後仍可使用的機器。對於診所或律師事務所而言,如果合約規定資料必須留在營業場所內,這就是決定性的因素,沒有任何 VPS 能與之相比。
對於租用方案,應直接說明:VPS 是位於他人資料中心的電腦。您的提示、文件、模型的回答及向量索引,都會在供應商擁有的主機記憶體中處理,並存放在供應商可實際接觸的磁碟上。VPS 上的「私有 AI」表示資料只對模型供應商及公開網際網路保持私有,僅此而已。您的代管供應商仍可存取該資料;客戶或稽核人員詢問資料所在位置時,得到的會是城市名稱,而不是您建築物內某個房間的名稱。靜態加密能在磁碟遭到取出時保護磁碟內容,但無法保護模型回答問題時仍位於記憶體中的資料。
折衷方案是將自有硬體放在租用的機櫃中,或使用沒有其他人共用的專用伺服器。這能保留租用方案的模型選擇自由與每月費用,同時縮小大部分的實體隔離差距。但這也會帶回設備方案所省去的工作:必須有人組裝這台機器。
電力與空間
6 kW 的機器不是辦公室 PC。美國標準壁式插座通常使用 15 A 或 20 A 電路;本頁要求 50 A 電路,這類電路通常供電磁爐或快速電動車充電器使用,因此安裝時需要電工協助。網站表示此設備運作時幾乎無聲,適合辦公環境,且只有工作時才會達到峰值功耗。待機功耗未公開。
電費是唯一能直接量化的持續成本,因為計算方式很簡單。功耗為 6 kW 時,每滿載運作 1 小時就是 6 kWh:
The data behind this chart
[
{
"label": "1 h/day at full load",
"kwh_per_month": 180,
"cost_usd_month": 27
},
{
"label": "4 h/day at full load",
"kwh_per_month": 720,
"cost_usd_month": 108
},
{
"label": "8 h/day at full load",
"kwh_per_month": 1440,
"cost_usd_month": 216
},
{
"label": "24 h/day at full load",
"kwh_per_month": "4,320",
"cost_usd_month": 648
}
]每天運作 1 小時的設備,以每 kWh 0.15 USD 計算,每月電費約為 27 USD。若全天候滿載運作,每月耗電 4,320 kWh,電費約為 648 USD。供應商提供的數據是滿載時「每小時約 $1」,表示其假設的電價略高於圖表中的費率,因此請使用你所在地的實際電價。這些電能最後都會以熱能形式離開機器;峰值時每小時約產生 20,000 BTU(英熱單位)的熱量,必須由房間的空調設備排除。
若選擇租用方案,電力與冷卻已包含在租金內,電路也由供應商的資料中心負責。代價是你無法查看電表:GPU 方案的費用相同,無論設備每天運作 1 小時或 24 小時。
模型選擇
這台設備會在設定時搭配所選模型出貨,來源是「主要的開放權重模型系列」;頁面也表示,新權重可透過下載取得。但目前沒有公開文件說明有哪些模型系列、如何在 Zanus OS 內切換模型、是否能載入供應商清單以外的模型,以及由誰執行切換,因此請在簽約前先確認。
租用方案可執行任何已發布權重且記憶體足以容納權重的模型。新的開放權重版本一發布,就能將 ollama pull 或 Hugging Face 儲存庫名稱傳給 vLLM;如果需要特定量化版本或自行微調的模型,則可自行 將 GGUF 檔案匯入 Ollama。但反過來也有相應的責任:評估工作同樣由你負責。沒有人會依你的文件或每日 token 用量替你評估適合的模型大小,因此第一個月通常都在確認哪個模型的品質足夠、速度合適,以及記憶體能負擔 哪種量化版本。
私人 AI 接聽服務:相對獨立的模組
許多搜尋「private AI server」的人,實際上是在找電話接待員,因此應個別處理這種需求。
在 Zanus 方面,電話代理程式是 Front Office AI。頁面表示,它能「以您選擇的語音,在您的選單中接聽每通電話,每週 7 天、每天 24 小時,最多支援 40 種語言」。它提供由您編寫的 IVR(interactive voice response)選單,並以託管租戶形式銷售;最高方案另提供 on-premises 部署途徑。其使用的語音模型及回覆延遲並未公開。
在租用的部署途徑中,語音代理程式是不同於上述聊天堆疊的獨立專案,實作難度也更高。它需要另外整合 4 個部分:電話通訊入口(SIP trunk,其中 SIP 是 session initiation protocol,或可將音訊交給您的 telephony API)、語音轉文字(STT)、LLM,以及文字轉語音(TTS)。這些元件必須串接運作,讓來電者在說完一句話後約 1 秒內聽到回覆。每個環節都會增加延遲,因此模型必須較小,GPU 也必須部署在較近的位置。STT 與 TTS 的部分,以及可在本機執行的引擎和各自的速度,請參閱 在 VPS 上自架語音轉文字與文字轉語音。預期電話代理程式所需時間會比上述完整聊天堆疊更長,也應預期初版會打斷來電者。如果您只需要電話接待員,使用設備的模組或託管語音產品會是較直接的途徑;聊天伺服器反而會分散注意力。
決策規則
符合以下4項條件時,購買設備:合約或監管機關要求資料留在建築物內、團隊中沒有人會管理 Linux、你已經具備或將安裝 50 A 電路,而且頁面列出的模組符合實際工作需求。報價反映的是不必聘用工程師的成本。在簽約前,要求對方以書面提供型號清單與更換程序。
符合以下條件時,租用並自行建置:有人能負責伺服器、資料可以存放在你審核過的託管服務商處、你希望自行選擇型號,而且使用量足夠穩定,依上述損益平衡點計算,按月租用 GPU 的成本低於 token 費用。模型發布當天,你就能使用所有開放權重模型,且下個月即可調整費用方案。但所有整合工作也都必須自行完成。
符合以下條件時,使用 API:使用量零星或很少、資料不敏感、沒有人想管理任何系統,而且你需要在本週內完成部署。在損益平衡用量以下,API 的成本較低,而且啟動速度始終較快。日後若 token 費用或資料政策促使你採用自建方案,再加入自架層即可。
FAQ
Zanus AI 實際銷售的是什麼?
截至 September 2026,zanusai.com 說明其產品分為 3 個層級。Front Office AI 負責電話、網頁聊天、報價與預約。Back Office AI 宣稱「15+ 個模組。無須撰寫程式碼。內建完成。」Private On-Premises AI 則是在 Zanus 硬體上執行相同軟體的方案,於您的建築物內執行「Zanus OS」,採完全擁有的銷售模式,並支援 air-gap。硬體價格須透過 RFQ 取得。其需要 50 A 電路,最高耗電量為 6 kW。該公司總部位於 Florida 的 Pompano Beach。
Zanus AI private server 的價格是多少?
硬體沒有公開價格。伺服器頁面標示「Price by RFQ」,規格依 GPU 記憶體、RAM 及每日 tokens 數量決定。Hosted Front Office 方案截至 September 2026 列有固定年費,但這些方案是在 Zanus datacenter 執行,且採訂閱制,因此不能用來判定硬體價格。若要比較,請使用相同變數計算租用方案的成本,再與 API tokens 成本比較損益平衡點。
我可以在沒有 GPU 的 VPS 上建置 private AI server 嗎?
可以,適用於少量使用者及小型模型。只有 CPU 的 VPS 若具備 16 GB 至 32 GB RAM,可透過 Ollama 執行 7B 和 8B 模型,速度約為每秒數個 tokens,足以測試文件助理。但這不足以支援團隊同時使用,也不適合 voice agent,因為回應時間很重要。在任何人依賴該服務之前,請先測量方案上的每秒 tokens 數量。
在 VPS 上自架 LLM,真的具備隱私嗎?
只要防火牆封鎖 11434 埠,並讓聊天介面置於 TLS 後方,該服務便可避免模型供應商及公開網際網路存取。但 hosting provider 例外:其人員可以存取磁碟,且其主機會在記憶體中執行模型。若合約要求資料必須留在您的建築物內,VPS 不符合此要求。使用位於您辦公室或租用機櫃中的自有硬體,才符合要求。
DIY 方案包含電話接待員嗎?
沒有內建。Voice agent 是獨立的專案,包含 telephony 入口、speech-to-text、LLM 及 text-to-speech,並且必須緊密串接,讓來電者約在 1 秒內聽到回覆。這是租用方案中最困難的部分,也是 appliance 的模組或 hosted voice product 最能節省時間的部分。