Zanus AI 私有主機可靠嗎?下單前的查證清單
買 Zanus AI 私有主機之前,哪些事可以從公開資料查證,哪些查不到?規格與 GPU VRAM、保固與台港在地維修、公司登記的查法,加上關稅、電費與噪音這些規格表不會寫的成本。
先說結論:可以查證的是事實,不是口碑
要判斷一台 Zanus AI 私有主機值不值得付錢,先把問題換掉。不要問「這家公司好不好」,要問「有哪些事我現在就能自己查到」。GPU 型號與 VRAM 容量、完整規格表、保固條款全文、公司登記資料、交期、在地維修窗口,這些都是可以在付款前拿到白紙黑字的事實。至於使用者口碑、出貨量、公司三年後還在不在,你查不到,我也不該替你猜。
這一頁不對任何品牌下判斷,也不引用任何評價或使用心得。下面寫的都是你自己做得到的查證動作,以及你應該用書面向任何廠商提出的問題。整機採購和自己架的取捨是另一個題目,先看 整機採購與自建 AI 主機的取捨,價錢結構在那邊談得比較完整,這裡只談怎麼驗。
Zanus AI 主機:可以從公開來源查證的六件事
一、完整規格是否公開到型號層級。 可以被查證的規格表會寫出 GPU 的完整型號與 VRAM 容量、CPU 型號、記憶體容量與通道數、系統碟與資料碟的型號、電源供應器瓦數與 80 PLUS 等級、機殼尺寸與整機重量。只寫「高效能 GPU」「大容量記憶體」的規格表不是規格表,因為裡面沒有一個字串可以貼進搜尋引擎查到原廠頁面。你要的是可被外部驗證的字串,不是形容詞。
二、GPU 到底是哪一張卡。 同樣叫「48GB 專業卡」,RTX A6000、RTX 6000 Ada、L40S 的價格與效能差很遠;RTX 5090 是 32GB,RTX 4090 是 24GB。要問清楚是原廠零售卡、OEM 版本,還是第三方改裝卡。市面上確實存在改過記憶體顆粒的顯示卡,它們跑得動,但沒有原廠保固,壞了只能回去找改的人。順便問序號是否可在原廠查詢,以及保固登記在誰名下。
三、保固條款的全文,不是網頁上的一行字。 要拿到條款頁或 PDF,裡面必須回答這幾件事:保固幾年、GPU 與其他零件是否分開計算年限、起算日是出貨日還是簽收日、哪些情況不保(自行拆機、超頻、換非原廠電源)、送修期間有沒有代用機。「三年保固」四個字本身不構成承諾。
四、誰在台灣或香港實際執行維修。 這是台港買家最常漏掉的一題。要問到具體的收件公司名稱與地址。如果答案是「寄回原廠」,就繼續問:來回運費誰付、出口與進口報關誰處理、一趟要多久。一台二十公斤以上的主機做一次國際來回送修,運費加上關務處理,金額可能超過你當初省下來的價差。
五、公司登記。 台灣可以在經濟部的商工登記公示資料查詢服務,用公司名稱或統一編號查到設立日期、資本額與登記地址。香港可以在公司註冊處的網上查冊中心查公司編號與成立日期。查到的只是「這家公司存在,成立於某年」,不等於品質。但查不到,或查到的名稱跟收款帳戶戶名對不上,那就是應該停下來的訊號。發票或收據由哪一家公司開立?這個問題要在付款前問,不是收到機器之後問。
六、交期與逾期的處理方式。 要書面的出貨日期,以及逾期後可以做什麼(退訂、退款、違約金)。「預計四到六週」不帶任何約束力,寫進訂單也一樣。
查不到的事,不要自己補
有幾類資訊,不管你花多少時間搜尋都不會有可靠答案:這家公司過去的實際出貨數量、真實使用者的長期心得、售後回覆速度、公司的財務狀況。網路上找到的零星貼文無法分辨是真實買家還是行銷,把它當成證據會誤導你自己。
處理方式不是「多找幾篇評價」,而是把風險移到合約與付款方式上。你無法預測一家公司三年後的樣子,但你可以決定今天一次付多少錢、用什麼工具付、驗收不過時怎麼退。下面兩節就是在做這件事。
把問題寫成書面寄出去
口頭回答不算數。同一個業務願意寫下來的東西,和願意說出口的東西,常常不是同一組。把下面這份清單貼進 email,對方怎麼回、多久回、願不願意逐條回,本身就是資訊。
- 這台機器的 GPU 完整型號、VRAM 容量與張數是什麼?是原廠零售卡、OEM 版本,還是改裝卡?
- 保固幾年?GPU 與其他零件年限相同嗎?保固條款全文請提供連結或 PDF。
- 送修的收件公司與地址在台灣或香港的哪裡?貴公司自行維修還是委外?
- 送修期間有代用機嗎?來回運費由誰負擔?
- 可否提供這台機器在 Qwen3 8B Q4_K_M 與 32B Q4_K_M 下的 tokens/s 實測值,並附上測試軟體版本、context 長度與 batch 設定?
- 整機滿載功耗多少瓦?待機多少瓦?隨附電源線是哪一種插頭規格?
- 滿載時的噪音值是多少 dB(A)?量測距離多遠?
- 報價是否已含進口稅與清關費用(DDP),還是到港後由買方自行處理(DAP)?
- 預計出貨日是哪一天?逾期如何處理?
- 可以刷信用卡嗎?發票或收據的開立公司名稱是什麼?
- 系統預裝了哪些軟體?有沒有遠端管理或狀態回報功能?可以關閉嗎?
最後一題比看起來重要。一台放在你辦公室、握有你資料的機器,如果預設開著你不知道的遠端通道,那台機器就不完全是你的。
VRAM 決定你能跑哪些模型,其他都是次要
選 AI 主機時,VRAM 容量是第一個門檻,因為模型權重放不進去,速度就會掉一個數量級。系統會把放不下的層丟到主記憶體,由 CPU 計算,而 CPU 的記憶體頻寬遠低於 GPU,所以生成速度會從每秒幾十個 token 掉到每秒幾個。這不是調參數能救的事。
下面是 GGUF 格式常見量化的權重檔案大小,取自公開發布的模型檔典型值,再加上一個可用的 VRAM 建議值。建議值比權重大,是因為 KV cache(儲存已處理過的 token 的鍵值快取)、啟用值與 CUDA context 都要佔空間,而 KV cache 會隨 context 長度線性成長。
The data behind this chart
[
{
"label": "8B Q4_K_M",
"weights_gb": 4.9,
"min_vram_gb": 8
},
{
"label": "14B Q4_K_M",
"weights_gb": 8.6,
"min_vram_gb": 12
},
{
"label": "32B Q4_K_M",
"weights_gb": 19.9,
"min_vram_gb": 24
},
{
"label": "70B Q4_K_M",
"weights_gb": 42.5,
"min_vram_gb": 48
},
{
"label": "70B Q8_0",
"weights_gb": 74.5,
"min_vram_gb": 80
}
]讀法很直接。一張 24GB 的卡跑 32B Q4_K_M 是合理的,因為權重約 19.9 GB,剩下的空間給 KV cache,但 context 拉到很長時就會開始吃緊。想跑 70B 的 Q4_K_M,權重就要 42.5 GB,所以建議至少 48 GB VRAM,也就是一張 48GB 專業卡或兩張 24GB 卡。同一個 70B 換成 Q8_0,權重跳到 74.5 GB,需求變成 80 GB,這已經是資料中心級的卡。這 5 列的意思是:量化格式比模型代號更決定你要買多少 VRAM。
所以向廠商確認 VRAM 時,要問的是「總共幾 GB、分在幾張卡上」。兩張 24GB 的卡不等於一張 48GB 的卡。多卡要靠 tensor parallel 把單一模型切開,切開就有卡間通訊成本;沒有 NVLink 時,資料走 PCIe,速度會比單卡差。判斷你的模型需求時,哪些開源模型真的可以自己架 和 多大的模型塞得進你手上的記憶體 這兩篇把換算過程寫得更細。
要 tokens/s,不要 TFLOPS
行銷資料喜歡寫 TFLOPS 或 TOPS,因為數字大而且好看。這個數字對買家幾乎沒有用,原因是它衡量的是理論峰值算力,而大型語言模型的生成階段瓶頸在記憶體頻寬,不在算力。每生成一個 token,GPU 要把整份權重從 VRAM 讀過一遍,所以決定速度的是 GB/s,不是 TFLOPS。兩張理論算力相近的卡,記憶體頻寬差兩倍,生成速度就差將近兩倍。
要求的是這種形式的數字:指定模型、指定量化、指定 context 長度、指定併發數下的 tokens/s。例如「Qwen3 32B Q4_K_M,4k context,單一請求,生成 45 tokens/s」。任何少了限定條件的 tokens/s 都可以靠改條件變大。
驗收當天,先確認硬體跟規格表一致:
nvidia-smi --query-gpu=name,memory.total,driver_version,serial --format=csv
sudo dmidecode -t memory | grep -E 'Size|Speed|Manufacturer'
sudo nvme list
lscpu | grep -E 'Model name|Socket|Core'name 欄位要和訂單上的型號一字不差,memory.total 要等於承諾的容量。如果規格寫 48GB 而輸出只有一列 24576 MiB,那就是張數或型號有問題,當場問,不要收貨之後再問。
接著實測生成速度。Ollama 加上 --verbose 會在回答結束後印出計時資料:
ollama run --verbose qwen3:8b輸入一段固定的提示,等它答完,終端機會列出 prompt eval rate 與 eval rate 兩個速率,單位都是 tokens/s。前者是處理你輸入的速度,後者是逐字生成的速度。廠商只報一個數字時,要問是哪一個,因為預填通常比生成快很多。
想要可重複、可比對的數字,用 llama.cpp 附的 llama-bench:
llama-bench -m qwen3-8b-q4_k_m.gguf -p 512 -n 128 -ngl 99-p 512 測 512 個 token 的預填,-n 128 測生成 128 個 token,-ngl 99 要求把所有層都放上 GPU。輸出會分成 pp512 與 tg128 兩列。如果 tg128 低得離譜,先用 nvidia-smi 看 VRAM 是不是滿了,因為只要有幾層掉回 CPU,生成速度就會崩掉。
跑測試時,另開一個視窗看功耗與溫度:
nvidia-smi --query-gpu=power.draw,temperature.gpu,clocks.sm --format=csv -l 1如果 clocks.sm 在跑了十分鐘之後開始往下掉,而溫度貼在八十幾度,那是散熱不足造成的降頻。短時間的跑分看不出這件事,所以測試要持續跑到至少十五分鐘。
規格表不會寫的成本:稅、運費與電費
標價不是到手價。機器從海外寄進來,到岸成本還要加上運費、進口稅費與清關處理費。
以 2026 年 9 月的規定來說,台灣進口電腦主機的關稅稅率在資訊科技協定下多數為 0%,但 5% 的營業稅一定要繳,而且課徵基礎是完稅價格加運費與保險,不是你看到的商品標價。實際稅則請自己到財政部關務署的稅則稅率查詢系統用貨品名稱查一次。香港的情況不同:一般貨物不徵進口關稅,也沒有增值稅,所以到岸成本主要是運費與清關處理費。兩地都一樣的是,你要先問清楚報價是 DDP(廠商負責稅與清關)還是 DAP(貨到之後由你自己付稅、自己處理報關),這兩者的差額可能是總價的一成。
再來是電費,這筆錢每個月都會來。下面用每度電 NT$5 與 HK$1.5 的假設,算三種使用強度下一整年的電費,假設機器全年不關機:
The data behind this chart
[
{
"label": "\u4ee5\u5f85\u6a5f\u70ba\u4e3b",
"avg_watt": 120,
"annual_kwh": "1,051",
"annual_twd": "5,256",
"annual_hkd": "1,577"
},
{
"label": "\u6bcf\u5929\u63a8\u8ad6 2 \u5c0f\u6642",
"avg_watt": 180,
"annual_kwh": "1,577",
"annual_twd": "7,884",
"annual_hkd": "2,365"
},
{
"label": "\u5e7e\u4e4e\u5168\u5929\u63a8\u8ad6",
"avg_watt": 500,
"annual_kwh": "4,380",
"annual_twd": "21,900",
"annual_hkd": "6,570"
}
]機器擺著不太用,一年也要約 NT$5,256 或 HK$1,577,因為 GPU 待機、風扇與電源轉換損耗一直在耗電。推到 500 W 的長時間推論,一年就是 NT$21,900 或 HK$6,570。
這兩個數字要往上修。台灣住宅電價是累進級距,夏月費率更高,你多出來的這 1,577 度會疊在原本的用電上,通常落在最高的級距,實際單價可能高於假設值;營業用電的計費方式又不一樣,還可能有需量計費。香港的中電與港燈都有燃料調整費,帳單上的實付單價會高於基本電價。把你自己最近一張電費單拿出來,算出真正的每度單價再重算一次。另外,機器產生的熱要靠冷氣排掉,而冷氣的耗電要另外算,在台港的夏天這筆不小。
放進公寓或小辦公室:電路、散熱與噪音
台灣住宅的一般插座迴路是 110V 15A,理論上限約 1,650 W,持續負載通常建議抓八成,約 1,320 W。一台雙 GPU 的 AI 主機滿載可以輕鬆吃掉 1,200 W,同一條迴路上再接一台冷氣或一個電熱水瓶就會跳電。要嘛把機器獨立拉一條迴路,要嘛確認同迴路上沒有其他大電流電器。香港是 220V,單一 13A 插座約 2,860 W,餘裕大得多,但同一個 final circuit 上的總負載仍然要算。
散熱的算法很簡單:機器吃進去的電,幾乎全部變成熱。持續 1,000 W 的運轉,等於房間裡多了一台 1,000 W 的電暖器,而且不會自己停。在沒有空調的房間,室溫會一路推高到 GPU 自己降頻保護,於是你付了全額的電費,卻只拿到打折的效能。
噪音是最後一個,也是最多人事後後悔的一個。伺服器型的 2U 或 4U 機殼使用 40mm 到 60mm 的高轉速風扇,滿載時常在 55 dB(A) 以上,那是你沒辦法在同一個房間講電話的程度。工作站機殼的風扇大而慢,安靜很多。所以前面那份問題清單裡要問 dB(A) 數值與量測距離。如果廠商給不出來,就自己設定一個驗收條件:機器擺在你要放的位置,滿載跑十五分鐘,你能不能在旁邊工作。
付款方式決定你有沒有追索空間
信用卡是消費者手上最有力的工具,因為刷卡有爭議款(chargeback)的管道,貨沒到或貨不符時可以透過發卡行請求撤銷。銀行轉帳與加密貨幣付款沒有這個機制,錢出去就很難回來。願意收卡但要你多付手續費的廠商,那筆手續費通常值得付。
法律面上,台灣的消費者保護法給通訊交易七日解除權,但它保護的是「消費者」,以公司名義採購一般不適用,而且客製化商品可能被排除。香港沒有一般性的冷靜期法律,所以合約條款寫什麼就是什麼。結論是:不要把希望寄託在法律的預設保護上,把退貨與驗收條件寫進訂單裡。
大額訂單可以談分段付款:下訂付一部分,機器驗收通過(跑完上面那套 nvidia-smi 與 llama-bench)再付尾款。對方願不願意接受這個安排,本身就是一個很有資訊量的回答。
兩個懷疑派的替代方案,把三年總成本擺在一起算
如果查到這裡你還是不確定,有兩條路可以不用把錢押在單一廠商身上。
第一條是租。 按小時計費的 帶 GPU 的 VPS 可以讓你今天就開始跑,明天就停掉,沒有關稅、沒有電費、沒有噪音,壞了是別人的事。缺點是資料在別人機器上,長期使用單價也比較高。要判斷划不划算,先租一個月,把你真正用掉的 GPU 小時數記下來。大多數人高估自己的使用時數,以為會全天跑,實際上一週用不到十小時。有了真實數字,再對照 租 GPU 與直接買 API token 的損益平衡點,就知道你屬於哪一邊。如果你的需求其實只是「有一個穩定的推論端點」,託管服務與自有主機的比較 會告訴你有沒有必要買硬體。
第二條是自己買已知的硬體。 不買整機,直接買零件,或請本地的電腦店組。好處是每一個型號都是你自己選的,GPU 走原廠保固,壞了在台北或旺角就能處理。以 VRAM 對價格來說,兩張二手 RTX 3090 可以湊到 48GB,是目前最便宜的大 VRAM 路線,但二手卡沒有保固,而且雙卡的功耗與散熱要回頭看上一節的電路限制。
把兩邊放在同一張紙上算三年:整機方案是「機器價 + 稅費 + 運費 + 三年電費 + 停機風險」,租用方案是「每小時單價 × 你實測出來的年使用時數 × 3」。用你自己的報價與自己的電費單填進去,不要用任何人給你的範例數字。算完之後,如果差距在一成以內,那就不是成本問題,而是你想不想要資料留在自己手上的問題,那個答案只有你自己知道。
FAQ
驗收當天,我可以自己確認規格嗎?
可以,而且應該。開機後跑 nvidia-smi --query-gpu=name,memory.total,driver_version,serial --format=csv,輸出的型號字串要和訂單一字不差,memory.total 要等於承諾的容量。再用 sudo dmidecode -t memory 看記憶體條數與速度、sudo nvme list 看硬碟型號與容量、lscpu 看 CPU。對不上就當場提出,收貨簽名之後你的立場會弱很多。把這幾行指令和預期結果先寫進訂單的驗收條款,雙方都清楚。
廠商只給 TFLOPS,我該要求什麼數字?
要求指定條件下的 tokens/s。大型語言模型的生成速度受限於記憶體頻寬,不是理論算力,所以 TFLOPS 大不代表回話快。正確的問法是「Qwen3 32B Q4_K_M、4k context、單一請求的生成速度是多少 tokens/s」,並且要求附上測試軟體版本。你自己可以用 ollama run --verbose <model> 看 eval rate,或用 llama-bench -m <model.gguf> -p 512 -n 128 -ngl 99 得到 pp512 與 tg128 兩個可重複的數字。
機器寄到台灣或香港,要另外付多少稅?
以 2026 年 9 月的規定,台灣進口電腦主機的關稅稅率多數為 0%,但要繳 5% 營業稅,課稅基礎是完稅價格加運費與保險,再加上報關與物流處理費。香港一般貨物不徵進口關稅,也沒有增值稅,主要成本是運費與清關處理費。實際稅則請到財政部關務署的稅則稅率查詢系統自行查證,並且在下單前問清楚報價是 DDP 還是 DAP,因為 DAP 代表這些錢由你在貨到之後另外付。
這種主機放在住家會跳電或太吵嗎?
電的部分看迴路。台灣住宅 110V 15A 迴路的持續負載建議約 1,320 W,一台雙 GPU 主機滿載就可能接近這個數字,同迴路再開冷氣很容易跳。香港 220V 13A 插座的餘裕大得多。熱的部分沒有例外:吃進去的瓦數幾乎全部變成房間裡的熱。噪音要看機殼,伺服器型小風扇滿載常在 55 dB(A) 以上,工作站機殼安靜許多。下單前就要求廠商提供噪音實測值與量測距離。
用哪種方式付款比較有追索空間?
信用卡,因為有爭議款機制,貨沒到或貨不符時可以透過發卡行處理;銀行轉帳與加密貨幣沒有這個管道。台灣消費者保護法的通訊交易七日解除權只保護以個人身分購買的消費者,公司採購通常不適用,客製化商品也可能被排除;香港沒有一般性的冷靜期法律。所以要把驗收條件與退款方式寫進訂單,並盡量談成分段付款,驗機通過再付尾款。