Claude 模型怎麼選?Opus、Sonnet、Haiku 費用比較
比較 Claude Opus 4.8、Sonnet 5 與 Haiku 4.5 的適用工作與 2026 年 7 月 API 價格,並用 100,000 次工作試算輸入、輸出費用及最影響帳單的設定。
我應該使用哪個 Claude 模型?
如果你不確定應該使用哪個 Claude 模型,簡短答案是:先從 Claude Opus 4.8 開始,只有在能說明具體理由時才改用其他模型。Anthropic 的建議也相同:「如果不確定該使用哪個模型,請先使用 Claude Opus 4.8,處理複雜的代理式程式設計與企業工作。」當任務規格明確,而且你每天會執行許多次時,改用 Claude Sonnet 5。對於機械性、高大量的工作,如果你已經知道正確答案應有的樣子,再改用 Claude Haiku 4.5。Claude Fable 5 的能力高於這些模型,適合長時間執行的代理。
模型選擇也會影響費用。以下是 Claude API(應用程式介面)截至 23 July 2026 的價格。單位為每百萬 tokens,文件中記為 MTok。
- Claude Fable 5 (
claude-fable-5):輸入 $10 / MTok,輸出 $50 / MTok。1M context。 - Claude Opus 4.8 (
claude-opus-4-8):輸入 $5,輸出 $25。1M context。 - Claude Opus 4.7 (
claude-opus-4-7):輸入 $5,輸出 $25。1M context。 - Claude Sonnet 5 (
claude-sonnet-5):截至 31 August 2026 的導入價格為輸入 $2、輸出 $10。標準價格輸入 $3、輸出 $15,於 1 September 2026 生效。1M context。 - Claude Haiku 4.5 (
claude-haiku-4-5):輸入 $1,輸出 $5。200K context。
上述識別字串必須完整照寫。不可在其後附加任何內容。
對 1M-token 模型而言,大小本身不會產生額外費用:「900k-token 請求與 9k-token 請求採用相同的每 token 費率。」這些費率也適用於 API 以外的使用情境,因為 Claude Enterprise 會在席位價格之外,按照 API 費率計算用量,因此下文的計算方式同樣適用於採用席位方案的團隊。固定費率訂閱會改變計量方式,但不會改變這項判斷,因為 Claude Max 的兩個層級使用相同的模型,差別只在可用量。在這個方案階梯的更低層級,Claude Pro 每月 $20 購買的是用量額度,而不是每 token 費率,因此限制你的因素是額度重設,而不是帳單。如果你目前使用的是這個方案,應先確認你正在等待哪個時間窗,再進行下文的計算;因為解決方式是改用較小的模型、縮小 context,或改用 API,而不是尋找更低的費率。如果你尚未開始付費,先判斷 Pro 是否值得每月 $20,取決於免費額度多久會限制你一次,而不是上述任何費率。
每個模型實際適用的工作
Anthropic 以每個模型一句話說明產品定位。這些描述比任何排行榜都更能協助判斷。
- Claude Fable 5:「新世代智慧,適用於長時間執行的 agents。」4 個模型中延遲最高。
- Claude Opus 4.8:「適用於複雜的 agentic coding 與企業工作。」延遲中等。
- Claude Sonnet 5:「速度與智慧的最佳組合。」速度快。
- Claude Haiku 4.5:「具備接近前沿智慧的最快模型。」
Fable 5 是這 4 個模型中,這項比較唯一未針對任何工作負載計價的模型。其價格是 Opus 4.8 的 2 倍,因此哪些工作值得投入 $10 並產出 $50需要單獨回答。
Haiku 4.5 也有一些限制,會在價格之前決定其適用的工作。其 context window 為 200K tokens,而非 1M,因此大型 repository 或冗長的 agent transcript 無法放入其中。其同步 Messages API 的最大輸出為 64K tokens,其他模型則為 128K;此外,其可靠的知識截止日期為 February 2025,其他 3 個模型則為 January 2026。
實際工作負載下,這個選擇的成本是多少?
產品線中的每個模型,輸出費率都是輸入費率的 5 倍。Opus 4.8 的輸入費率為 $5,輸出費率為 $25。Haiku 4.5 的輸入費率為 $1,輸出費率為 $5。這個比例適用於整個級距,因此你選擇的模型,對於會產生大量輸出的工作影響最大。
Agentic 工作正是這類工作,因為思考 token 會按照輸出 token 計費,即使文字從未傳送給你,也會計入 max_tokens。在 Fable 5、Opus 4.8、Opus 4.7 與 Sonnet 5 中,推理摘要預設會省略,因此 thinking 欄位會是空的。計費方式不變:「Either way the block is billed the same and passed back the same in multi-turn conversations.」實際計入 Claude token 費用的內容會完整拆解這個計量方式。
你比較的模型是否會執行思考功能可能不同。若忽略這點,成本測試就會失真。Sonnet 5 和 Fable 5 已預設啟用思考功能,不需要額外設定。Opus 4.8 和 Opus 4.7 則預設停用,必須在請求中設定 thinking: {type: "adaptive"}。讀取數據前,請先確保兩側的設定一致。
最便宜的模型可能最昂貴
以一個獨立完成的程式撰寫工作為例。請求包含 60,000 tokens 的上下文,模型產生 8,000 tokens 的輸出,其中包括思考內容。不使用快取,因此計算結果清楚可見。
使用 Opus 4.8 時,0.06 MTok 的輸入按 $5 計算為 $0.30,0.008 MTok 的輸出按 $25 計算為 $0.20。一次嘗試的成本為 $0.50。使用 Haiku 4.5 時,相同的嘗試成本為 $0.06 加上 $0.04,合計 $0.10。
Haiku 每次嘗試便宜 5 倍,看似有很大的成本餘裕。但如果進一步考慮失敗嘗試的後續影響,情況就不同了。你必須閱讀錯誤答案,這會耗費時間。重試時,你會將錯誤答案作為上下文再次傳送,因此每次嘗試都比上一次更大。第三次嘗試仍然失敗時,你還是必須升級到更大的模型:$0.30 的 Haiku 加上 $0.50 的 Opus,合計 $0.80,比直接執行一次 Opus 高出 60%。
因此,決定性問題是:你能以多低的成本檢查答案。若一秒內就能看出答案錯誤,小型模型便很划算。若必須仔細閱讀 diff 才能發現問題,小型模型所耗費的時間不會出現在帳單上,卻仍然是成本。
較小的模型在這些情況下明顯勝出
Haiku 4.5 適合以下情況:
- 機械式的子代理工作。負責重新命名檔案或收集搜尋結果的子代理不需要最前沿的推理能力。建立 Claude AI 代理程式並提供輔助工具後,通常就是這種使用模式。
- 日誌初步分析。判斷某行是雜訊,還是值得人工注意,屬於範圍狹窄且失敗模式明確的判斷。
- 依固定標籤集合進行分類。輸出內容簡短,也能透過樣本衡量準確度。
- 大量生產環境呼叫。每天執行 100,000 次時,每個 token 的價差就不再只是四捨五入誤差。這正是 整合至 n8n 的 AI 工作流程常見的使用型態。
- 任何需要快速回應的情況。Haiku 4.5 被評為產品線中速度最快的模型。
Haiku 有一項特有的限制。其可快取提示的最小長度為 4,096 tokens;Opus 4.8 和 Sonnet 5 則為 1,024。低於此下限時,「任何要求快取少於此 token 數量的請求,都會在未啟用快取的情況下處理,且不會傳回錯誤」。在 Sonnet 5 上會進行快取的 1,500-token 指令區塊,在 Haiku 4.5 上會靜默地不進行快取。判斷依據是 cache_creation_input_tokens 和 cache_read_input_tokens 都為零;降低常駐代理程式的成本一文也涵蓋其他導致快取失效的方式。
會改變答案的調整項目
這些調整對帳單的影響,大於模型名稱本身。
工作量。 output_config.effort 控制模型在回答前執行多少工作。可用級別為 low、medium、high、xhigh 和 max,其中 high 為預設值:「將 effort 設為 high,產生的行為與完全省略 effort 參數時完全相同。」它位於 output_config 內,而不是請求的最上層:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)工作量會影響回應中的每個 token:「它可能影響所有 token 用量,包括工具呼叫。例如,較低的工作量表示 Claude 會減少工具呼叫。」在代理迴圈中,這種影響會累積。它不是 token 上限:「工作量是行為訊號,不是嚴格的 token 預算。」Anthropic 沒有公布各級別的成本倍率,而是建議測試自己的使用情境。因此,今天下午即可實際比較在 high 下執行 Sonnet 5,以及在 low 下執行 Opus 4.8 的結果。Haiku 4.5 不在支援工作量設定的模型清單中。
Prompt caching。 快取讀取的費用是基本輸入費率的 0.1 倍,而決定模型選擇的關鍵,在於這項差異跨越不同級別後的結果。Opus 4.8 的快取命中費用為 $0.50 / MTok,Haiku 4.5 的未快取輸入費用為 $1 / MTok。因此,妥善快取的 Opus 前綴,每個輸入 token 的成本低於未命中快取的 Haiku prompt。對於會重複傳送大型固定前綴的工作負載,維持工作階段整潔比選擇模型更重要。
批次。 如果沒有任何工作需要等待回答,Message Batches API 會使用相同模型,並「對輸入與輸出 token 均提供 50% 折扣」。這會將下方比較表中的每一列費用減半,而且適用於各模型級別:批次執行的 Opus 4.8 工作,成本低於依照 2026 年 9 月 1 日標準價格同步執行的 Sonnet 5 工作,以延遲換取能力,但費用相同。
一個完整的成本比較
工作負載:分類 100,000 封支援電子郵件,每封執行一次呼叫,每次呼叫包含 2,000 個輸入 token 和 300 個輸出 token。總計為 200 MTok 輸入和 30 MTok 輸出。
- Haiku 4.5:200 x $1 = $200 輸入,30 x $5 = $150 輸出。總計 $350。
- Sonnet 5,導入優惠價格:200 x $2 = $400 輸入,30 x $10 = $300 輸出。總計 $700。
- Sonnet 5,自 1 September 2026 起:200 x $3 = $600 輸入,30 x $15 = $450 輸出。總計 $1,050。
- Opus 4.8:200 x $5 = $1,000 輸入,30 x $25 = $750 輸出。總計 $1,750。
只要替換 4 個數字,就能依照明天的價格重新計算。以下調整對結果的影響,比模型名稱更大:
- 批次處理可讓每一行的成本減半:$175、$350、$525 和 $875。沒有人需要等待每晚的分類工作完成,因此沒有理由略過批次處理。
- 快取共用前置內容。 假設每次的 2,000 個輸入 token 中,有 1,200 個是相同的指令區塊。在 Sonnet 5 的導入優惠價格下,這些 token 作為快取命中時的價格為 $0.20 / MTok,而不是 $2 / MTok,因此 120 MTok 的成本是 $24,而不是 $240。再加上以 $2 計算的 80 MTok 新輸入,也就是 $160,以及 $300 的輸出,Sonnet 5 的成本約為 $484,而不是 $700。Haiku 4.5 無法使用相同方法降低成本,因為 1,200 個 token 低於其 4,096 token 的最低門檻。
- 重試。 假設你拒絕 Haiku 對 8% 電子郵件產生的答案,並改用 Opus 4.8 重新執行。將 0.08 x $1,750 = $140 加到 $350,總成本為 $490。請測量你自己的拒絕率,不要直接套用我的數值。
- 工作使用工具定義時的成本。 這些定義產生的 system prompt,在 Opus 4.8 且
tool_choice設為auto時包含 290 個 token;Sonnet 5 為 354 個,Haiku 4.5 為 496 個。價格最低的模型反而承擔最大的固定額外成本。
Haiku 搭配升級處理路徑的成本為 $490,快取 Sonnet 5 的成本為 $484,兩者幾乎相同,而且其中一個模型可在單次處理中完成工作。問題從來不只是選哪個模型。
在工作階段中途切換模型能省錢嗎?
通常沒有標價顯示的那麼多,因為節省的是每個 token 的費用,但可能失去的是整個已快取的前綴。
Anthropic 說明了哪些變更會使快取失效。前綴會依 tools、system、再到 messages 的順序建立,而「每個層級的變更都會使該層級及其後續所有層級失效」。清單中也包含兩項請求設定:「思考設定與解析後的 effort 層級會直接寫入提示內容,因此變更其中任一項都會建立新的快取前綴。」關於 effort,文件的說明更進一步指出:「應在不同工作負載之間調整 effort,而不要在依賴快取命中的對話中調整。」
文件列出的項目中沒有模型,因此不要預設切換模型一定會或一定不會使快取失效。切換後的第一個請求讀取 cache_read_input_tokens,讓實際數值回答這個問題。以 150,000-token 的 Opus 4.8 前綴為例,讀取快取的費用約為 $0.08,而重新寫入約為 $0.94,這已經高於你原本想透過每個 token 的價差節省的數個回合費用。
因此,應在不同工作之間變更這些設定,不要在同一項工作中途變更。在 Claude Code 中,這表示先執行 /clear,因為此時快取本來就會被捨棄,再執行 /model 或 /effort。這兩個指令都要在 CLI 中輸入。因此,如果你使用 Linux,值得安裝的是終端機版本,因為 Anthropic 原生提供給 Linux 的版本 是穩定的 CLI,而桌面應用程式仍處於 beta。切換是否會反映在帳單上,取決於該工作階段的付款方式,因為 Claude Code 可使用固定月費方案或按 token 計費的 API 額度,只有後者會以美元計算模型切換的費用。
如何在自己的工作負載上測試答案
不要使用從其他模型取得的計數來估算提示。Token 計數端點可免費使用,並會使用你指定模型的 tokenizer 進行計數,因此請指定你實際計畫呼叫的模型。該端點是平台中少數永不計費的功能之一;在比較之前,值得先確認還有哪些功能可以免費執行。Opus 4.7 及後續版本、Fable 5 和 Sonnet 5 使用較新的 tokenizer,會「針對相同文字產生約多 30% 的 token」,因此在每個 token 的費率不變時,以舊模型測得的預算套用到新模型會偏低。
接著查看回傳內容。input_tokens 只有未命中快取的剩餘部分,因此實際提示大小是該欄位加上 cache_creation_input_tokens 與 cache_read_input_tokens。在 VPS 上建立第一個 Claude API 應用程式是執行這項測量最小且合理的環境,而哪個 Claude 方案符合你的使用量則是另一項決定,用來判斷你是否需要按 token 付費。如果最後變成要決定訂閱哪個方案,而不是是否訂閱,Claude 各層級方案與 ChatGPT 的價格比較會說明在另一家供應商的方案中,執行相同程式碼工作的成本。如果測量結果讓你決定今後改用 API,將訂閱降一級或完全取消仍會保留你已經付費的期間,因此等數據確認後再決定,不會受到任何處罰。
FAQ
哪個 Claude 模型最適合撰寫程式碼?
對於複雜的代理式程式設計,文件建議從 Claude Opus 4.8 開始使用。截至 2026 年 7 月,輸入每 1 million tokens 收費 $5,輸出每 1 million tokens 收費 $25。Claude Sonnet 5 定位為速度與智慧的最佳組合。在 2026 年 8 月 31 日前,價格為 $2 / $10,不到 Opus 4.8 的一半。請在兩者上執行相同工作,固定 thinking 設定,再透過 response.usage 比較總 token 用量。
Claude Haiku 4.5 夠便宜,可以取代 Sonnet 5 嗎?
單看每個 token 的價格,完全可以:入門定價下,Claude Haiku 4.5 為 $1 / $5,Sonnet 5 為 $2 / $10;自 2026 年 9 月 1 日起,Sonnet 5 為 $3 / $15。但限制條件才是決定因素。Haiku 4.5 的 context window 為 200K tokens,而不是 1M;同步 Messages API 的最大輸出為 64K tokens;可靠的知識截止日期為 2025 年 2 月;不支援 output_config.effort;此外,最小可快取 prompt 為 4,096 tokens,因此較短的 system prompt 會在未明顯提示的情況下停用 caching。
在工作階段中途切換到較便宜的 Claude 模型,能省錢嗎?
通常沒有看起來那麼容易。Anthropic 文件指出,cache invalidator 包括變更 tools、system 或 messages 的 prefix、變更 thinking 設定,以及變更 output_config.effort。文件沒有說明切換模型會如何影響現有 cache,因此應視為未知,並在之後的第一個 request 讀取 cache_read_input_tokens。了解這點很重要:對於 150,000-token 的 Opus 4.8 prefix,cache read 約需 $0.08,而重新寫入約需 $0.94;這筆費用可能超過數個回合所節省的 token 費用。請在工作之間切換,或在 Claude Code 中完成 /clear 後切換,此時 cache 無論如何都會被捨棄。
output_config.effort 會如何影響費用?
它會改變模型在文字、tool calls 與 thinking 上使用的 token 數量。較低的 effort 會減少 tool calls;在代理式迴圈中,這項影響會累積,因為每個 tool result 都會在後續回合重新傳送。可用層級為 low、medium、high、xhigh 與 max,預設值為 high。Anthropic 沒有公布各層級的成本倍數,而是將 effort 視為行為訊號,不是 token 預算,因此請在自己的工作上進行測量。
Claude Batches API 能省多少費用?
輸入與輸出 token 都可節省 50%,代價是採用非同步交付。截至 2026 年 7 月,Opus 4.8 的價格為輸入 $2.50 / 輸出 $12.50,Sonnet 5 在入門定價下為 $1 / $5,Haiku 4.5 為 $0.50 / $2.50。值得注意的是跨層級比較:批次處理的 Opus 4.8 工作,其費用低於 2026 年 9 月 1 日起按標準費率計算的同步 Sonnet 5 工作。因此,批次處理能以相同費用使用更強的模型。