SSD Nodes Learn 🎉 VPS $5.50/月起
指南 Matt Connor作者: Matt Connor · 已更新 2026-08-13

Claude Fable 5 價格與適用情境

Claude Fable 5 的 API 費率為每百萬輸入 tokens $10、輸出 $50。了解 Sonnet 5 於 2026 年 9 月 1 日調價後的差異,以及 Prompt caching 與 Batch API 如何影響實際費用。

Claude Fable 5 的費用是多少?

在 Claude API 上,Claude Fable 5 的輸入費率為每百萬個輸入 tokens $10,輸出費率為每百萬個輸出 tokens $50。這些是 Anthropic 公布的牌價,取自 2026 年 8 月 3 日的定價頁面。API 模型 ID 為 claude-fable-5。該模型已於 2026 年 6 月 9 日在 Claude API、Amazon Bedrock、AWS 上的 Claude Platform、Google Cloud 及 Microsoft Foundry 正式推出。

ChartPublished Claude API list prices, US dollars per million tokens, checked 3 August 2026
The data behind this chart
[
  {
    "label": "Claude Fable 5",
    "input": "10",
    "output": "50",
    "cache_read": "1",
    "batch_input": "5",
    "batch_output": "25"
  },
  {
    "label": "Claude Opus 5",
    "input": "5",
    "output": "25",
    "cache_read": "0.50",
    "batch_input": "2.50",
    "batch_output": "12.50"
  },
  {
    "label": "Claude Sonnet 5 (intro rate)",
    "input": "2",
    "output": "10",
    "cache_read": "0.20",
    "batch_input": "1",
    "batch_output": "5"
  },
  {
    "label": "Claude Sonnet 5 (from 1 Sep)",
    "input": "3",
    "output": "15",
    "cache_read": "0.30",
    "batch_input": "1.50",
    "batch_output": "7.50"
  },
  {
    "label": "Claude Haiku 4.5",
    "input": "1",
    "output": "5",
    "cache_read": "0.10",
    "batch_input": "0.50",
    "batch_output": "2.50"
  }
]

可以把這組價格視為階梯。Fable 5 的牌價是 Claude Opus 5 的 2 倍、目前 Claude Sonnet 5 費率的 5 倍,以及 Claude Haiku 4.5 的 10 倍。由於該表中的每個模型,輸出費率都恰好是自身輸入費率的 5 倍,因此帳單的輸入與輸出兩側都遵循相同比例。只要知道工作中的輸入與輸出 tokens 比例,就能透過乘法將一種價格換算成其他價格。

有一個日期會改變計算方式。Sonnet 5 在 2026 年 8 月 31 日前採用優惠價格,每百萬個輸入 tokens 為 $2,每百萬個輸出 tokens 為 $10。自 2026 年 9 月 1 日起,其牌價為每百萬個輸入 tokens $3,每百萬個輸出 tokens $15。Fable 5 自身的價格不變,因此兩者的價差在當天會從 5 倍縮小至略高於 3 倍。如果要編列秋季預算,請使用後續的 Sonnet 價格。

折扣,以及唯一會反向增加費用的乘數

Prompt caching 是影響費用最大的因素。讀取快取的費用是基本輸入價格的十分之一。在 Fable 5 上,每百萬 token 的費用為 $1。寫入快取的費用高於一般輸入 token:5 分鐘快取是基本價格的 1.25 倍,1 小時快取則是 2 倍。5 分鐘快取只要讀取 1 次即可回本,1 小時快取則需讀取 2 次。這項計算說明了為何應先計算 Prompt caching 的損益平衡點,再決定是否全面啟用。

Batch API 會將輸入與輸出兩側的費用都降低 50%,因此批次處理 Fable 5 的費用為每百萬 token $5$25。批次請求採非同步處理,因此只適合不需要立即取得回答的工作。這兩項折扣可以疊加,讓同時使用快取與批次處理的工作在輸入與輸出兩側都能降低費用。

Claude 4.6 及後續模型的 1M token context window 已包含在標準費率中。不會收取長內容額外費用,因此 900k token 請求與 9k token 請求的每 token 費率相同。

會提高費用的乘數是資料駐留設定。將 inference_geo: "us" 設為在美國境內執行推論時,所有 token 類別都會套用 1.1 倍乘數,包括快取讀取與快取寫入。除非合約另有要求,否則請保留預設的全球路由設定。

這個模型有一項特定的計費規則。Fable 5 隨附可拒絕請求的安全分類器。發生這種情況時,Messages API 會以成功的 HTTP 200 回應傳回 stop_reason: "refusal",而不是回報錯誤;如果請求在產生任何輸出前遭到拒絕,也不會收費。若在其他 Claude 模型上重試相同的 prompt,fallback credit 會退還切換所產生的 prompt cache 費用,因此不必為相同的快取預熱支付 2 次費用。

哪些方案包含 Claude Fable 5?

截至 2026 年 8 月 3 日,Anthropic 的 Claude Fable 頁面表示,Pro、Max、Team 和 Enterprise 使用者都可以使用此模型。頁面未列出免費方案。Pro 是這份清單中價格最低的方案,因此Pro 的價格以及使用量限制決定了訂閱使用 Fable 的最低成本。對開發人員而言,Fable 通常可透過 Claude API 及上述列出的雲端市場取得。這條途徑沒有免費層級,因此Anthropic 註冊時提供的小額點數就是計費開始前可用的全部額度。

方案可使用模型,不代表可以無限制使用。Anthropic 定價頁面的方案比較表,對部分席位將 Fable 限制在每週使用量上限的一定比例內,對其他席位則採用使用量點數;這項安排在 2026 年 7 月曾多次變更。Anthropic 關於重新部署 Fable 5 的說明指出,Pro、Max、Team 及部分 Enterprise 方案在 2026 年 7 月 7 日前,可使用最多相當於每週使用量上限 50% 的 Fable;該日期後則改用使用量點數。7 月剩餘期間的報導指出,期限進一步延長,且不同席位類型採用不同安排。

因此,本頁不會列出各方案的使用量上限。該月份發布的數字沒有任何一個能維持兩週,保留過時數字反而比不列出更糟。決定使用方案的當天,請在方案比較表中開啟標示為 Fable 的列,並將新聞文章中的任何數字視為過時資訊。如果你為了使用 Fable 購買席位,但實際額度比比較表讓你預期的更少,在下次續訂前降回較低方案,已付費的當月權益仍會保留。

穩定不變的是 API 費率。在所有途徑中,內含額度用完後,後續 Fable 5 使用量都會依上方圖表中的價格計費。Enterprise 清楚呈現這種結構,因為Enterprise 席位費只購買存取權,token 仍會另外依 API 費率計量。因此,無論採用哪種途徑,都應以價格表中的數字作為規劃依據;針對其他 Claude 模型進行API 計費與訂閱方案比較時,也會得到相同結論。如果你尚未選定層級,請先從哪個 Claude 方案符合你的使用量開始。如果該席位除了用來存取 Fable,也會作為日常助理使用,決定前也值得查看Claude 各方案與 ChatGPT 的價格比較

為何帳單增幅高於價格比例所顯示的結果

有 2 個已記錄的機制,會讓 Fable 5 的成本高於直接比較價格所推算的結果。

第一個是 tokenizer。Fable 5 使用 Claude Opus 4.7 引入的 tokenizer。與 Opus 4.7 之前發布的模型相比,相同文字產生的 token 約多 30%,實際增幅則取決於內容。Haiku 4.5 早於該 tokenizer,因此價格表中的 10 倍差距,在讓 2 個模型處理相同文字後,實際更接近 13 倍。Sonnet 5 使用較新的 tokenizer,因此 Fable 與 Sonnet 之間可以公平比較每個 token 的價格。Fable 與 Haiku 則不能直接比較。

第二個是 thinking。Fable 5 永遠啟用 adaptive thinking,且不支援 thinking: {"type": "disabled"}。Thinking token 會以 output token 計費,並套用完整的 output rate。此模型永遠不會回傳原始 chain of thought,而 thinking.display 預設為 "omitted",因此簡短的可見回答仍可能包含大量計費 output token。Anthropic 的文件明確指出:計費的 output token 數量不等於回應中可見的 token 數量。

請查看明細,不要自行推測。usage.output_tokens_details.thinking_tokens 欄位會顯示計費的 output token 中,有多少用於 reasoning:

{
  "usage": {
    "input_tokens": 25,
    "output_tokens": 348,
    "output_tokens_details": {
      "thinking_tokens": 312
    }
  }
}

該範例取自 Anthropic 的 thinking 文件,其中 348 個計費 output token 有 312 個用於使用者從未看見的 reasoning。使用串流時,這項明細只會在最後的 message_delta event 中傳送,因此在最後一個文字區塊後停止讀取的 client,永遠不會記錄這項資訊。

控制項是 effort,設定為 output_config.effort,可用層級包括 lowmediumhigh(預設值)、xhighmax

{
  "model": "claude-fable-5",
  "max_tokens": 32000,
  "output_config": { "effort": "medium" },
  "messages": [{ "role": "user", "content": "..." }]
}

Anthropic 對此模型的建議是從 high 開始,只有在最重視能力的工作中才提高至 xhigh;例行工作則降至 mediumlow。原因是,在 Fable 5 上使用較低的 effort,通常優於早期模型的 xhigh。這會帶來 2 個常見陷阱。每次請求變更 effort 都會使 prompt cache 失效,因為解析後的 effort 值會寫入 prompt;因此應為每種工作負載選定一個層級並維持不變。max_tokens 是 output 總量的硬上限,包含 thinking 和回應文字,因此,若上限是按照不含 thinking 的回答設定,回應就會遭到截斷。看到 stop_reason: "max_tokens" 表示你必須提高上限,或降低 effort。

每項已完成工作,而不是每個 token 的成本

ChartCost of one job in US dollars, worked from published rates and assumed token volumes
The data behind this chart
[
  {
    "label": "Short answer (5k in, 1k out)",
    "fable_5": "0.10",
    "opus_5": "0.05",
    "sonnet_5": "0.02",
    "haiku_4_5": "0.01"
  },
  {
    "label": "Coding session (300k in, 40k out)",
    "fable_5": "5.00",
    "opus_5": "2.50",
    "sonnet_5": "1.00",
    "haiku_4_5": "0.50"
  },
  {
    "label": "Long agent run (2M in, 400k out)",
    "fable_5": "40.00",
    "opus_5": "20.00",
    "sonnet_5": "8.00",
    "haiku_4_5": "4.00"
  }
]

3 列是算術結果,不是基準測試。費率是公開資料。token 數量是應由你自己的使用資料取代的假設值。以中間一列所代表的 coding session 而言,在 Fable 5 上的成本為 $5.00,在 Sonnet 5 上則為 $1.00。長時間執行的成本分別為 $40.00$8.00。最後一列的 Haiku 欄位僅是算術結果:Haiku 4.5 的 context window 為 200k token,因此根本無法容納該工作。

以每個 token 計算成本,是錯誤的決策單位。每項已完成工作的成本,等於每次嘗試的成本乘以嘗試次數。以目前費率計算,1 次 Fable 5 嘗試的成本等於 5 次 Sonnet 5 嘗試,因此單靠 retry 次數幾乎從來不足以證明升級的合理性。Sonnet 必須在 5 次中失敗超過 4 次,使用較低成本的方案才會在 token 成本上處於劣勢。

真正足以支持升級的因素,是 token 帳單未反映的所有成本。圖中兩次長時間執行的成本差距,在多數市場都低於 1 小時的工程師工時。如果高成本模型能節省 1 小時的審查時間,或避免 1 次之後必須拆解重做的不良 migration,它就已經透過帳單上不會顯示的節省回本。請以每項驗收結果的金額進行比較,並將你自己的時間納入總成本。了解 1 million token 實際能換得什麼能讓這項估算不再那麼抽象。

Claude Fable 5 值得其價格的 3 種工作

犯錯代價高的長時間代理程式執行。 Fable 5 適合處理以小時為單位衡量的工作:具備 1M token 的 context window、每次請求最多可輸出 128k token,以及針對執行時間超過三十分钟、token 預算達數百萬的工作所設計的 xhigh effort level。請將這次執行的成本,與代理程式在第 40 步走錯分支、直到第 300 步才被發現後所需的清理工作一併評估。

在大型程式碼庫中只執行一次的 migration 或 audit。 一次性工作沒有執行量可分攤成本,因此每個 token 的溢價會集中在單一筆帳單上,而且整項工作可能可以放進單一個 context window。若可非同步執行,Batch API 可將成本降至每百萬個 output token $25

較便宜的模型已經失敗兩次的工作。 兩次失敗加上除錯時間,其成本高於依上圖用量讓 Fable 執行一次。升級模型是成本較低的分支,而這正是 model ladder 的用途。如果你目前是在一般情況下選擇 tier,Claude 模型 tier 之間的能力比較回答的是與本頁不同的問題。

Sonnet 5 或 Haiku 4.5 才是合理答案的 3 種工作

大量分類與擷取。 這類工作依處理量與單位成本評估,而且品質上限足夠低,便宜的模型即可達到。若某項工作由 Haiku 4.5 以正確結果完成,而 Fable 5 的價格是其 10 倍,卻沒有任何可量化的額外價值。

以延遲為核心的互動工作。 Anthropic 的模型表列出 Fable 5 的相對延遲較高,而且無法關閉 thinking。聊天視窗或編輯器自動補全使用功能較強的模型時,體驗反而較差,因為使用者會先感受到等待時間,才注意到品質差異。

任何取決於 2026 年 1 月之後事件的工作。 Fable 5 的可靠知識截止日期為 2026 年 1 月,Opus 5 則為 2026 年 5 月。價格較高的模型反而掌握較舊的資訊,因此在詢問最新資訊時,除非提供 search 或 fetch 工具,否則付出雙倍費用卻只能取得較舊的知識。

有一項限制完全不屬於成本考量。Fable 5 會保留資料 30 天,且不提供 zero data retention,因為它被指定為 Covered Model。若合約要求 zero retention,Fable 5 無論價格多低都無法使用,折扣也無法改變這項限制。

fable-method repos 顯示了什麼,以及沒有顯示什麼

實務工作者已發布一些 repositories,將 Fable 5 的工作方式提煉成較便宜的模型可以遵循的 skills。fable-method repo 說明了一項思考 skill、一個 orchestration loop,以及一個 adversarial verifier。後者不會閱讀 agent 自己的報告,而是重新執行每一項聲稱已完成的檢查。其 README 也直接說明:「這是社群整理的內容,不是 Anthropic 的成果。」

請將它完全視為上述內容。它能證明人們如何驅動模型,但不能說明模型的運作方式。Anthropic 未驗證其中任何內容,而且存在數個措辭不同但幾乎相同的 forks。這種情況符合民間傳說,而不是規格文件的特徵。

若要評估成本,值得採用的訊號是:人們認為值得複製的部分都是程序性的。先分類工作,指出能證明工作完成的檢查,做出決定前先蒐集證據,最後透過觀察驗證,而不是閱讀摘要。若為較便宜的模型提供明確的 checklist 和 verification step,就能縮小部分差距。因此,請先在自己的 evaluation set 上執行這項實驗,再決定是否統一採用昂貴的模型。結果取決於你的工作內容,所以其他人的數據對你沒有太大參考價值。

在承諾預算前,先核對自己的數字

  • 閱讀每個回應中的 usage,並將 output_tokens_details.thinking_tokens 與可見輸出分開記錄。你看不到的推理內容,才是最容易造成意外支出的項目。
  • 明確設定 effort,不要接受預設值。凡是依賴 prompt caching 的對話,都應維持此設定不變。
  • 先將穩定的前置內容放在 cache breakpoint 後方。以基本輸入價格十分之一計算的快取讀取費用,通常比多數模型降級方案更能節省成本。
  • 將不需要立即回覆的工作移至 Batch API。
  • 誠實評估替代方案。在長期投入前,針對自己的工作負載比較 Claude 與 ChatGPT API 的定價,花一個下午進行評估值得。

如果工作負載是在自己的伺服器上執行的 agent,最重要的控制措施不在模型選擇,而在模型之外。控制 VPS 上的 agent 成本說明可限制失控工作階段的迴圈次數與支出上限;Claude Code 實際將 token 用在哪裡則說明你會在使用量儀表板中看到的數字。

FAQ

Claude Fable 5 每百萬個 token 的費用是多少?

截至 2026 年 8 月 3 日,Anthropic 定價頁面顯示,Claude Fable 5 在 Claude API 上的輸入費率為每百萬個輸入 token $10,輸出費率為每百萬個輸出 token $50。快取讀取的費率為每百萬個 token $1,是基本輸入費率的十分之一。Batch API 對輸入與輸出兩側都提供 50% 折扣,非同步工作每百萬個 token 的費率分別為 $5$25。使用 inference_geo 參數,將推論限制在美國境內時,每個類別都會套用 1.1 倍的乘數。

Claude Pro 訂閱是否包含 Claude Fable 5?

Anthropic 的 Claude Fable 頁面列出 Pro、Max、Team 和 Enterprise 使用者可使用此模型,但未列出免費方案。包含的使用額度並非無限。有些席位會將 Fable 的使用量計入每週使用上限,有些則透過使用額度提供;這項安排在 2026 年 7 月曾變更不只一次。請在決定當天查看 Anthropic 定價頁面方案比較表中標示為 Fable 的列,不要直接採信文章中的數字。包含的額度用完後,後續使用量會依 API 費率計費。

為什麼 Claude Fable 5 的帳單高於可見輸出所顯示的費用?

Claude Fable 5 一律啟用自適應思考。思考 token 會按輸出 token 計費,而且不會回傳原始思考鏈。thinking.display 使用預設值 omitted 時,您會看到空白的思考欄位,但其中每個推理 token 仍會計費。請讀取回應中的 usage.output_tokens_details.thinking_tokens 來查看明細;使用串流時,該內容只會在最後一個 message_delta 事件中到達。如果推理與答案的比例高於工作所需,請降低 effort 層級。

應該使用 Claude Fable 5 還是 Claude Opus 5?

Claude Opus 5 的每 token 費用低一半,且具備較近期且可靠的知識截止日期:Claude Opus 5 為 2026 年 5 月,Fable 5 則為 2026 年 1 月。先使用 Opus 5;若工作在該模型上失敗,或錯誤答案造成的損失高於價格差異,再升級至 Fable 5。若是長期代理工作,單一錯誤分支可能造成數小時的清理工作,Fable 5 是較適合的選擇。對於一次性工作,若較高的費用只會出現在單一帳單,而不是永久套用到每次請求,也適合使用 Fable 5。

#claude#fable#model-selection#pricing#tokens