Claude 為什麼這麼貴?Token 成本怎麼算
輸出 token 費用是輸入的 5 倍,而且每輪都會重讀完整上下文。查看一個實際工作階段的算式,以及可降低費用的 4 個方法。
Claude 為什麼這麼貴?簡短答案
Claude 昂貴的原因有 4 個,而且會彼此疊加。輸出 token 的計價是輸入 token 的 5 倍。API 不會保留對話記憶,因此每一輪都會重新傳送完整歷史記錄,並再次計費。Agent 會把 1 個問題轉換成數十次 API 呼叫,而每次呼叫都會帶上持續增加的歷史記錄。此外,frontier model 的定價是依據其處理工作的難度,而不是依據執行小型模型的成本。
Token 是一段文字。粗略而言,1 個 token 約含 4 個字元,或約 0.75 個英文單字。費率以每百萬個 token 計算,寫作 MTok(million tokens)。以下所有費率都是截至 August 2026 公布的 Claude API 費率。
大多數意外帳單都來自上述清單中的第 2 和第 3 個原因。人們通常以為 Claude 產生的答案才是費用來源。在 Agent 工作階段中,文字產生通常不到帳單的十分之一。
公開費率,先確認數字一致
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5,
"cache_read_usd": "0.10"
},
{
"label": "Sonnet 5, to Aug 31 2026",
"input_usd": 2,
"output_usd": 10,
"cache_read_usd": "0.20"
},
{
"label": "Sonnet 5, from Sep 1 2026",
"input_usd": 3,
"output_usd": 15,
"cache_read_usd": "0.30"
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25,
"cache_read_usd": "0.50"
}
]請先看費率的結構,不要只看絕對數字。每個模型的輸出費率都正好是輸入費率的 5 倍。Opus 5 的輸入費率為每 1 百萬個輸入 token 5 美元,輸出費率為 25 美元。Haiku 4.5 的費率分別為 1 和 5 美元。因此,最便宜模型與最昂貴模型之間相差 5 倍,讀取與寫入之間也相差 5 倍。
Sonnet 5 在 2026 年 8 月 31 日前採用導入期費率,每 1 百萬個 token 的輸入與輸出費率分別為 2 和 10 美元。自 2026 年 9 月 1 日起,費率調整為 3 和 15 美元。費率會隨模型版本發布而變動,因此在據此編列預算前,請先確認目前費率。這張表下方也沒有免費方案;不過新帳戶會先取得少量額度,而且 API 的部分功能完全不收費。
最後一欄是快取讀取費率。大多數帳單金額都由它決定。先完成算術計算,再回頭查看這一欄。
為什麼輸出 token 的成本是輸入 token 的 5 倍?
讀取與寫入所需的工作量不同。輸入 token 會以單次傳遞處理。模型會一次讀取完整提示,並在其中平行執行處理,因此 60,000 token 的提示讀取時間,不會是 1,000 token 提示的 60,000 倍。
輸出 token 會逐一產生。每個新 token 都需要再次通過模型處理,並以它之前的所有 token 作為上下文。寫入 1,000 個 token 就代表依序執行 1,000 次處理。這些循序工作無法像讀取一樣平行分散,因此每個輸出 token 會讓硬體維持較長時間的運作。
因此,「讓答案更短」的效果不如預期。它只會影響 agent 費用中較小的部分。
為什麼每一輪都要再次計費整段對話?
Claude API 是無狀態的。Anthropic 端沒有一段持續存在、供你逐則追加訊息的對話。每個請求都會攜帶完整的訊息歷程,模型會先讀取全部內容,再產生回應。因此,第 30 輪的計費也包含第 1 至第 29 輪。
這表示對話成本的增長速度會高於對話長度。第 1 輪只會計費少量內容。第 40 輪則會計費大量內容。將 40 輪的費用加總後,你實際支付的 token 數量可能遠高於曾經寫入的 token 總數。
The data behind this chart
[
{
"turn": 1,
"context_tokens": "20,000"
},
{
"turn": 5,
"context_tokens": "32,000"
},
{
"turn": 10,
"context_tokens": "45,000"
},
{
"turn": 15,
"context_tokens": "55,000"
},
{
"turn": 20,
"context_tokens": "64,000"
},
{
"turn": 25,
"context_tokens": "74,000"
},
{
"turn": 30,
"context_tokens": "84,000"
},
{
"turn": 35,
"context_tokens": "92,000"
},
{
"turn": 40,
"context_tokens": "100,000"
}
]上述工作階段一開始有 20,000 個 token,其中包含 system prompt、工具定義,以及代理程式首次開啟的檔案。到了第 40 輪,內容已達 100,000 個 token。將這些數值平均分布在 40 輪後,每個請求讀取的 token 數量約為 60,000。
為什麼 agent 的成本比聊天高這麼多?
聊天模式中,每個問題只會發出 1 個請求。agent 模式中,每個步驟都會發出 1 個請求。讀取檔案是 1 個步驟。執行測試是 1 個步驟。讀取測試輸出是 1 個步驟。編輯檔案是 1 個步驟。完成一項工作需要 40 個步驟,對 coding agent 而言很常見。
使用工具還會產生 2 項額外成本。工具定義會在每個請求中算入輸入 token,因為每次都必須告知模型有哪些工具可用。Anthropic 公布的額外負擔如下:在 tool_choice 設為 auto 時,Opus 5 的工具使用 system prompt 會占用 286 個 token,另外還要加上你自行定義的工具 schema 所占用的 token。部分伺服器端工具也會另外收費。Web search 的費用為每 1,000 次搜尋 $10,且不包含搜尋結果所消耗的 token。
每個工具結果也會永久保留在上下文中。某個命令若輸出 3,000 行,這 3,000 行就會在本次工作階段的後續每個請求中持續占用上下文。Claude Code 顯示的每個工作階段 token 使用量能讓這點清楚可見:執行輸出量大的命令後,觀察輸入數字立即上升。
單一實際工作階段的算式
以下是使用 Opus 5 進行代理式編碼的一個真實小時。共發出 40 次 API 請求。上下文從 20,000 個 token 增加到 100,000 個 token,因此每次請求平均約 60,000 個 token。模型每次請求寫入約 700 個 token,內容包括簡短的工具呼叫,以及幾段較長的程式碼。
Requests in the session: 40
Average context per request: 60,000 tokens
Total input tokens billed: 40 x 60,000 = 2,400,000
Input cost on Opus 5: 2,400,000 x $5 / 1,000,000 = $12.00
Total output tokens: 40 x 700 = 28,000
Output cost on Opus 5: 28,000 x $25 / 1,000,000 = $0.70
Session total = $12.70The data behind this chart
[
{
"label": "Input, context re-read",
"billed_tokens": "2,400,000",
"cost_usd": "12.00"
},
{
"label": "Output, code and tool calls",
"billed_tokens": "28,000",
"cost_usd": "0.70"
}
]請注意其中的比例。讀取成本為 12.00 美元,寫入成本為 0.70 美元,因此你實際讀取的輸出約占帳單的 5%。模型寫入了 28,000 個 token,但讀取部分計費達 2,400,000 個 token。沒有人輸入 2.4 million 個 token。同一批 100,000 個 token 被反覆讀取。
方法1:prompt caching,效益最大
Prompt caching 會儲存 prompt 中穩定前綴的處理結果。下一次請求會直接從快取讀取該前綴,不必重新處理。寫入快取的成本是 5 分鐘快取輸入費率的 1.25 倍,或 1 小時快取輸入費率的 2 倍。讀取快取的成本是輸入費率的 0.1 倍。以 Opus 5 為例,每百萬個 token 的費用是 0.50 美元,而不是 5 美元。
將這項設定套用到上述工作階段。隨著對話持續增加,100,000 個 token 會各自寫入快取一次。其餘 2,300,000 個輸入 token 會改為從快取讀取。
Tokens written to cache: 100,000
Cache write at 1.25x input: 100,000 x $6.25 / 1,000,000 = $0.63
Tokens read from cache: 2,300,000
Cache read at 0.1x input: 2,300,000 x $0.50 / 1,000,000 = $1.15
Output cost, unchanged = $0.70
Session total = $2.48使用 cache_control 欄位標示可快取的部分。將斷點放在每輪之間不會變動的內容之後,也就是 system prompt 和工具定義之後。需要持續參照的長文件,也應放在同一個穩定區塊中。
{
"model": "claude-opus-5",
"system": [
{
"type": "text",
"text": "<long, stable instructions>",
"cache_control": {"type": "ephemeral"}
}
],
"messages": [{"role": "user", "content": "..."}]
}現在,prompt 的順序會直接影響費用。快取命中必須從 prompt 的最開頭開始完全相符,因此每次請求都會變動的內容,必須放在所有不變內容之後。如果在 system prompt 頂端加入 timestamp,每一輪都會使快取失效:整個前綴會變成快取未命中,並再次以輸入費率的 1.25 倍寫入快取。
回應會顯示設定是否生效。傳送請求後,查看 usage 區塊。
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-opus-5",
"max_tokens": 256,
"messages": [{"role": "user", "content": "Hello"}]
}'每個回應都包含類似以下內容的 usage 物件:
{
"usage": {
"input_tokens": 105,
"cache_creation_input_tokens": 7345,
"cache_read_input_tokens": 7123,
"output_tokens": 239
}
}如果重複請求仍在 cache_read_input_tokens 中顯示 0,表示快取未命中。通常原因是斷點之前的內容發生變更。5 分鐘快取也會過期,因此在 6 分鐘後傳送的請求會先快取未命中,再重新寫入快取。
槓桿 2:將簡單回合交給較小的模型
代理程式工作階段中的大多數回合都不困難,例如開啟檔案、執行格式化工具或讀取差異內容。這些工作不需要 frontier model。將它們路由至 Haiku 4.5,可將輸入費率從每百萬個 token 5 美元降至 1 美元。
The data behind this chart
[
{
"label": "Opus 5, no caching",
"session_cost_usd": "12.70"
},
{
"label": "Opus 5, cached",
"session_cost_usd": "2.48"
},
{
"label": "Sonnet 5, cached",
"session_cost_usd": "0.99"
},
{
"label": "Haiku 4.5, cached",
"session_cost_usd": "0.50"
}
]相同的工作階段在未啟用快取的 Opus 5 上要花費 12.70 美元;啟用快取時為 2.48 美元;使用啟用快取的 Sonnet 5 時為 0.99 美元;使用啟用快取的 Haiku 4.5 時則為 0.50 美元。僅啟用快取就能減少約 80% 的費用。選擇模型則能進一步降低剩餘的大部分費用。
但有一項務實的限制需要注意。如果較便宜的模型答錯,您可能必須重新支付整個工作階段的費用,還要加上您自行處理所花的時間。請依工作難度進行路由,不要只看價格。這項原則也適用於更高階的模型:Claude Fable 5 的每百萬個 token 費率高於 Opus 5,分別是 $10 和 $50,因此將回合交給它之前,請先閱讀 這些費率能換來什麼。在 Opus、Sonnet 和 Haiku 之間選擇則說明各模型適合處理哪些工作。
第3 個槓桿:內容脈絡管理
留在內容脈絡中的每個 token,都會在後續每一回合計費。因此,越早移除 token,節省的成本越高。在 40 回合的工作階段中,若於第 5 回合貼入一個 5,000 token 的檔案,之後還會讀取 35 次。這會額外增加 175,000 個輸入 token;在 Opus 5 上,僅一次不慎貼上就可能接近 1 美元。
以下 4 個習慣有助於降低這個數字:
- 開始新工作時建立新的工作階段,不要繼續使用前一天的工作階段。
- 在輸出送達模型前,先使用類似
head -50的方式篩除雜訊,不要等輸出送達後才處理。 - 只要求你需要的那個函式,不要要求整個檔案。
- 長時間工作階段停止取得進展時,要求先產生摘要,再從摘要重新開始。摘要只有幾百個 token;逐字記錄則可能有十萬個 token。
槓桿 4:將所有非互動式工作批次處理
Batch API 會非同步處理請求,並將輸入與輸出的費用各降低 50%。如果工作不需要在下一秒內取得回應,就應以批次方式處理。這包括分類、擷取、彙整待處理資料,以及執行評估。批次折扣可與 prompt caching 疊加使用。互動式工作階段不適用此折扣,因為沒有可等待的處理時間。
我是不是被坑了?
這其實就是「為什麼 Claude 這麼貴」背後真正的問題,因此直接回答:費率已公開,在標準方案中對所有人都相同,而且按 token 計費。例外是協商合約;即使如此,Claude Enterprise 定價也是在相同的用量計費 token 之外,另收按席次計算的費用,而不是取代 token 計費。帳單中的任何費用都不是任意決定的。費率表無法告訴你的是這筆費用是否值得,因為它按 token 定價,而你在意的是成果。
因此,應該改用成果來衡量費用。上面的工作階段未使用快取時,成本為 12.70 美元。如果它交付了一項原本需要你花 1 小時完成的功能,這筆費用就很便宜。如果它花了 40 輪對話仍在原地打轉,同樣的 12.70 美元就什麼也沒換到,而問題從來不在費率。
這是最值得記住的重點。你的帳單會隨 token 數量增加,而不是隨價值增加。同樣長度的高效率工作階段與浪費時間的工作階段,成本相同。因此,四個調整項目的重要性高於費率表:你無法協商每個 token 的價格,但可以決定工作需要多少 token。
因此,應追蹤每項已完成工作的美元成本,而不是每月美元支出。如果你在調整快取與路由後,每項工作的成本下降,即使每月總額上升,設定仍在改善,因為總額增加代表完成了更多工作。
不會降低帳單的做法
有些常見建議幾乎沒有幫助。要求模型「簡潔」只會減少輸出,而輸出在範例帳單中只占 5%。在 60,000 token 的 context 中,縮短自己的問題只能省下幾百個 token。關閉 extended thinking 只有在 thinking token 確實占輸出相當比例時才有用;usage 區塊會顯示這一點,不必自行猜測。
較大的 context window 本身也不會增加費用。在 Claude 4.6 及更新版本中,完整的 1,000,000 token window 按標準單一 token 費率計費,因此 900,000 token 的請求與 9,000 token 的請求,每個 token 的費用相同。window 大小不會決定價格,放入 window 的內容才會。
另外兩項應在規劃階段處理,而不是只看單一工作階段。如果你每天都會互動使用,請比較按 token 計費與固定方案:API 與訂閱費用比較會計算這筆差額。如果固定方案較划算,而你同時也在評估其他供應商,Claude 與 ChatGPT 方案並列價格比較會對兩者執行相同的比較。如果 agent 會在伺服器上無人值守執行,請先設定硬性支出上限,再調整其他設定;VPS 上 AI agent 的費用控制涵蓋這項做法。若只想了解大致規模,1,000,000 個 Claude token 實際能換來什麼會將費率表轉換成文字頁數。
FAQ
為什麼我開始使用 agent 後,Claude 帳單突然增加?
因為 agent 會針對每個問題送出多個請求,而且每個請求都會包含截至目前的完整對話內容。聊天功能每個問題只送出一個請求。coding agent 每個步驟送出一個請求,而單一工作執行 40 個步驟很常見。這些請求都會按照完整上下文計費,因此一個最終達到 100,000 tokens 的工作階段,輸入 tokens 總數可能超過 2,000,000。查看 API 回應中的 input_tokens 和 cache_read_input_tokens,即可直接確認。
prompt caching 真的能大幅降低帳單嗎?
在實際範例中,工作階段費用從 12.70 美元降至 2.48 美元,因為 cache read 的費率是 input 費率的十分之一。節省幅度完全取決於命中率。使用 5 分鐘 cache 時,只要讀取 1 次就能回本,因為寫入費用是 input 費率的 1.25 倍,而讀取費用是 0.1 倍。如果你的 prompt 在每次請求接近開頭處都會變更,便完全不會命中,還會白白支付寫入加價。先透過 cache_read_input_tokens 確認功能正常,再判斷它是否有效。
我是否應該全部使用 Haiku?
不應該。Haiku 4.5 每 1,000,000 個輸入 tokens 的費用為 1 美元,Opus 5 則為 5 美元,因此在分類、路由等簡單且高流量的工作上,確實能節省費用。困難工作的錯誤答案會增加成本,因為除了模型本身節省的費用,還要支付重試請求及你投入的時間。實際可行的做法是混合使用:機械性步驟使用小型模型,需要判斷的步驟使用最先進的模型。
API 比 Claude 訂閱方案便宜嗎?
這取決於你的使用量是否穩定。訂閱方案是固定月費,並附帶使用量限制。API 按 tokens 計費且沒有上限;使用量低或集中在短時間內時,API 通常較便宜,但如果你每天工作時間都大量使用,費用可能更高。從 usage 區塊取得每日平均 tokens,依照所用模型的費率計算,再與方案價格比較;入門方案的價格與使用量限制請參閱 Claude Pro 的費用與使用量限制。如果計算結果顯示 API 較划算,取消方案或降至較低級別 不會浪費你已支付的當月費用,因為存取權會持續到目前計費週期結束。