Claude Pro có bao nhiêu token? Cách kiểm tra giới hạn
Claude Pro không công bố quota token cố định. Gói tính theo message trong rolling window; chat dài dùng hạn mức nhanh hơn. Xem cách kiểm tra mức dùng của bạn.
Claude Pro bao gồm bao nhiêu token?
Claude Pro không bao gồm một hạn mức token cố định, và tính đến September 2026, Anthropic không công bố con số này. Gói Claude được tính theo số message trong một time window luân phiên, không phải theo số token trừ từ số dư. Phạm vi của time window phụ thuộc vào model bạn chọn, độ dài cuộc hội thoại và lượng text được gửi kèm trong mỗi lượt.
Đó là phần trả lời thường bị bỏ qua, vì nhiều người nghĩ gói thuê bao hoạt động giống API key. API key sử dụng số dư được tính bằng token, nên bạn có thể tự cộng chi phí trên invoice. Gói thuê bao bán quyền truy cập trong một giới hạn do Anthropic đặt ra và điều chỉnh. Giới hạn này được tính bằng message, nên không có một con số token cố định để trích dẫn. Ai đưa cho bạn một con số như vậy thì đã tự bịa ra.
Vì vậy, hãy đặt một câu hỏi khác: Điều gì khiến message của tôi tốn nhiều tài nguyên? Câu hỏi đó có câu trả lời cụ thể, và bạn có thể xử lý ngay hôm nay.
Vì sao gói thuê bao không thể báo một con số token
API tính phí cho từng request dựa trên số token. Input token bao gồm mọi thứ bạn gửi, output token bao gồm mọi nội dung model trả về, và hai loại này có đơn giá khác nhau. Vì vậy, trước khi ước tính, bạn cần biết input token và output token có chi phí khác nhau.
Các gói dành cho người dùng cá nhân không có số dư để tiêu. Anthropic giới hạn số message bạn có thể gửi trong một rolling window. Cửa sổ này bắt đầu từ message đầu tiên và đóng lại sau một số giờ cố định. Các gói trả phí còn có thêm một giới hạn dài hơn, được tính trong một tuần. Một message không có kích thước cố định. Vì vậy, cùng một số lượng message có thể tương ứng với khối lượng xử lý rất khác nhau đối với hai người dùng.
Các trang trợ giúp của Anthropic mô tả giới hạn bằng số message ước tính cho một cuộc hội thoại ngắn. Sau đó, các trang này cảnh báo rằng hội thoại dài và file đính kèm lớn sẽ làm mức sử dụng tăng nhanh hơn. Cảnh báo đó chính là toàn bộ vấn đề, nhưng cơ chế phía sau hầu như không được giải thích.
Vì sao lượt 20 của một cuộc trò chuyện tốn nhiều hơn lượt 1
Model không lưu memory giữa các request. Model stateless, nên mỗi lượt đều gửi lại toàn bộ cuộc trò chuyện: system prompt, từng message trước đó bạn đã viết, từng reply trước đó từ Claude và mọi file bạn đã đính kèm. Câu hỏi mới của bạn có thể chỉ gồm 20 từ. Nhưng request chứa câu hỏi đó là toàn bộ transcript.
Vì vậy, chi phí của mỗi lượt tăng theo độ dài cuộc trò chuyện và tăng tuyến tính. Các dòng bên dưới minh họa phép tính này với một bộ giả định: system prompt gần 1,000 token, mỗi message của bạn gần 1,000 token và mỗi reply gần 1,200 token. Đây là minh họa cho cơ chế hoạt động, không phải số liệu đo trên account của bạn.
The data behind this chart
[
{
"label": "Turn 1",
"sent_this_turn": "2,000",
"cumulative_input": "2,000"
},
{
"label": "Turn 5",
"sent_this_turn": "10,800",
"cumulative_input": "32,000"
},
{
"label": "Turn 10",
"sent_this_turn": "21,800",
"cumulative_input": "119,000"
},
{
"label": "Turn 20",
"sent_this_turn": "43,800",
"cumulative_input": "458,000"
}
]Lượt 1 gửi 2,000 input token. Đến lượt 20, cùng một câu hỏi ngắn đó gửi 43,800, nhiều hơn 20 lần, dù lượng nội dung bạn nhập vẫn như nhau. Trong toàn bộ cuộc trò chuyện, bạn đã gửi 458,000 input token, và phần lớn trong số đó là cùng một đoạn văn bản được gửi lặp đi lặp lại.
20 cuộc trò chuyện riêng biệt, mỗi cuộc chỉ có 1 lượt, sẽ gửi lượng token bằng 20 lần dòng đầu tiên ở trên và không gửi thêm gì. Cùng những câu hỏi đó nhưng tải nhỏ hơn nhiều. File đính kèm làm khoảng cách này lớn hơn, vì một PDF bạn đính kèm ở lượt 2 sẽ được gửi lại ở lượt 3, lượt 4 và mọi lượt sau đó, dù cuộc trò chuyện còn liên quan đến file đó hay không.
Đây là lý do hai người dùng cùng một plan có thể báo cáo mức sử dụng hoàn toàn khác nhau. Một người giữ nguyên một thread suốt cả tuần và chạm giới hạn vào thứ Tư. Người kia mở chat mới cho từng task và hiếm khi thấy giới hạn. Không ai làm sai. Lượng token họ dùng khác nhau cả một bậc độ lớn vì thói quen của họ khác nhau.
Trên API, bạn có thể giảm chi phí lặp lại bằng prompt caching. Cơ chế này lưu phần đầu không thay đổi của request, để các lần gọi sau được tính input rate thấp hơn cho phần đó. Với subscription, bạn không kiểm soát được caching. Vì vậy, độ dài cuộc trò chuyện là đòn bẩy thực tế bạn có thể kiểm soát. Cơ chế này đặc biệt ảnh hưởng đến các phiên coding, vì nội dung file và định nghĩa tool được gửi kèm trong mọi lượt. Do đó, giữ context của phiên coding ở mức nhỏ giúp bạn kiểm soát limit hiệu quả hơn bất kỳ setting nào. Bạn cũng nên đọc token của một phiên Claude Code thực sự được dùng vào đâu trước khi đổ lỗi cho plan.
Mỗi cấp gói mang lại gì, xét theo tương quan
Không có cấp gói nào công bố hạn mức tuyệt đối. Thông tin được công bố là mức tương đối, và như vậy là đủ để lựa chọn. Free ở mức thấp nhất, đồng thời dung lượng miễn phí có thể bị siết khi nhu cầu đối với dịch vụ tăng cao. Pro ở trên Free. Max có 2 quy mô, được mô tả theo bội số mức sử dụng của Pro: khoảng 5 lần và khoảng 20 lần. Team và Enterprise tính phí theo seat và có hạn mức riêng.
Hãy xem các bội số này là tuyên bố về định hướng, không phải cam kết hợp đồng. Anthropic điều chỉnh các hạn mức, và không thông báo trước việc điều chỉnh. Đây là một lý do khác khiến không trang nào có thể cung cấp cho bạn một con số token đáng tin cậy. Về chi phí trong cùng phép so sánh, Pro có giá bao nhiêu và giới hạn bạn ở đâu và chênh lệch giữa 2 cấp Max sẽ giải thích phần này; còn gói miễn phí thực sự cho phép những gì giải thích mức cơ bản.
Việc chọn model là một hệ số thứ hai nằm trên cấp gói. Cùng một câu hỏi sẽ chiếm nhiều hơn trong window của bạn khi dùng model lớn nhất so với model nhỏ nhất, vì model nặng hơn tốn nhiều chi phí hơn cho mỗi token khi chạy. Chuyển các tác vụ thường ngày từ Opus sang Sonnet hoặc Haiku thường giúp bạn có thêm thời gian làm việc nhiều hơn một lần nâng cấp, vì vậy chọn model phù hợp với tác vụ là việc đầu tiên nên thử khi bạn liên tục dùng hết hạn mức.
Cách xem mức sử dụng của chính bạn thay vì phỏng đoán
Tài khoản của bạn là nguồn thông tin chính xác duy nhất và chỉ cách 2 lần nhấp. Trên claude.ai, mở Settings, rồi chọn Usage. Mục này hiển thị lượng bạn đã sử dụng trong window hiện tại và thời điểm window đó reset. Hãy kiểm tra một lần khi các câu trả lời bắt đầu bị từ chối và một lần sau một phiên dài. Bạn sẽ nắm được quy luật sử dụng của mình nhanh hơn nhiều so với bất kỳ số liệu được công bố nào.
Trong Claude Code, 2 slash command thực hiện cùng việc đó từ terminal. /usage báo cáo mức sử dụng của plan và thời điểm reset. /context phân tích những thành phần đang lấp đầy context window, gồm system prompt, định nghĩa tool, file và lịch sử hội thoại. Khi /context cho thấy hội thoại cũ chiếm phần lớn, /clear sẽ bắt đầu một session mới và chi phí cho mỗi lượt quay về gần mức của hàng đầu tiên trong biểu đồ trên.
Trên API, số liệu là chính xác và bạn có thể yêu cầu số liệu đó trước khi gửi bất kỳ nội dung nào:
curl https://api.anthropic.com/v1/messages/count_tokens \
--header "x-api-key: $ANTHROPIC_API_KEY" \
--header "anthropic-version: 2023-06-01" \
--header "content-type: application/json" \
--data '{
"model": "claude-sonnet-5",
"messages": [{"role": "user", "content": "Summarise the attached report."}]
}'Response hợp lệ chỉ có một field. Đây là số mà hệ thống billing sẽ sử dụng:
{"input_tokens": 14}Mỗi request hoàn tất đều báo cáo cùng cách tính khi kết thúc:
{"usage": {"input_tokens": 21430, "output_tokens": 512}}Hãy gửi một câu hỏi ngắn trong một request mới, sau đó gửi lại chính câu hỏi đó ở cuối một thread dài và so sánh 2 giá trị input_tokens. Chênh lệch này chính xác là tác động mà subscription của bạn đang tính, được thể hiện bằng một con số.
Phải làm gì khi chạm giới hạn giữa chừng
- Chờ đến khi cửa sổ được reset. Ứng dụng hiển thị thời điểm reset, và thời gian chờ thường ngắn hơn thời gian cần cho cách xử lý thay thế. Đây là lựa chọn phù hợp khi không có việc nào cần hoàn thành ngay.
- Chuyển sang model nhẹ hơn. Model nhỏ hơn có chi phí trên mỗi lượt thấp hơn trong mọi plan. Trên một số plan, model này còn dùng một hạn mức riêng, nên bạn có thể tiếp tục làm việc trong khi model nặng được reset.
- Mở một chat mới và chỉ mang theo những gì bước tiếp theo cần. Dán phần kết luận, không dán toàn bộ transcript. Chi phí trên mỗi lượt giảm ngay lập tức. Câu trả lời thường cũng tốt hơn vì model không còn phải xử lý hàng nghìn token của phần thảo luận đã được thống nhất.
- Chuyển công việc sang API, nơi token được tính theo từng request và tính phí theo token. Bạn không phải chờ cửa sổ được reset. Bạn cũng có thể xem chi phí của từng lần gọi trước và sau khi thực hiện.
Lựa chọn phù hợp phụ thuộc vào việc vấn đề của bạn nằm ở thời gian hay workload. Một lần cần xử lý gấp là vấn đề về thời điểm. Nếu bạn chạm tường giới hạn vào mỗi thứ Tư, đó là vấn đề về workload. Trường hợp này cần dùng API hoặc plan lớn hơn, thay vì chỉ chọn thời điểm tốt hơn. checklist đầy đủ khi chạm giới hạn giữa chừng hướng dẫn từng bước để khôi phục, còn cách các cửa sổ cuốn chiếu mở và reset giải thích vì sao bộ đếm thời gian hoạt động như vậy. Nếu bạn định chuyển sang API, hãy tính chi phí trước: so sánh API với subscription cho cùng một workload và chi phí thực tế của một triệu token cung cấp phép tính trước khi bạn chuyển đổi.
FAQ
Claude Pro bao gồm bao nhiêu token?
Anthropic không công bố hạn mức token cho Pro, và tính đến September 2026 không có con số nào để trích dẫn. Pro được tính theo số message trong một rolling window, với một hạn mức dài hơn được tính trong một tuần. Số message có thể gửi thay đổi theo model và độ dài cuộc trò chuyện. Bất kỳ trang nào nêu một con số token hàng tháng cụ thể cho Pro đều chỉ đang đoán. Mở Settings, rồi chọn Usage trên claude.ai để xem mức sử dụng và thời điểm reset của tài khoản bạn.
Bắt đầu chat mới có reset mức sử dụng không?
Không. Mức sử dụng được tính trên toàn bộ account trong rolling window, nên chat mới không hoàn lại phần bạn đã dùng. Điều thay đổi là chi phí của mỗi lượt từ thời điểm đó. Chat mới không có transcript để gửi lại, nên bắt đầu ở mức thấp của biểu đồ trên thay vì tiếp tục tăng. Mở chat mới khi chủ đề thay đổi là cách tiết kiệm nhất trên mọi plan.
Vì sao hôm nay tôi chạm giới hạn nhanh hơn hôm qua?
Thông thường vì công việc hôm nay diễn ra trong một thread dài. Mỗi lượt đều gửi lại toàn bộ cuộc trò chuyện cùng các file đính kèm, nên chi phí trên mỗi message tăng đều dù số message hiển thị với bạn không đổi. Nguyên nhân phổ biến khác là model: các model nặng sử dụng hạn mức nhanh hơn trong mỗi lượt, nên một buổi chiều dùng model lớn nhất sẽ kết thúc sớm hơn một buổi sáng dùng model nhỏ hơn.
Tôi có nên chuyển sang API để đếm token chính xác không?
Hãy chuyển nếu bạn cần số liệu hoặc khả năng dự đoán. API đếm input token và output token trong mỗi call, cung cấp token counting endpoint mà bạn có thể chạy trước khi gửi, và không có window phải chờ hết. API tính phí theo token, nên dùng nhiều sẽ tốn hơn subscription cố định, còn dùng ít sẽ rẻ hơn nhiều. Hãy tính chi phí workload thực tế so với plan hiện tại trước khi chuyển, vì kết quả phụ thuộc vào số token bạn gửi.