Claude báo giới hạn: bạn cần làm gì tiếp theo?
Gặp lỗi giới hạn Claude? Xác định bạn đang chờ cửa sổ session 5 giờ hay giới hạn tuần, rồi chọn model nhẹ hơn, giảm context, mua credits hoặc dùng API.
Bạn đã chạm giới hạn Claude nào
Thông báo chạm giới hạn Claude cho biết bạn đang phải chờ cửa sổ nào. Cửa sổ đó quyết định việc bạn có thể làm tiếp theo. Giới hạn theo session và theo tuần áp dụng đồng thời cho mọi model, nên đổi model không khôi phục quyền truy cập. Giới hạn chỉ nêu tên một model là ngoại lệ: bạn có thể đổi model và tiếp tục làm việc, trong khi model đó vẫn bị chặn.
Claude Code in cửa sổ và thời điểm reset trên cùng một dòng:
You've hit your session limit · resets 3:45pm
You've hit your weekly limit · resets Mon 12:00am
You've hit your Opus limit · resets 3:45pmCửa sổ session kéo dài 5 giờ và tính theo thời gian trượt. Cửa sổ theo tuần reset vào một thời điểm cố định mỗi tuần, được gán cho tài khoản của bạn, nên ngày và giờ reset không đổi từ tuần này sang tuần khác. Gói Pro có cửa sổ session 5 giờ và một giới hạn theo tuần áp dụng cho mọi model. Gói Max có thêm một giới hạn theo tuần thứ hai, chỉ áp dụng riêng cho một nhóm model. Mức trần cụ thể nằm trong bảng phân tích đầy đủ về giới hạn sử dụng Claude. Trang này bắt đầu từ phần mà bảng đó kết thúc.
Đây là điểm dễ gây nhầm lẫn. Mỗi request được tính đồng thời vào cửa sổ session và cửa sổ theo tuần, nên một buổi chiều dùng nhiều có thể làm hết hạn mức theo tuần trong khi cửa sổ 5 giờ vẫn còn dung lượng. Hãy xem thời điểm reset trước khi lên kế hoạch cho thời gian còn lại trong ngày. Reset lúc 3:45pm chỉ giống một giờ nghỉ uống cà phê. Reset vào 12 giờ đêm thứ Hai thì không.
Xem mức sử dụng trước khi phỏng đoán
Trên claude.ai, mở Settings rồi chọn Usage. Các thanh tiến trình cho biết bạn đã dùng bao nhiêu trong cửa sổ phiên năm giờ và từng cửa sổ hằng tuần. Nhờ đó, bạn biết cửa sổ nào đã hết thay vì phải phỏng đoán.
Trong Claude Code, chạy /usage. Lệnh này hiển thị các thanh mức sử dụng của gói, cùng với phân tích nguồn sử dụng gần đây: skills, subagents, plugins và từng máy chủ MCP (model context protocol), tính theo phần trăm tổng mức sử dụng. Nhấn d để xem 24 giờ gần nhất và w để xem 7 ngày gần nhất. Lệnh này cũng đánh dấu mọi mẫu sử dụng chiếm từ 10% trở lên trong mức sử dụng gần đây. Hai mẫu bạn thường thấy nhất là context dài và cache miss.
Có hai điểm cần lưu ý. Phân tích này được tính từ lịch sử phiên lưu trên máy đó. Vì vậy, dữ liệu từ công việc bạn thực hiện trên laptop khác hoặc trên claude.ai sẽ không có trong đó. Ngoài ra, số tiền trong block Session ở phía trên được tính theo mức giá niêm yết tiêu chuẩn dành cho người dùng API (application programming interface). Vì vậy, đây không phải số tiền bạn phải trả khi dùng subscription.
Chuyển sang model nhỏ hơn có giúp không?
Chỉ khi tin nhắn chỉ định một model. Sau You've hit your Opus limit, chạy /model, chọn Sonnet hoặc Haiku, rồi session tiếp tục với toàn bộ context hiện có. Sau You've hit your session limit hoặc You've hit your weekly limit, /model không thay đổi gì, vì các cửa sổ đó được dùng chung cho mọi model.
Chuyển model trước khi chạm giới hạn hiệu quả hơn nhiều so với sau đó. Sonnet xử lý hầu hết tác vụ coding với mức phí chỉ bằng một phần Opus. Vì vậy, để Opus làm model mặc định là một trong hai thói quen gây ra phần lớn mức sử dụng vượt dự kiến. Thói quen còn lại là không bao giờ xóa session. Giao các chỉnh sửa mang tính cơ học và việc phân loại log cho Haiku, còn giữ Opus cho quyết định thiết kế mà bạn thực sự chưa thể tự giải quyết. Chọn giữa Opus, Sonnet và Haiku giải thích trường hợp từng model xứng đáng với mức phí của mình.
Đừng tiếp tục trả tiền cho context mà bạn không còn dùng
Claude Code gửi toàn bộ cuộc hội thoại trong mỗi request. Mỗi lần Claude dùng một tool, nó lại gửi thêm một request chứa lô kết quả tool đó. Prompt caching giúp đọc lại history theo mức giá cache thay vì mức giá input đầy đủ, nên chi phí thấp hơn nhưng không miễn phí. Vì vậy, một câu hỏi chỉ có một dòng trong session đã mở từ buổi sáng vẫn tính usage cho toàn bộ cuộc hội thoại.
/context
/clear
/compact Focus on the failing tests and the files we changed/clear không tốn chi phí vì nó loại bỏ context thay vì đọc lại context đó. /compact phải đọc cuộc hội thoại mà nó tóm tắt, nên compact một context rất lớn tự nó đã là một request lớn. Dùng /clear khi chuyển sang công việc không liên quan. Chỉ dùng /compact khi đang thực hiện một task và cần giữ lại thread. Chạy /rename trước khi xóa để có thể tìm lại session bằng /resume.
Thời gian tồn tại của cache quan trọng hơn nhiều người nghĩ. Với subscription, cache tồn tại trong một giờ. Cache giảm xuống còn năm phút khi bạn bắt đầu dùng usage credits, và năm phút cũng là giá trị mặc định với API key. Tin nhắn đầu tiên sau một bữa trưa dài sẽ không dùng được cache và phải xử lý lại toàn bộ context theo mức giá input đầy đủ. Vì vậy usage thường tăng mà không có nguyên nhân rõ ràng. Prompt caching giúp tiết kiệm chi phí ở đâu trình bày phần tính toán.
Có thêm 3 cơ chế điều chỉnh ở cùng vị trí. /mcp liệt kê các server đã cấu hình để bạn có thể tắt những server không cần cho task này. Một file CLAUDE.md dài sẽ được load khi session bắt đầu, dù công việc có cần hay không. Vì vậy, hãy chuyển các instruction chuyên biệt vào skills; chúng chỉ được load khi được gọi. Extended thinking được tính là output tokens, tức phần đắt hơn, nên hãy giảm mức này bằng /effort, tắt trong /config hoặc đặt MAX_THINKING_TOKENS=8000 trên model có thinking budget cố định.
Chia nhỏ công việc để vừa trong một cửa sổ
Nhấn Shift+Tab để chuyển sang plan mode trước khi thực hiện một thay đổi lớn. Claude sẽ phân tích codebase và đề xuất cách thực hiện để bạn phê duyệt. Nếu phát hiện hướng đi sai ở bước này, bạn chỉ tốn một plan thay vì mất hai giờ chỉnh sửa rồi phải làm lại.
Giao các tác vụ tạo nhiều output cho subagent. Chạy test suite hoặc đọc log dài 10,000 dòng bên trong một subagent sẽ giữ output thô trong context của subagent đó. Chỉ phần tóm tắt được trả về cuộc hội thoại chính.
Nhấn Escape ngay khi Claude đi sai hướng. /rewind khôi phục cả cuộc hội thoại và code về một checkpoint trước đó, nên bạn không phải tốn chi phí để gỡ bỏ những thay đổi mình chưa từng muốn.
Bạn nên mua usage credits hay dùng API?
Usage credits cho phép tài khoản Pro hoặc Max tiếp tục hoạt động sau khi dùng hết hạn mức của plan, với mức phí theo bảng giá API tiêu chuẩn. Bật tính năng này trong Settings rồi vào Usage trên claude.ai và thêm payment method, hoặc chạy /usage-credits trong Claude Code. Lệnh này sẽ mở phần cài đặt thanh toán trong trình duyệt. Credits áp dụng cho cả các cuộc trò chuyện Claude và việc sử dụng terminal của Claude Code, với giới hạn quy đổi hằng ngày là $2000. Lệnh này yêu cầu đăng nhập bằng subscription, nên không khả dụng khi bạn xác thực bằng API key.
Cách còn lại là dùng API key thông thường từ Claude Console. Cách này tính phí theo token và hoàn toàn không có session hoặc weekly window. Có một lỗi dễ bỏ sót: nếu trong environment còn ANTHROPIC_API_KEY, Claude Code sẽ âm thầm dùng key đó thay cho subscription của bạn. Bạn chỉ phát hiện ra qua hóa đơn hoặc bằng lệnh sau:
API Error: Request rejected (429) · this may be a temporary capacity issue. If it persists, check https://status.claude.com.Mã lỗi 429 là rate limit của key, không phải của plan. Chạy /status và xác nhận credential đang active là credential bạn định dùng.
Chi phí dùng API trong một buổi chiều là bao nhiêu?
Ví dụ tính toán dưới đây là một buổi chiều lập trình theo kiểu agent: 200,000 input token không có trong cache, 1.8 triệu lần đọc từ cache và 150,000 output token. Đây là mức giá niêm yết của Anthropic tính đến tháng 8 năm 2026. Tất cả mức giá đều tính trên mỗi triệu token. Nếu đơn vị này vẫn còn khó hình dung, giá trị thực tế của một triệu token sẽ quy đổi thành lượng nội dung đọc và viết cụ thể hơn.
The data behind this chart
[
{
"label": "Opus 5",
"input_usd_per_mtok": 5,
"cache_read_usd_per_mtok": 0.5,
"output_usd_per_mtok": 25,
"afternoon_usd": 5.65
},
{
"label": "Sonnet 5",
"input_usd_per_mtok": 2,
"cache_read_usd_per_mtok": 0.2,
"output_usd_per_mtok": 10,
"afternoon_usd": 2.26
},
{
"label": "Haiku 4.5",
"input_usd_per_mtok": 1,
"cache_read_usd_per_mtok": 0.1,
"output_usd_per_mtok": 5,
"afternoon_usd": 1.13
}
]Cùng một buổi chiều có chi phí 5.65 USD trên Opus 5 và 1.13 USD trên Haiku 4.5. Output là yếu tố làm tổng chi phí thay đổi: với mức 25 USD cho mỗi triệu token trên Opus 5, so với 5 USD trên Haiku 4.5, 150,000 token Claude ghi ra có chi phí cao hơn 2 triệu token mà nó đọc. Vì vậy, giảm thinking budget tiết kiệm được nhiều hơn cắt bớt file.
Cần lưu ý một mốc thời gian. Sonnet 5 áp dụng mức giá giới thiệu là 2 USD và 10 USD cho mỗi triệu input và output token đến hết ngày 31 tháng 8 năm 2026. Từ ngày 1 tháng 9 năm 2026, mức giá này tăng lên 3 USD và 15 USD, khiến chi phí cho cùng buổi chiều tăng từ 2.26 USD lên khoảng 3.39 USD.
Cách tính từng mức chi phí cho buổi chiều
Opus 5: 200,000 input token không có trong cache, với giá 5 USD cho mỗi triệu token, có chi phí 1.00 USD. 1.8 triệu lần đọc từ cache, tính bằng một phần mười mức giá input, có chi phí 0.90 USD. 150,000 output token, với giá 25 USD cho mỗi triệu token, có chi phí 3.75 USD. Tổng cộng 5.65 USD.
Sonnet 5: 0.40 USD cho input không có trong cache, 0.36 USD cho các lần đọc từ cache và 1.50 USD cho output. Tổng cộng 2.26 USD.
Haiku 4.5: 0.20 USD cho input không có trong cache, 0.18 USD cho các lần đọc từ cache và 0.75 USD cho output. Tổng cộng 1.13 USD.
Cả 3 dòng đều giả định cùng số lượng token, nên chênh lệch giữa các dòng hoàn toàn do giá. Một buổi chiều thực tế sẽ thay đổi tùy vào lượng context được giữ trong cache.
Để dễ hình dung quy mô, tài liệu của chính Anthropic cho biết chi phí Claude Code trung bình trong các hệ thống enterprise gần 13 USD cho mỗi developer trong một ngày hoạt động, và dưới 30 USD cho mỗi ngày hoạt động đối với 90% người dùng, tính đến tháng 8 năm 2026. Tính phí theo token không mặc định rẻ hơn subscription. Cách này có lợi khi tải sử dụng tăng giảm đột biến, vì những ngày không dùng sẽ không phát sinh chi phí, nhưng bất lợi khi bạn làm việc mỗi ngày. So sánh API với subscription bằng số liệu thực tế cho biết điểm hòa vốn.
Chạy job dài trên VPS qua đêm
Một số job không cần bạn theo dõi: refactor lớn, migration test hoặc rà soát tài liệu. Những job đó cũng không cần dùng đến thời lượng subscription của bạn. Đưa chúng lên một VPS (virtual private server) bằng API key để chúng dùng cơ chế tính phí theo token, còn hạn mức trong plan của bạn vẫn được giữ nguyên cho công việc tương tác vào ngày mai.
Cài Claude Code trên một máy Ubuntu và xác nhận chương trình chạy được:
curl -fsSL https://claude.ai/install.sh | bash
claude --versionclaude --version sẽ in ra một chuỗi phiên bản, chẳng hạn như 2.1.211 (Claude Code). command not found ở đây có nghĩa là ~/.local/bin chưa có trong PATH, vì vậy hãy mở shell mới rồi thử lại.
Đặt key vào một file thay vì để nó xuất hiện trong shell history. Mở editor để tạo ~/.claude-env với một dòng là export ANTHROPIC_API_KEY=sk-ant-your-key-here, sau đó giới hạn quyền truy cập và load file:
chmod 600 ~/.claude-env
. ~/.claude-env
printenv ANTHROPIC_API_KEY | cut -c1-10Dòng cuối chỉ in 10 ký tự đầu tiên. Như vậy là đủ để xác nhận biến đã được đặt mà không đưa toàn bộ key lên màn hình.
Bây giờ chạy job bên trong tmux để job vẫn tiếp tục khi bạn đóng laptop:
tmux new -s overnight
claude --bare -p "Convert every test under ./tests from unittest to pytest, run the suite, and fix what fails" \
--allowedTools "Read,Edit,Bash" \
--append-system-prompt-file ./CLAUDE.md \
--output-format json > ~/overnight.jsonDetach bằng Ctrl-b rồi d, sau đó đóng kết nối. Kết nối lại sau bằng tmux attach -t overnight. Claude Code trong tmux session trên VPS trình bày đầy đủ cách quản lý session.
--bare rất quan trọng ở đây. Tùy chọn này bỏ qua việc tự động phát hiện hooks, skills, plugins và CLAUDE.md, đồng thời không bao giờ đọc OAuth credentials, nên lần chạy chỉ dùng API key và không dùng gì khác. Đây là yếu tố khiến job không sử dụng subscription của bạn. Điều đó cũng có nghĩa là các rule của project không còn, nên --append-system-prompt-file chủ động truyền lại chúng. Nếu không có --bare, một ANTHROPIC_API_KEY đã được đặt sẽ kích hoạt prompt yêu cầu phê duyệt một lần mà một lần chạy không có người theo dõi không thể trả lời.
Buổi sáng, đọc kết quả và chi phí từ JSON:
jq -r '.result' ~/overnight.json
jq -r '.total_cost_usd' ~/overnight.jsonClaude Code thoát với mã 0 khi thành công và mã khác 0 khi lần chạy thất bại, nên wrapper script có thể kiểm tra exit status rồi gửi email báo lỗi cho bạn. Trước khi để job chạy, hãy đặt workspace spend limit trong Claude Console: một agent bị mắc trong retry loop lúc 3am là cách thực tế để tiêu tiền thật. Giảm CLAUDE_CODE_MAX_TOOL_USE_CONCURRENCY nếu bạn cũng muốn làm chậm agent. Kiểm soát chi phí cho agent chạy liên tục trình bày các giới hạn nên đặt trước tiên.
Cấp cho job một user không có đặc quyền riêng và một git branch riêng. Agent chỉnh sửa repository khi không có người theo dõi đôi lúc sẽ làm điều mà bạn đã dừng lại nếu đang quan sát, còn branch biến việc đó thành một git checkout thay vì một sự cố. Chạy coding agent an toàn trên VPS trình bày cách cô lập.
Với công việc xử lý hàng loạt hoàn toàn không mang tính tương tác, chẳng hạn phân loại hàng nghìn bản ghi, Batch API xử lý request bất đồng bộ với mức giảm 50% cho cả input token và output token. Đây là cách có chi phí theo token thấp nhất mà Anthropic công bố, và thời lượng qua đêm chính là độ trễ mà cách này yêu cầu.
Điều gì không khôi phục quyền truy cập của bạn
Bắt đầu cuộc trò chuyện mới không khôi phục hạn mức của bạn. Mức sử dụng được tính cho tài khoản, không tính riêng cho từng cuộc trò chuyện. Tuy vậy, cách này làm mỗi tin nhắn tiếp theo rẻ hơn vì cuộc trò chuyện mới không có lịch sử cần đọc lại. Vì thế, bạn vẫn nên làm vậy. Đây là cách giảm chi phí, không phải reset hạn mức.
Xóa các cuộc trò chuyện cũ không hoàn lại gì. Các token đó đã được sử dụng khi hệ thống xử lý chúng.
Đổi model sau khi chạm giới hạn theo session hoặc theo tuần không có tác dụng vì các khoảng giới hạn này được dùng chung cho mọi model. Chỉ tin nhắn chỉ rõ model mới phản hồi /model.
Retry liên tục chỉ khiến terminal bận mà không giải quyết được gì. Thời điểm reset được in trong tin nhắn là thông tin chính xác, và /usage sẽ hiển thị cùng thời điểm đó mà không kèm lỗi.
FAQ
Mất bao lâu để giới hạn Claude được đặt lại?
Thông báo sẽ cho bạn biết. Giới hạn phiên chạy theo cửa sổ trượt 5 giờ và thông báo hiển thị thời điểm, chẳng hạn như resets 3:45pm. Giới hạn theo tuần được đặt lại vào một thời điểm cố định mỗi tuần dành cho tài khoản của bạn, và thông báo hiển thị ngày, chẳng hạn như resets Mon 12:00am. Để xem cả hai thanh giới hạn và thời điểm đặt lại trước khi chạm giới hạn, chạy /usage trong Claude Code, hoặc mở Settings rồi chọn Usage trên claude.ai.
Chuyển sang Sonnet có giúp tôi tiếp tục làm việc không?
Chỉ khi thông báo nêu rõ model. Sau You've hit your Opus limit, chạy /model, chọn một model khác, rồi phiên tiếp tục với nguyên context của bạn. Sau You've hit your session limit hoặc You've hit your weekly limit, việc chọn model không tạo ra khác biệt, vì các cửa sổ này tính tất cả model cùng nhau. Chuyển sang model rẻ hơn trước khi chạm giới hạn mới thực sự kéo dài cửa sổ.
Bắt đầu chat mới có đặt lại giới hạn sử dụng không?
Không. Mức sử dụng được tính theo tài khoản, nên chat mới vẫn bắt đầu với cùng phần allowance còn lại. Tuy nhiên, mỗi message tiếp theo sẽ rẻ hơn, vì conversation mới không có lịch sử để Claude đọc lại. /clear trong Claude Code cũng làm việc tương tự và không tốn phí, còn /compact phải đọc conversation mà nó tóm tắt, nên compact một session rất lớn tự nó đã là một request tốn kém.
API có rẻ hơn nâng cấp plan không?
Điều này phụ thuộc vào mức độ ổn định khi bạn sử dụng. Buổi làm việc buổi chiều trong ví dụ trên trang này có giá $2.26 với Sonnet 5 và $1.13 với Haiku 4.5 theo giá niêm yết tháng 8 năm 2026. Subscription là khoản phí cố định cho một allowance có giới hạn, nên có lợi hơn khi bạn làm việc hầu hết các ngày. Tính phí theo token có lợi hơn khi tải không đều, vì những ngày không sử dụng hoàn toàn không tốn phí.
Tôi có thể để một job chạy trong khi chờ đặt lại giới hạn không?
Có, nếu bạn chuyển job đó ra khỏi subscription. Chạy job trên VPS với ANTHROPIC_API_KEY được đặt trong environment; job sẽ được tính phí theo token thay vì dùng cửa sổ của plan, nên hai mức sử dụng không cạnh tranh với nhau. claude --bare -p bên trong tmux vẫn chạy khi bạn đóng laptop, còn --output-format json ghi một trường total_cost_usd mà bạn có thể kiểm tra vào buổi sáng bằng jq.