SSD Nodes Learn 🎉 VPS từ $4.99/tháng
Hướng dẫn Matt ConnorBởi Matt Connor · Cập nhật ngày 2026-08-13

Cách xử lý khi Claude báo lỗi giới hạn sử dụng

Khi Claude báo lỗi limit, bạn cần xác định loại giới hạn phiên hay hàng tuần. Bài viết hướng dẫn cách tối ưu prompt, chuyển đổi model hoặc sử dụng API để tiếp tục công việc.

Bạn đã chạm ngưỡng giới hạn nào của Claude

Thông báo chạm ngưỡng giới hạn của Claude sẽ nêu rõ khoảng thời gian bạn cần chờ, và khoảng thời gian đó quyết định những gì bạn có thể làm tiếp theo. Giới hạn phiên (session) và giới hạn hàng tuần áp dụng cho tất cả các model cùng lúc, vì vậy việc chuyển đổi model không giúp bạn khôi phục quyền truy cập. Ngoại lệ là khi giới hạn chỉ nêu tên một model cụ thể: bạn có thể đổi sang model khác để tiếp tục làm việc trong khi model đó vẫn bị chặn.

Claude Code in ra khoảng thời gian chờ và thời điểm reset ngay trên cùng một dòng:

You've hit your session limit · resets 3:45pm
You've hit your weekly limit · resets Mon 12:00am
You've hit your Opus limit · resets 3:45pm

Cửa sổ phiên là khoảng thời gian trượt 5 giờ. Cửa sổ hàng tuần reset vào một thời điểm cố định mỗi tuần được gán cho tài khoản của bạn, vì vậy ngày và giờ reset sẽ không đổi giữa các tuần. Gói Pro có cửa sổ phiên 5 giờ cộng với một giới hạn hàng tuần áp dụng cho tất cả các model. Gói Max bổ sung giới hạn hàng tuần thứ hai áp dụng riêng cho một dòng model. Các con số giới hạn cụ thể nằm trong bảng phân tích chi tiết giới hạn sử dụng Claude. Trang này bắt đầu từ nơi trang đó kết thúc.

Đây là phần khiến nhiều người dùng nhầm lẫn. Mỗi request đều được tính vào cửa sổ phiên và cửa sổ hàng tuần cùng một lúc, vì vậy một buổi chiều làm việc cường độ cao có thể làm cạn kiệt hạn mức hàng tuần trong khi cửa sổ 5 giờ vẫn còn chỗ. Hãy đọc thời điểm reset trước khi bạn lên kế hoạch cho phần còn lại trong ngày. Reset lúc 3:45 chiều chỉ là thời gian nghỉ uống cà phê. Reset vào nửa đêm thứ Hai thì không.

Kiểm tra hạn mức trước khi đoán

Trên claude.ai, hãy mở Settings rồi chọn Usage. Các thanh tiến trình hiển thị bạn đã sử dụng bao nhiêu trong cửa sổ phiên 5 giờ và mỗi cửa sổ hàng tuần, vì vậy bạn có thể thấy hạn mức nào đã hết thay vì phải đoán.

Trong Claude Code, hãy chạy /usage. Lệnh này hiển thị các thanh kế hoạch tương tự cùng với bảng phân tích chi tiết nơi sử dụng gần đây, được phân bổ theo các kỹ năng, subagent, plugin và từng server MCP (model context protocol) dưới dạng phần trăm tổng số. Nhấn d để xem dữ liệu trong 24 giờ qua và w cho 7 ngày qua. Công cụ này cũng gắn cờ bất kỳ mô hình nào chiếm từ 10% trở lên trong mức sử dụng gần đây, và hai mục bạn sẽ thấy nhiều nhất là long context và cache misses.

Có hai lưu ý. Bảng phân tích được tính toán từ lịch sử phiên lưu trữ trên máy đó, vì vậy công việc bạn đã thực hiện trên một laptop khác hoặc trên claude.ai sẽ không có trong đó. Và con số đô la trong khối Session ở trên cùng được tính theo giá niêm yết tiêu chuẩn cho người dùng API (application programming interface), nghĩa là đó không phải là hóa đơn của bạn khi bạn đang sử dụng gói đăng ký.

Việc chuyển sang model nhỏ hơn có giúp ích không?

Chỉ khi tin nhắn chỉ định một model cụ thể. Sau You've hit your Opus limit, hãy chạy /model, chọn Sonnet hoặc Haiku, phiên làm việc sẽ tiếp tục với toàn bộ ngữ cảnh được giữ nguyên. Sau You've hit your session limit hoặc You've hit your weekly limit, /model không thay đổi được gì, vì các cửa sổ đó được chia sẻ cho mọi model.

Việc chuyển đổi mang lại hiệu quả cao hơn nhiều trước khi bạn chạm ngưỡng giới hạn thay vì sau đó. Sonnet xử lý hầu hết các tác vụ lập trình với chi phí chỉ bằng một phần nhỏ so với Opus, vì vậy việc để Opus làm mặc định là một trong hai thói quen dẫn đến việc sử dụng vượt mức ngoài dự kiến. Thói quen còn lại là không bao giờ xóa phiên làm việc. Hãy giao các tác vụ chỉnh sửa máy móc và phân loại log cho Haiku, và chỉ giữ lại Opus cho các quyết định thiết kế mà bạn thực sự gặp bế tắc. Lựa chọn giữa Opus, Sonnet và Haiku sẽ giải thích chi tiết nơi mỗi model phát huy giá trị tương xứng với chi phí của nó.

Ngừng trả phí cho ngữ cảnh bạn không còn sử dụng

Claude Code gửi toàn bộ nội dung hội thoại của bạn trong mỗi yêu cầu, và mỗi khi Claude sử dụng một tool, nó lại gửi thêm một yêu cầu chứa tập hợp kết quả của tool đó. Prompt caching giúp lịch sử hội thoại được đọc với mức phí cache thay vì mức phí input đầy đủ, điều này giúp giảm chi phí chứ không miễn phí. Do đó, một câu hỏi chỉ dài một dòng trong phiên làm việc bạn đã mở từ sáng vẫn sẽ tính phí cho toàn bộ nội dung hội thoại đó.

/context
/clear
/compact Focus on the failing tests and the files we changed

/clear không tốn phí vì nó loại bỏ ngữ cảnh thay vì đọc lại. /compact phải đọc lại nội dung hội thoại mà nó tóm tắt, nên việc nén một ngữ cảnh quá lớn bản thân nó đã là một yêu cầu lớn. Hãy sử dụng /clear khi bạn chuyển sang công việc không liên quan, và /compact chỉ khi bạn đang làm dở việc và cần giữ lại luồng hội thoại. Hãy chạy /rename trước khi xóa để bạn có thể tìm lại phiên làm việc đó bằng /resume.

Thời gian tồn tại của cache quan trọng hơn mức mọi người thường nghĩ. Với gói đăng ký, cache tồn tại trong một giờ. Nó giảm xuống còn năm phút khi bạn bắt đầu sử dụng credit, và năm phút cũng là mặc định trên API key. Tin nhắn đầu tiên của bạn sau bữa trưa dài sẽ bị trượt cache và phải xử lý lại toàn bộ ngữ cảnh với giá input đầy đủ, đó là lý do tại sao mức sử dụng thường tăng vọt mà không rõ nguyên nhân. Khi nào prompt caching mang lại hiệu quả kinh tế giải thích chi tiết về các phép tính này.

Ba đòn bẩy khác cũng nằm ở cùng vị trí. /mcp liệt kê các server đã cấu hình để bạn có thể tắt những server không cần thiết cho tác vụ hiện tại. Một file CLAUDE.md dài sẽ được load ngay khi bắt đầu phiên làm việc bất kể công việc có cần đến nó hay không, vì vậy hãy chuyển các hướng dẫn chuyên biệt vào các kỹ năng (skills), vốn chỉ được load khi được gọi. Ngoài ra, extended thinking được tính phí như output token, đây là phần đắt đỏ, vì vậy hãy giảm nó bằng /effort, tắt nó trong /config, hoặc thiết lập MAX_THINKING_TOKENS=8000 trên một model có ngân sách thinking cố định.

Chia nhỏ công việc để vừa trong một cửa sổ

Nhấn Shift+Tab để chuyển sang chế độ lập kế hoạch trước khi thực hiện thay đổi lớn. Claude sẽ tìm hiểu codebase và đề xuất phương án để bạn phê duyệt. Phát hiện hướng đi sai ở bước này chỉ tốn một kế hoạch thay vì mất hai giờ chỉnh sửa cộng với việc làm lại từ đầu.

Ủy quyền các tác vụ gây nhiễu cho subagent. Việc chạy bộ test hoặc đọc file log dài 10.000 dòng bên trong một subagent sẽ giữ dữ liệu thô trong ngữ cảnh của subagent đó, và chỉ phần tóm tắt mới được trả về cuộc hội thoại chính của bạn.

Nhấn Escape ngay khi thấy Claude đi chệch hướng. /rewind sẽ khôi phục cả cuộc hội thoại và code về checkpoint trước đó, giúp bạn không phải tốn chi phí để gỡ bỏ những công việc không mong muốn.

Bạn nên mua credit sử dụng hay dùng API?

Credit sử dụng cho phép tài khoản Pro hoặc Max tiếp tục hoạt động sau khi đã vượt quá hạn mức của gói, được tính phí theo mức giá API tiêu chuẩn. Bạn hãy bật tính năng này trong phần Settings rồi chọn Usage trên claude.ai với phương thức thanh toán đã được liên kết, hoặc chạy /usage-credits trong Claude Code để mở cài đặt thanh toán trên trình duyệt. Credit áp dụng cho các cuộc hội thoại Claude và việc sử dụng Claude Code trên terminal, với hạn mức quy đổi hàng ngày là $2000. Lệnh này yêu cầu đăng nhập gói thuê bao, vì vậy nó không khả dụng khi bạn xác thực bằng API key. Với gói miễn phí, credit không được cung cấp, nên bước đầu tiên là nâng cấp lên Pro với giá $20 mỗi tháng, và những gì gói Pro bổ sung và giới hạn của nó sẽ cho bạn biết gói này đáp ứng được đến đâu. Nếu bạn phải nạp thêm credit hầu như mỗi tuần, việc chọn hạn mức cao hơn thường là cách tiết kiệm hơn, và sự khác biệt giữa các gói Max $100 và $200 chủ yếu là hệ số nhân mức sử dụng thay vì sự khác biệt về model hay tính năng.

Lựa chọn còn lại là sử dụng API key thông thường từ Claude Console, tính phí theo token và không bị giới hạn bởi phiên làm việc hay hạn mức hàng tuần. Một cái bẫy thường gặp là biến môi trường ANTHROPIC_API_KEY bị thiết lập sai, khiến Claude Code định tuyến qua key đó thay vì gói thuê bao của bạn mà không thông báo. Bạn sẽ chỉ nhận ra điều này qua hóa đơn hoặc thông báo sau:

API Error: Request rejected (429) · this may be a temporary capacity issue. If it persists, check https://status.claude.com.

Lỗi 429 đó là giới hạn tốc độ (rate limit) trên key, không phải trên gói của bạn. Hãy chạy /status và xác nhận credential đang hoạt động đúng là cái bạn muốn sử dụng.

Chi phí cho một buổi chiều sử dụng API là bao nhiêu?

Ví dụ dưới đây là một buổi chiều lập trình theo phong cách agent: 200.000 token đầu vào không cache, 1,8 triệu lượt đọc cache và 150.000 token đầu ra. Giá được tính theo bảng giá của Anthropic vào tháng 8 năm 2026. Mọi mức giá đều được niêm yết trên mỗi triệu token, vì vậy nếu đơn vị này vẫn còn trừu tượng, giá trị thực tế của một triệu token sẽ quy đổi nó thành khối lượng đọc và viết mà bạn có thể hình dung được.

ChartOne afternoon of agent work priced at API list rates, August 2026
The data behind this chart
[
  {
    "label": "Opus 5",
    "input_usd_per_mtok": 5,
    "cache_read_usd_per_mtok": 0.5,
    "output_usd_per_mtok": 25,
    "afternoon_usd": 5.65
  },
  {
    "label": "Sonnet 5",
    "input_usd_per_mtok": 2,
    "cache_read_usd_per_mtok": 0.2,
    "output_usd_per_mtok": 10,
    "afternoon_usd": 2.26
  },
  {
    "label": "Haiku 4.5",
    "input_usd_per_mtok": 1,
    "cache_read_usd_per_mtok": 0.1,
    "output_usd_per_mtok": 5,
    "afternoon_usd": 1.13
  }
]

Cùng một buổi chiều đó tiêu tốn $5.65 trên Opus 5 và $1.13 trên Haiku 4.5. Đầu ra là yếu tố quyết định tổng chi phí: với $25 mỗi triệu token trên Opus 5 so với $5 trên Haiku 4.5, 150.000 token mà Claude viết ra tốn kém hơn 2 triệu token mà nó đọc. Đó là lý do tại sao việc giảm ngân sách suy luận (thinking budget) tiết kiệm hơn là cắt giảm file.

Một mốc thời gian cần lưu ý. Sonnet 5 đang áp dụng giá ưu đãi là $2 cho đầu vào và $10 cho đầu ra trên mỗi triệu token cho đến hết ngày 31 tháng 8 năm 2026, sau đó sẽ chuyển sang mức $3 và $15 vào ngày 1 tháng 9 năm 2026. Điều này khiến chi phí cho cùng một buổi chiều tăng từ $2.26 lên khoảng $3.39.

Cách tính chi phí cho mỗi buổi chiều

Opus 5: 200.000 token đầu vào không cache với giá $5 mỗi triệu là $1.00. 1,8 triệu lượt đọc cache với giá bằng một phần mười giá đầu vào là $0.90. 150.000 token đầu ra với giá $25 mỗi triệu là $3.75. Tổng cộng $5.65.

Sonnet 5: $0.40 cho đầu vào không cache, $0.36 cho lượt đọc cache, $1.50 cho đầu ra. Tổng cộng $2.26.

Haiku 4.5: $0.20 cho đầu vào không cache, $0.18 cho lượt đọc cache, $0.75 cho đầu ra. Tổng cộng $1.13.

Tất cả 3 hàng đều giả định số lượng token như nhau, vì vậy sự chênh lệch giữa chúng hoàn toàn là do giá. Một buổi chiều thực tế sẽ thay đổi tùy thuộc vào lượng context của bạn được giữ trong cache.

Để so sánh quy mô, tài liệu của Anthropic cho biết chi phí trung bình cho Claude Code trong các triển khai doanh nghiệp là khoảng $13 mỗi lập trình viên cho mỗi ngày hoạt động, và dưới $30 mỗi ngày hoạt động cho 90% người dùng tính đến tháng 8 năm 2026. Thanh toán theo token không mặc định rẻ hơn gói đăng ký (subscription). Nó có lợi khi tải công việc của bạn không đều, vì những ngày không làm việc sẽ không tốn phí, và nó sẽ đắt hơn khi bạn làm việc mỗi ngày. So sánh API với gói đăng ký bằng số liệu thực tế sẽ cho thấy điểm hòa vốn.

Chạy tác vụ dài trên VPS qua đêm

Một số tác vụ không cần bạn phải theo dõi: refactor quy mô lớn, migration thử nghiệm, hoặc rà soát tài liệu. Những tác vụ này cũng không cần dùng đến hạn mức subscription của bạn. Hãy đưa chúng lên một VPS (virtual private server) với một API key; chúng sẽ tính phí theo token trong khi hạn mức gói của bạn vẫn còn nguyên cho công việc tương tác vào ngày hôm sau.

Cài đặt Claude Code trên máy Ubuntu và xác nhận nó chạy được:

curl -fsSL https://claude.ai/install.sh | bash
claude --version

claude --version sẽ in ra chuỗi phiên bản như 2.1.211 (Claude Code). Lỗi command not found ở đây nghĩa là ~/.local/bin chưa có trong PATH của bạn, hãy mở một shell mới và thử lại.

Lưu key vào một file thay vì để trong lịch sử shell. Tạo ~/.claude-env bằng trình soạn thảo với một dòng duy nhất, export ANTHROPIC_API_KEY=sk-ant-your-key-here, sau đó khóa quyền truy cập và load nó:

chmod 600 ~/.claude-env
. ~/.claude-env
printenv ANTHROPIC_API_KEY | cut -c1-10

Dòng cuối cùng in ra 10 ký tự đầu tiên, đủ để xác nhận biến đã được thiết lập mà không làm lộ toàn bộ key trên màn hình.

Bây giờ hãy bắt đầu tác vụ bên trong tmux để nó vẫn chạy khi bạn đóng laptop:

tmux new -s overnight
claude --bare -p "Convert every test under ./tests from unittest to pytest, run the suite, and fix what fails" \
  --allowedTools "Read,Edit,Bash" \
  --append-system-prompt-file ./CLAUDE.md \
  --output-format json > ~/overnight.json

Detach bằng Ctrl-b rồi nhấn d, sau đó đóng kết nối. Reattach sau đó bằng tmux attach -t overnight. Claude Code trong một phiên tmux trên VPS giải thích đầy đủ về việc xử lý phiên.

--bare rất quan trọng ở đây. Nó bỏ qua việc tự động phát hiện các hook, skill, plugin và CLAUDE.md, đồng thời không đọc thông tin xác thực OAuth, vì vậy quá trình chạy chỉ sử dụng API key và không gì khác. Đó là lý do giúp tác vụ không tiêu tốn hạn mức subscription của bạn. Điều này cũng có nghĩa là các quy tắc dự án bị vô hiệu, đó là lý do tại sao --append-system-prompt-file được dùng để cung cấp lại chúng một cách chủ động. Nếu không có --bare, một ANTHROPIC_API_KEY được thiết lập sẽ kích hoạt prompt yêu cầu phê duyệt một lần mà một tiến trình chạy ngầm không thể trả lời được.

Vào buổi sáng, hãy đọc kết quả và chi phí từ file JSON:

jq -r '.result' ~/overnight.json
jq -r '.total_cost_usd' ~/overnight.json

Claude Code thoát với mã 0 khi thành công và khác 0 khi tác vụ thất bại, vì vậy một script bao bọc (wrapper script) có thể phân nhánh dựa trên trạng thái thoát và gửi email thông báo lỗi cho bạn. Hãy thiết lập giới hạn chi tiêu cho workspace trong Claude Console trước khi để nó chạy: một agent bị kẹt trong vòng lặp retry lúc 3 giờ sáng là cách nhanh nhất để tiêu tốn tiền thật. Hãy giảm CLAUDE_CODE_MAX_TOOL_USE_CONCURRENCY nếu bạn cũng muốn làm chậm tốc độ xử lý của nó. Kiểm soát chi phí cho các agent chạy ngầm hướng dẫn các giới hạn cần thiết lập trước tiên.

Hãy cấp cho tác vụ một user không có đặc quyền riêng và một git branch riêng. Một agent chỉnh sửa repository mà không có sự giám sát đôi khi sẽ thực hiện những thay đổi mà bạn lẽ ra đã ngăn chặn, và việc dùng branch sẽ biến điều đó thành một git checkout thay vì một sự cố. Chạy coding agent an toàn trên VPS bao quát các biện pháp cô lập.

Đối với công việc số lượng lớn không cần tương tác, ví dụ như phân loại hàng ngàn bản ghi, Batch API sẽ xử lý các yêu cầu một cách bất đồng bộ với mức giảm giá 50% cho cả token đầu vào và đầu ra. Đây là phương thức rẻ nhất trên mỗi token mà Anthropic cung cấp, và khoảng thời gian qua đêm chính là độ trễ phù hợp cho phương thức này.

Những việc không giúp bạn khôi phục quyền truy cập

Bắt đầu một cuộc hội thoại mới không khôi phục hạn mức của bạn. Mức sử dụng được tính dựa trên tài khoản, không phải dựa trên cuộc hội thoại. Việc này giúp các tin nhắn tiếp theo tốn ít chi phí hơn vì cuộc hội thoại mới không chứa lịch sử để hệ thống phải đọc lại, nên vẫn đáng để thực hiện. Đây là cách cắt giảm chi phí, không phải là thiết lập lại.

Xóa các cuộc hội thoại cũ không hoàn lại bất cứ thứ gì. Các token đó đã được tiêu thụ khi chúng được xử lý.

Chuyển đổi model sau khi đã hết hạn phiên hoặc hạn mức tin nhắn hàng tuần không có tác dụng, vì các cửa sổ giới hạn này được chia sẻ cho mọi model. Chỉ có tin nhắn chỉ định tên model mới phản hồi /model.

Thử lại liên tục không có tác dụng gì ngoài việc làm bận terminal của bạn. Thời gian thiết lập lại được in trong thông báo mới là câu trả lời chính xác, và /usage sẽ hiển thị cho bạn cùng một đồng hồ đếm ngược mà không kèm theo lỗi.

FAQ

Khi nào giới hạn của tôi được reset?

Thông báo sẽ cho bạn biết. Giới hạn phiên làm việc chạy theo cửa sổ trượt 5 giờ và thông báo sẽ hiển thị thời gian cụ thể, ví dụ như resets 3:45pm. Giới hạn hàng tuần được reset vào một thời điểm cố định mỗi tuần tùy theo tài khoản của bạn, và thông báo sẽ hiển thị ngày, ví dụ như resets Mon 12:00am. Để xem cả hai thanh trạng thái và thời gian reset trước khi chạm ngưỡng, hãy chạy /usage trong Claude Code, hoặc mở Settings rồi chọn Usage trên claude.ai.

Chuyển sang Sonnet có giúp tôi làm việc tiếp được không?

Chỉ khi thông báo chỉ định đích danh một model. Sau You've hit your Opus limit, hãy chạy /model, chọn một model khác, và phiên làm việc sẽ tiếp tục với context được giữ nguyên. Sau You've hit your session limit hoặc You've hit your weekly limit, việc chọn model không có tác dụng, vì các cửa sổ này tính tổng tất cả các model. Chuyển sang model rẻ hơn trước khi chạm ngưỡng mới là cách thực sự giúp kéo dài cửa sổ sử dụng.

Bắt đầu chat mới có reset giới hạn sử dụng không?

Không. Mức sử dụng được tính theo tài khoản của bạn, vì vậy chat mới vẫn nằm trong cùng một hạn mức. Tuy nhiên, nó giúp mỗi tin nhắn sau đó rẻ hơn, vì cuộc hội thoại mới không chứa lịch sử để Claude phải đọc lại. /clear trong Claude Code thực hiện điều tương tự và không tốn phí, trong khi /compact phải đọc lại cuộc hội thoại mà nó tóm tắt, nên việc nén một phiên làm việc quá lớn bản thân nó đã là một request tốn kém.

Dùng API có rẻ hơn nâng cấp gói thuê bao không?

Điều này phụ thuộc vào mức độ sử dụng ổn định của bạn. Một buổi chiều làm việc như trên trang này tốn $2.26 trên Sonnet 5 và $1.13 trên Haiku 4.5 theo bảng giá tháng 8 năm 2026. Thuê bao là mức phí cố định cho một hạn mức nhất định, nên nó có lợi hơn khi bạn làm việc hầu hết các ngày. Thanh toán theo token có lợi hơn khi khối lượng công việc của bạn không đều, vì những ngày không dùng bạn sẽ không mất phí.

Tôi có thể giữ job chạy trong khi chờ reset không?

Có, nếu bạn chuyển nó ra khỏi gói thuê bao. Hãy chạy nó trên một VPS với ANTHROPIC_API_KEY được thiết lập trong môi trường, khi đó hệ thống sẽ tính phí theo token thay vì trừ vào cửa sổ hạn mức của gói, nên hai bên không bao giờ xung đột. claude --bare -p bên trong tmux vẫn chạy kể cả khi bạn đóng laptop, và --output-format json sẽ ghi lại trường total_cost_usd mà bạn có thể kiểm tra vào sáng hôm sau bằng jq.