Liên hệ
    Hướng dẫn · Cập nhật

    Lỗi 429 rate_limit_error nghĩa là tổ chức của bạn vượt hạn mức RPM, ITPM, OTPM hoặc chạm trần chi tiêu tháng; hãy chờ đúng số giây trong header retry-after rồi thử lại. Lỗi 529 overloaded_error là API quá tải chung, không do tài khoản bạn; xử lý bằng exponential backoff kèm jitter. Tier Start, Build, Scale được xếp tự động, nạp thêm tiền không giúp lên hạng.

    Cập nhật:

    Nội dung 01

    Lỗi 429 và lỗi 529 khác nhau thế nào?

    429 là lỗi của riêng tổ chức bạn. API trả 429 rate_limit_error khi bạn vượt một trong ba hạn mức theo phút, khi chạm trần chi tiêu tháng của tier, hoặc khi request của Claude Code vượt spend limit của workspace Claude Code. Response thường kèm header retry-after cho biết cần chờ bao nhiêu giây. 529 overloaded_error là tình trạng API quá tải tạm thời, xảy ra khi lưu lượng chung của mọi người dùng tăng cao. Tài khoản bạn không vượt gì cả, nên xin nâng hạn mức thường không giải quyết được. Cách đúng là thử lại có giãn cách, hoặc chuyển tạm sang model hay nền tảng khác. Có một kiểu 429 dễ nhầm: acceleration limit. Nếu lưu lượng của tổ chức tăng vọt đột ngột, API có thể trả 429 dù bạn chưa chạm hạn mức. Anthropic khuyên tăng tải từ từ và giữ nhịp sử dụng đều.

    Nội dung 02

    Tier Claude API hiện nay: Start, Build, Scale, Custom

    Nếu bạn đọc hướng dẫn cũ về Tier 1–4 và mức nạp để lên hạng, thông tin đó đã lỗi thời. Hiện Anthropic dùng các tier Start, Build, Scale và Custom. Tổ chức được xếp tier tự động theo lịch sử sử dụng và uy tín tài khoản; không có khoản nạp hay mua nào giúp lên hạng. Tổ chức mới hoặc ít lịch sử có thể bắt đầu ở Evaluation tier, với hạn mức thấp hơn bảng chuẩn. Anthropic nói đây là biện pháp chống gian lận, và hạn mức sẽ tự tăng khi có thêm lịch sử sử dụng. Tier và hạn mức hiện tại xem ở trang Rate limits trong Claude Console.

    • Start: trần chi tiêu $500 mỗi tháng dương lịch.
    • Build: trần $1.000 mỗi tháng.
    • Scale: trần $200.000 mỗi tháng.
    • Custom: không có trần, hạn mức thỏa thuận với account team của Anthropic.
    • Muốn hạn mức cao hơn: bấm Request rate limit increase ở trang Rate limits khi đã dùng từ 50% hạn mức hiện tại; việc gấp thì liên hệ Anthropic support.
    • Claude Platform on AWS: bắt đầu ở Start, tự lên tier khi có lịch sử hóa đơn AWS Marketplace đã thanh toán; không có nút xin nâng trong Console.
    Nội dung 03

    RPM, ITPM, OTPM theo từng tier

    Rate limit của Messages API tính theo ba chỉ số cho từng nhóm model: RPM (request mỗi phút), ITPM (token đầu vào mỗi phút) và OTPM (token đầu ra mỗi phút). Vượt chỉ số nào cũng nhận 429. Hạn mức tính riêng theo nhóm model. Fable 5.1 và Fable 5 chung một nhóm. Opus 4.8, 4.7, 4.6 và 4.5 chung một nhóm. Opus 5.5, Opus 5 và Sonnet 5 mỗi model một nhóm riêng. Sonnet 4.6 và 4.5 chung nhóm. API dùng thuật toán token bucket: dung lượng được bù liên tục chứ không reset theo mốc phút cố định. Hạn mức 60 RPM có thể bị áp như 1 request mỗi giây, nên một loạt request dồn trong vài giây vẫn có thể dính 429. Số liệu dưới đây là hạn mức chuẩn, kiểm tra ngày 28/09/2026.

    • Start: Fable 5.x 1.000 RPM, 500.000 ITPM, 100.000 OTPM; mỗi nhóm Opus 5.5, Opus 5, Opus 4.x, Sonnet 5, Sonnet 4.x, Haiku 4.5 là 1.000 RPM, 2.000.000 ITPM, 400.000 OTPM.
    • Build: Fable 5.x 2.000 RPM, 1.500.000 ITPM, 300.000 OTPM; các nhóm còn lại 5.000 RPM, 5.000.000 ITPM, 1.000.000 OTPM.
    • Scale: Fable 5.x 4.000 RPM, 4.000.000 ITPM, 800.000 OTPM; các nhóm còn lại 10.000 RPM, 10.000.000 ITPM, 2.000.000 OTPM.
    • Batch API có hạn mức riêng dùng chung mọi model: Start 1.000 RPM và 200.000 request chờ xử lý, Build 2.000 và 300.000, Scale 4.000 và 500.000.
    Nội dung 04

    Bảng mã lỗi Claude API và cách xử lý

    Mọi lỗi trả về JSON có error.type, error.message và request_id. Nhóm 4xx (trừ 429) thường do request hoặc tài khoản, nên gửi lại y nguyên sẽ lỗi tiếp. Nhóm 429 (trừ khi chạm trần chi tiêu tháng), 500 và 529 là lỗi tạm thời, nên thử lại có giãn cách. Khi báo lỗi cho Anthropic, luôn gửi kèm request-id (dạng req_...) lấy từ header hoặc từ trường request_id trong body lỗi. Với response thành công, Python và TypeScript SDK trả mã này qua thuộc tính _request_id.

    • 400 invalid_request_error: sai định dạng hoặc tham số, ví dụ tắt thinking trên Opus 5.5. Cũng xuất hiện khi chạm spend limit bạn tự đặt. Sửa request, không retry.
    • 401 authentication_error: key sai định dạng, bị thu hồi hoặc hết hạn. Kiểm tra key, tạo key mới nếu cần.
    • 402 billing_error: vấn đề thanh toán. Kiểm tra thông tin thanh toán trong Console.
    • 403 permission_error: key không có quyền với tài nguyên hoặc workspace đó.
    • 404 not_found_error: sai đường dẫn endpoint hoặc ID tài nguyên.
    • 413 request_too_large: vượt 32 MB với Messages API (Batch API là 256 MB).
    • 429 rate_limit_error: chờ theo retry-after. Nếu error.details.error_code là enforced_spend_limit_reached thì đó là trần chi tiêu tháng, không có retry-after và thử lại vô ích.
    • 500 api_error: lỗi nội bộ phía Anthropic. Retry với exponential backoff; kéo dài thì gửi request-id cho bộ phận hỗ trợ.
    • 504 timeout_error: request xử lý quá lâu. Chuyển sang streaming hoặc Batch API.
    • 529 overloaded_error: API quá tải chung. Retry có backoff và jitter, cân nhắc model dự phòng.
    Nội dung 05

    Retry đúng cách: retry-after, exponential backoff và jitter

    SDK chính thức của Anthropic đã tự retry lỗi kết nối, 429 và 5xx với exponential backoff, mặc định 2 lần, và tôn trọng header retry-after. Với đa số ứng dụng, tăng max_retries lên 4–5 thường là đủ. Với streaming, lỗi có thể đến sau khi API đã trả mã 200, dưới dạng event lỗi trong luồng SSE. Trường hợp này không đi qua cơ chế HTTP thông thường, cần bắt riêng theo tài liệu streaming. Nên tự viết vòng retry khi cần tách riêng trường hợp chạm trần chi tiêu, hoặc muốn chuyển sang model dự phòng sau vài lần thất bại. Khi đó đặt max_retries=0 để tránh retry chồng retry. Jitter là độ trễ ngẫu nhiên giúp nhiều worker không cùng thử lại một lúc. Khung xử lý bằng Python SDK:

    • Khởi tạo client: client = anthropic.Anthropic(max_retries=0).
    • Bắt lỗi: except anthropic.APIStatusError as e, đọc e.status_code và e.body; bắt thêm anthropic.APIConnectionError để retry lỗi mạng.
    • Trần chi tiêu: nếu e.status_code == 429 và e.body.get('error', {}).get('details', {}).get('error_code') == 'enforced_spend_limit_reached' thì dừng hẳn và báo người phụ trách billing. Dùng .get vì không phải lỗi 429 nào cũng có trường details.
    • Không retry các mã 400, 401, 403, 404, 413: ghi log kèm request-id rồi báo lỗi.
    • Thời gian chờ: nếu có e.response.headers.get('retry-after') thì chờ đúng số giây đó; nếu không, chờ min(60, 2 ** lan_thu) * random.uniform(0.5, 1) giây.
    • Giới hạn 5–6 lần thử; vẫn lỗi thì chuyển model dự phòng hoặc đẩy vào hàng đợi xử lý sau.
    Nội dung 06

    Giảm 429 từ khâu thiết kế: caching, Batch API, chia workspace

    Prompt caching là cách hiệu quả nhất để tăng thông lượng. Với đa số model, token đọc từ cache không tính vào ITPM; chỉ token đầu vào chưa cache và token ghi cache mới tính. Ví dụ trong tài liệu Anthropic: hạn mức 2.000.000 ITPM với tỷ lệ cache hit 80% xử lý được tương đương 10.000.000 token đầu vào mỗi phút. Việc không cần kết quả ngay như phân loại, tóm tắt hàng loạt hay sinh mô tả sản phẩm nên đưa sang Batch API. Batch có hạn mức riêng, giảm 50% giá, mỗi batch tối đa 100.000 request hoặc 256 MB, đa số xong dưới 1 giờ và hết hạn nếu chưa xong trong 24 giờ. Một hiểu lầm phổ biến là giảm max_tokens để tránh 429. Tài liệu ghi max_tokens không ảnh hưởng OTPM, vì OTPM chỉ tính token thực sự sinh ra. Tuy vậy, request có max_tokens lớn nên chạy streaming để tránh bị ngắt kết nối và lỗi 504.

    • Đếm token trước bằng endpoint /v1/messages/count_tokens (miễn phí, có RPM riêng) để ước lượng tải.
    • Tăng lưu lượng từ từ khi ra mắt tính năng mới để tránh acceleration limit.
    • Đặt hạn mức riêng cho từng workspace để một ứng dụng không chiếm hết hạn mức của cả tổ chức. Default Workspace không đặt được hạn mức riêng.
    • Caching không giảm số request, nên không giúp khi bạn chạm RPM.
    Nội dung 07

    Theo dõi hạn mức và chuẩn bị phương án dự phòng

    Mỗi response có các header anthropic-ratelimit-requests-*, anthropic-ratelimit-input-tokens-* và anthropic-ratelimit-output-tokens-* cho biết hạn mức, phần còn lại và thời điểm bù đầy theo định dạng RFC 3339. Ghi log các header này để thấy trước lúc sắp chạm trần. Trang Usage trong Console có biểu đồ request bị chặn do rate limit, biểu đồ token so với hạn mức ITPM, OTPM và tỷ lệ token đọc từ cache. Khi gặp 529 hoặc 5xx hàng loạt, mở status.claude.com để xem thành phần Claude API có sự cố không. Vì hạn mức tính theo nhóm model, chuyển sang model khác nhóm là cách dự phòng nhanh nhất. Opus 5.5 nghẽn thì chuyển tạm sang Sonnet 5. Chuyển từ Fable 5.1 sang Fable 5 thì không giúp, vì hai model dùng chung nhóm. Nếu chọn Haiku 4.5 làm model dự phòng, lưu ý model này có ngày ngừng không sớm hơn 15/10/2026. Tính năng fallbacks phía server (beta) của Anthropic chỉ kích hoạt khi model từ chối do bộ phân loại an toàn; lỗi rate limit, quá tải hay lỗi máy chủ vẫn trả nguyên về cho bạn. Với hệ thống quan trọng, có thể chuẩn bị thêm kênh Amazon Bedrock hoặc Google Cloud Vertex AI. Hai nền tảng này do AWS và Google vận hành, giá, hạn mức và model ID theo quy định riêng, nên cần kiểm thử trước.

    Nội dung 08

    Uptech hỗ trợ gì khi Claude API bị giới hạn?

    Tier được xếp theo lịch sử sử dụng của chính tổ chức. Một tài khoản Anthropic chính chủ, đứng tên doanh nghiệp, là cách để lịch sử đó thuộc về bạn. Key dùng chung qua proxy hay relay không cho bạn quyền xem trang Rate limits, không cho xin nâng hạn mức, và bạn chịu chung giới hạn với người khác. Uptech hỗ trợ doanh nghiệp mở và thanh toán Claude API chính chủ bằng VND, có hợp đồng và hóa đơn GTGT cho dịch vụ hỗ trợ mua sắm, thanh toán và triển khai. Bạn giữ quyền Admin, tự tạo key. Theo phạm vi thỏa thuận, Uptech có thể hỗ trợ cấu hình retry, prompt caching và Batch API. Liên hệ hotline +(84) 968 726 135 hoặc Zalo OA trên website.

    Nguồn chính thức

    Nguồn tham khảo chính thức

    Uptech đối chiếu tên gói, phạm vi sử dụng và ghi chú mua sắm với trang chính thức của nhà cung cấp. Giá, tình trạng hỗ trợ và điều kiện có thể thay đổi theo thời điểm mua.

    Claude API Pricing

    Anthropic tính phí Claude API theo triệu token, tách đầu vào và đầu ra; prompt caching đọc chỉ 0,1x giá đầu vào (thấp hơn ở Opus 5.5 và Fable 5.1), Batch API giảm 50%.

    Kiểm tra tại nguồn
    Claude Team Plan

    Claude Team được mô tả cho nhóm 5-150 người, có Standard/Premium seat, admin/billing, SSO/domain capture, JIT, role-based permissioning, spend controls, connectors và enterprise search.

    Kiểm tra tại nguồn
    Claude Enterprise

    Claude Enterprise kế thừa Team và bổ sung SCIM, audit logs, retention controls, usage analytics, spend controls và phân quyền sâu hơn.

    Kiểm tra tại nguồn
    Rate limits (Claude Platform Docs)

    Tier Start/Build/Scale/Custom, Evaluation tier, bảng RPM/ITPM/OTPM, trần chi tiêu, cache-aware ITPM, header anthropic-ratelimit-*. Kiểm tra 28/09/2026.

    Kiểm tra tại nguồn
    Claude API errors (Claude Platform Docs)

    Mã lỗi HTTP 400–529, request-id, lỗi giữa luồng streaming, SDK tự retry 2 lần với exponential backoff và tôn trọng retry-after.

    Kiểm tra tại nguồn
    How can I get higher rate limits on the Claude API? (Claude Help Center)

    Tier xếp tự động, không có khoản nạp nào giúp lên hạng; xin nâng khi dùng từ 50% hạn mức.

    Kiểm tra tại nguồn
    Workspaces (Claude Platform Docs)

    Workspace Claude Code tự tạo khi đăng nhập bằng Console, hạn mức riêng, spend limit theo người dùng; Default Workspace không đặt được hạn mức.

    Kiểm tra tại nguồn
    Cost and usage reporting in the Claude Console (Claude Help Center)

    Trang Usage có biểu đồ request bị rate limit, token so với hạn mức và tỷ lệ cache; xuất CSV.

    Kiểm tra tại nguồn
    Batch processing (Claude Platform Docs)

    Batch giảm 50% giá, đa số xong dưới 1 giờ, hết hạn sau 24 giờ, kết quả lưu 29 ngày.

    Kiểm tra tại nguồn
    Refusals and fallback (Claude Platform Docs)

    Fallback phía server chỉ áp dụng cho từ chối do bộ phân loại an toàn, không áp dụng cho rate limit, quá tải hay lỗi máy chủ.

    Kiểm tra tại nguồn
    Claude Status

    Trang trạng thái chính thức, có thành phần riêng cho Claude API, Console, claude.ai và Claude Code.

    Kiểm tra tại nguồn
    Cam kết minh bạch

    Minh bạch license và chứng từ

    Nội dung trên trang được định vị cho mua sắm license AI hợp lệ, không phải mua bán tài khoản dùng chung hoặc phần mềm/key không rõ nguồn.

    • Không bán tài khoản dùng chung, password/key trôi nổi hoặc tài khoản không rõ nguồn.
    • Không tự nhận đại lý chính thức của OpenAI, Anthropic hoặc Google nếu chưa có chứng nhận phù hợp.
    • Ưu tiên license gắn với người dùng hoặc workspace rõ ràng, có danh sách bàn giao và lịch gia hạn.
    • Hóa đơn VAT, hạch toán và thuế áp dụng theo phạm vi hợp đồng và chính sách của từng doanh nghiệp.
    02

    Câu hỏi thường gặp

    Lỗi 429 Claude API là gì?

    Là rate_limit_error: tổ chức của bạn vượt RPM, ITPM hoặc OTPM của một nhóm model, hoặc chạm trần chi tiêu tháng của tier. Nếu có header retry-after, chờ đúng số giây đó rồi thử lại. Nếu error_code là enforced_spend_limit_reached thì phải chờ sang tháng hoặc xin nâng trần.

    Lỗi 529 overloaded có phải do tài khoản của tôi?

    Không. 529 overloaded_error nghĩa là API quá tải tạm thời khi lưu lượng chung tăng cao. Hãy retry với exponential backoff và jitter, theo dõi status.claude.com, và cân nhắc chuyển tạm sang model khác nhóm hạn mức.

    Làm sao lên tier Claude API?

    Tier được Anthropic xếp tự động theo lịch sử sử dụng và uy tín tài khoản, không có mức nạp nào giúp lên hạng. Khi đã dùng từ 50% hạn mức hiện tại, bạn có thể bấm Request rate limit increase trong trang Rate limits của Claude Console.

    Nạp thêm credit có tăng rate limit không?

    Không. Số dư credit và rate limit là hai chuyện khác nhau. Nạp thêm chỉ giúp API không dừng vì hết tiền, không làm tăng RPM, ITPM hay OTPM.

    Prompt caching có giúp tránh lỗi 429 không?

    Có với ITPM. Ở đa số model, token đọc từ cache không tính vào ITPM, nên cache system prompt, tài liệu dài và định nghĩa tool giúp xử lý nhiều hơn trong cùng hạn mức. Caching không giảm số request nên không giúp khi chạm RPM.

    Chạm trần chi tiêu tháng thì khi nào dùng lại được?

    API dừng tới 00:00 UTC ngày 1 tháng sau, tức 7 giờ sáng giờ Việt Nam, trừ khi được nâng trần sớm hơn. Trong thời gian này, mọi lần retry kể cả retry tự động của SDK đều thất bại.

    Giảm max_tokens có giúp tránh lỗi 429 không?

    Không với OTPM. Theo tài liệu Anthropic, max_tokens không được tính vào OTPM, chỉ token thực sự sinh ra mới tính. Muốn giảm tải đầu ra, hãy yêu cầu câu trả lời ngắn hơn hoặc chuyển việc không gấp sang Batch API.

    Claude Code báo lỗi 429 thì xử lý thế nào?

    Tùy cách đăng nhập. Nếu dùng biến ANTHROPIC_API_KEY, request tính vào workspace của key đó và chịu hạn mức như mọi ứng dụng khác. Nếu đăng nhập Claude Code bằng tài khoản Console, request đi qua workspace Claude Code do Anthropic tự tạo, có hạn mức riêng; admin có thể giới hạn phần hạn mức của workspace này và đặt spend limit theo từng người. Vượt spend limit đó, request có thể nhận 429 kèm retry-after. Kiểm tra ở Settings > Workspaces trong Console.

    Nhận báo giá

    Gửi số người dùng, thời hạn, thông tin công ty và yêu cầu VAT. Uptech sẽ phản hồi phương án mua phù hợp.

    • Phản hồi trong ngày làm việc khi có đủ số người dùng và gói dự kiến
    • Báo giá VND kèm hợp đồng và hóa đơn VAT theo phạm vi thống nhất
    • Bàn giao theo người dùng/email và nhắc gia hạn
    Yêu cầu báo giá

    Bước 1/3: Gói

    1. 1Gói
    2. 2Công ty
    3. 3Liên hệ
    Gói cần mua3 gói đã chọn · 5-10 người dùng · 12 tháng
    Claude APIAnthropic Claude · API theo token
    Claude TeamAnthropic Claude · Gói đội nhóm
    Claude EnterpriseAnthropic Claude · Gói doanh nghiệp
    Chọn gói
    Gói của Anthropic Claude

    Chọn gói bên dưới để thêm vào yêu cầu.

    Số người dùng
    Thời hạn
    Zalo