Giá Claude API tính theo mỗi triệu token, chia input và output: Haiku 4.5 $1/$5, Sonnet 5 $2/$10, Opus 5.5 $4/$20, Fable 5.1 $10/$50 (USD/MTok). Chi phí = token vào × giá input + token ra × giá output. Caching và Batch API giúp giảm chi phí; VND chỉ là quy đổi tham chiếu theo tỷ giá, chưa VAT.
Cập nhật:
Bảng giá Claude API theo từng model (USD cho mỗi 1 triệu token)
Claude API không bán theo gói tháng mà tính tiền theo số token bạn thực dùng, với hai mức giá riêng: token đầu vào (input, gồm mọi thứ bạn gửi cho model) và token đầu ra (output, phần model viết ra). Theo bảng giá công khai của Anthropic trên platform.claude.com (kiểm tra ngày 28/09/2026), ở mọi model hiện hành, giá output đều gấp 5 lần giá input. Đơn vị niêm yết là USD cho mỗi 1 triệu token (MTok). Model mới ra chưa chắc đã đắt hơn. Opus 5.5 ($4/$20) rẻ hơn Opus 5 ($5/$25), và Sonnet 5 ($2/$10) rẻ hơn Sonnet 4.6 ($3/$15). Mức $2/$10 của Sonnet 5 lúc đầu là giá giới thiệu, nay đã thành giá chuẩn. Các model từ thế hệ 4.6 trở lên được dùng trọn ngữ cảnh 1M token mà vẫn tính giá chuẩn; riêng Haiku 4.5 có ngữ cảnh 200K. Claude Mythos chỉ mở cho một nhóm hạn chế (Project Glasswing) nên không có trong bảng giá mua được. Anthropic niêm yết và thu tiền bằng USD. Mọi con số VND Uptech hiển thị đều là quy đổi tham chiếu theo tỷ giá, chưa gồm VAT. Bảng quy đổi tự cập nhật hằng ngày trên chuyên trang API Claude.
- Claude Fable 5.1 (claude-fable-5-1): input $10, output $50, đọc cache $0,25, Batch $5/$25, ngữ cảnh 1M token. Model mạnh nhất Anthropic phát hành rộng rãi, dành cho suy luận khó.
- Claude Opus 5.5 (claude-opus-5-5): $4/$20, đọc cache $0,20, Batch $2/$10, ngữ cảnh 1M token. Opus mới nhất, hợp với coding và agent.
- Claude Opus 5 (claude-opus-5) và Opus 4.8 (claude-opus-4-8): $5/$25, đọc cache $0,50, Batch $2,50/$12,50, ngữ cảnh 1M token.
- Claude Sonnet 5 (claude-sonnet-5): $2/$10, đọc cache $0,20, Batch $1/$5, ngữ cảnh 1M token. Lựa chọn cân bằng cho phần lớn ứng dụng production.
- Claude Sonnet 4.6 (claude-sonnet-4-6): $3/$15, đọc cache $0,30, Batch $1,50/$7,50, ngữ cảnh 1M token.
- Claude Haiku 4.5 (claude-haiku-4-5): $1/$5, đọc cache $0,10, Batch $0,50/$2,50, ngữ cảnh 200K token. Rẻ nhất, hợp cho phân loại, trích xuất và định tuyến.
Token là gì và vì sao văn bản tiếng Việt tốn token hơn
Token là đơn vị nhỏ nhất mà Claude đọc và viết. Một token có thể là một từ, một phần của từ, một dấu câu hoặc một khoảng trắng. Với tiếng Anh, Anthropic đưa quy tắc ước lượng thô 1 token ≈ 4 ký tự ≈ 0,75 từ. Đây chỉ là ước lượng cho tokenizer đời cũ: model từ 4.7 trở lên sinh nhiều token hơn (tới khoảng 30%) và tiếng Việt có dấu thường tốn token hơn, nên hãy đo bằng count_tokens trên văn bản thật. Hóa đơn API chính là tổng số token input và output nhân với đơn giá của model. Cùng một nội dung, tiếng Việt thường tốn nhiều token hơn tiếng Anh. Chữ có dấu (ă, â, ơ, ư, đ cùng các dấu thanh) chiếm nhiều byte khi mã hóa, và những tổ hợp ký tự ít gặp dễ bị bộ tách token cắt thành nhiều mảnh nhỏ, trong khi chuỗi tiếng Anh phổ biến thường gộp được thành một token. Mức chênh còn tùy loại văn bản: văn bản hành chính, hợp đồng, bảng số liệu hay hội thoại ngắn đều khác nhau. Vì vậy không nên dùng một hệ số cố định cho mọi trường hợp, mà hãy đo trên dữ liệu thật. Còn một yếu tố nữa: các model từ thế hệ 4.7 trở lên dùng tokenizer mới, và cùng một văn bản có thể ra nhiều hơn tới khoảng 30% token so với tokenizer cũ. Khi so giá giữa model đời mới và đời cũ (như Sonnet 4.6, Haiku 4.5), hãy so trên số token đo được cho từng model thay vì chỉ nhìn đơn giá.
- Cách chính xác nhất: gọi endpoint đếm token (messages.count_tokens) với đúng model, system prompt và tài liệu thật trước khi chạy số lượng lớn.
- Sau mỗi request, đọc trường usage (input_tokens, output_tokens, cache_read_input_tokens, cache_creation_input_tokens) để biết chính xác mỗi phần tốn bao nhiêu.
- Không dùng công cụ đếm token của nhà cung cấp khác để ước tính cho Claude vì kết quả sẽ lệch.
- Token suy luận (thinking) được tính như token output, nên tác vụ cần suy nghĩ nhiều bước sẽ tốn output nhiều hơn phần chữ bạn thấy trong câu trả lời.
Công thức tính chi phí Claude API và các hệ số cần biết
Chi phí một request = (số token input ÷ 1.000.000 × giá input) + (số token output ÷ 1.000.000 × giá output). Nhân kết quả với số request trong tháng sẽ ra chi phí tháng bằng USD. Muốn có VND tham chiếu thì nhân tổng USD với tỷ giá USD/VND tại thời điểm tính, sau đó cộng VAT nếu cần lập tờ trình hoặc hạch toán. Prompt caching làm công thức có thêm hai loại token. Phần tiền tố lặp lại (system prompt, tài liệu, định nghĩa tool) sẽ tốn phí ghi vào cache ở lần đầu, còn các lần sau chỉ tính phí đọc cache, rẻ hơn rất nhiều so với input thường. Batch API là đòn bẩy độc lập: bạn chấp nhận nhận kết quả chậm (trong vòng 24 giờ) để được giảm một nửa giá, và mức giảm này cộng dồn được với caching. Ngoài token còn vài khoản phát sinh theo tính năng, cần đưa vào dự toán nếu có dùng. Các hệ số dưới đây lấy từ trang giá chính thức của Anthropic, nhân với giá input của từng model.
- Ghi cache TTL 5 phút: 1,25× giá input. Ghi cache TTL 1 giờ: 2× giá input.
- Đọc cache: 0,1× giá input (riêng Opus 5.5 là 0,05× và Fable 5.1 là 0,025×). Với TTL 5 phút, chỉ cần 2 request dùng chung tiền tố (1 lần ghi + 1 lần đọc) là đã có lời: 1,25× + 0,1× = 1,35×, so với 2× khi không cache. Với TTL 1 giờ cần ít nhất 3 request.
- Tiền tố tối thiểu để được cache khác nhau theo model, từ 512 đến 4.096 token (Sonnet 5 là 1.024, Haiku 4.5 là 4.096). Prompt ngắn hơn mức này sẽ không được cache và hệ thống không báo lỗi.
- Batch API: giảm 50% cả input lẫn output, cộng dồn với caching.
- Chỉ định suy luận tại Mỹ (inference_geo = 'us'): nhân 1,1× giá.
- Fast mode (research preview, chỉ có trên Claude API trực tiếp): Opus 5.5 $8/$40, Opus 5 và Opus 4.8 $10/$50 cho mỗi MTok.
- Web search: $10 cho mỗi 1.000 lượt tìm kiếm, chưa tính token của nội dung kết quả được đưa vào ngữ cảnh.
Ví dụ tính chi phí Claude API thực tế bằng USD
Ví dụ 1, chatbot chăm sóc khách hàng chạy Sonnet 5: 1.000 hội thoại mỗi ngày, tức 30.000 request mỗi tháng. Mỗi request gửi 5.000 token input (4.000 token system prompt và chính sách cố định, cộng 1.000 token câu hỏi và lịch sử) và nhận về 400 token output. Nếu không cache, input là 150 triệu token × $2 = $300, output là 12 triệu token × $10 = $120, tổng $420/tháng. Khi bật prompt caching cho 4.000 token cố định, với giả định 90% request đọc được cache và 10% phải ghi lại cache 5 phút, chi phí gồm đọc cache $21,60, ghi cache $30, input không cache $60 và output $120, tổng khoảng $231,60/tháng, giảm chừng 45%. Lúc này output chiếm hơn một nửa hóa đơn. Ví dụ 2, tóm tắt 2.000 hợp đồng mỗi tháng: mỗi hợp đồng khoảng 20.000 token input, bản tóm tắt dài 1.000 token output, tổng cộng 40 triệu token input và 2 triệu token output. Chạy thường trên Sonnet 5 tốn $80 + $20 = $100. Chạy qua Batch API (giảm 50%) còn $40 + $10 = $50. Cùng khối lượng đó qua Batch trên Haiku 4.5 là $25, trên Opus 5.5 là $100. Đây là dạng việc hợp với Batch vì không cần có kết quả ngay. Ví dụ 3, cùng một request gồm 10.000 token input và 1.000 token output, tính theo giá thường, không cache và không Batch. Bảng so sánh bên dưới cho thấy chọn model ảnh hưởng tới hóa đơn nhiều hơn mọi mẹo tối ưu khác. Số VND tương ứng chỉ là quy đổi tham chiếu theo tỷ giá, chưa VAT.
- Fable 5.1: $0,10 + $0,05 = $0,15 mỗi request, tức $150 cho 1.000 request.
- Opus 5.5: $0,04 + $0,02 = $0,06 mỗi request, tức $60 cho 1.000 request.
- Opus 5 hoặc Opus 4.8: $0,05 + $0,025 = $0,075 mỗi request, tức $75 cho 1.000 request.
- Sonnet 5: $0,02 + $0,01 = $0,03 mỗi request, tức $30 cho 1.000 request.
- Sonnet 4.6: $0,03 + $0,015 = $0,045 mỗi request, tức $45 cho 1.000 request.
- Haiku 4.5: $0,01 + $0,005 = $0,015 mỗi request, tức $15 cho 1.000 request.
- Nếu cùng văn bản ra nhiều hơn 30% token trên model đời mới, request Sonnet 5 tăng lên khoảng $0,039, vẫn rẻ hơn Sonnet 4.6.
Giảm chi phí Claude API và dự toán ngân sách bằng VND
Hai yếu tố tác động mạnh nhất tới hóa đơn thường là lượng output và việc chọn model, hơn là chênh lệch đơn giá giữa các nơi bán. Nên tối ưu theo thứ tự: trước tiên chọn đúng model cho từng loại việc, tiếp theo kiểm soát độ dài output, rồi bật caching cho phần prompt lặp lại, và cuối cùng chuyển việc không gấp sang Batch. Cách làm này giúp giảm chi phí trong khi vẫn dùng API chính chủ gọi thẳng tới Anthropic. Nếu gặp nơi bán credit rẻ hơn nhiều lần giá niêm yết, hãy kiểm tra base URL có đúng là api.anthropic.com hay không, vì mức giá như vậy thường có nghĩa là dữ liệu của bạn đi qua máy chủ trung gian. Khi đã có con số USD/tháng, doanh nghiệp quy đổi sang VND tham chiếu theo tỷ giá và cộng VAT để lập tờ trình. Uptech hỗ trợ nạp credit API chính chủ vào tài khoản Claude Console đứng tên doanh nghiệp, hoặc qua Claude Platform on AWS, Amazon Bedrock, Google Vertex AI nếu doanh nghiệp đang dùng cloud. Kèm theo là báo giá VND, hợp đồng, hóa đơn GTGT và tư vấn chọn model. Uptech không bán key proxy/relay hay tài khoản dùng chung, và không phải đại lý chính thức của Anthropic. Muốn ước tính nhanh cho workload của riêng bạn, hãy dùng máy tính chi phí trên chuyên trang API Claude. Bạn chọn model, số request, token vào/ra, tỷ lệ cache và bật hoặc tắt Batch; trang sẽ tính ra USD mỗi tháng kèm VND quy đổi tham chiếu theo tỷ giá hiện hành, chưa VAT.
- Chọn model theo loại việc: Haiku 4.5 cho phân loại và định tuyến, Sonnet 5 cho ứng dụng production phổ thông, Opus 5.5 cho coding và agent, Fable 5.1 cho bài toán suy luận khó nhất.
- Đặt max_tokens hợp lý và yêu cầu model trả lời ngắn gọn, vì output đắt gấp 5 lần input.
- Đặt phần cố định (system prompt, tài liệu, định nghĩa tool) ở đầu và bật prompt caching. Không chèn thời gian hiện tại hay ID thay đổi vào phần đầu prompt vì sẽ làm mất cache.
- Chuyển các việc không cần kết quả ngay (tóm tắt, phân loại, sinh dữ liệu hàng loạt) sang Batch API để được giảm 50%.
- Với model có tham số effort, dùng mức low hoặc medium cho tác vụ đơn giản để bớt token suy luận.
- Đặt spend limit theo workspace trong Claude Console và xem báo cáo usage hằng tuần để phát hiện chi phí bất thường sớm.
Nguồn tham khảo chính thức
Uptech đối chiếu tên gói, phạm vi sử dụng và ghi chú mua sắm với trang chính thức của nhà cung cấp. Giá, tình trạng hỗ trợ và điều kiện có thể thay đổi theo thời điểm mua.
Anthropic tính phí Claude API theo triệu token, tách đầu vào và đầu ra; prompt caching đọc chỉ 0,1x giá đầu vào (thấp hơn ở Opus 5.5 và Fable 5.1), Batch API giảm 50%.
Kiểm tra tại nguồnClaude Team được mô tả cho nhóm 5-150 người, có Standard/Premium seat, admin/billing, SSO/domain capture, JIT, role-based permissioning, spend controls, connectors và enterprise search.
Kiểm tra tại nguồnClaude Enterprise kế thừa Team và bổ sung SCIM, audit logs, retention controls, usage analytics, spend controls và phân quyền sâu hơn.
Kiểm tra tại nguồnGiá theo triệu token từng model, hệ số prompt caching, Batch API, fast mode và giá trên các nền tảng cloud. Kiểm tra 28/09/2026.
Kiểm tra tại nguồnCách đặt cache_control, thời hạn 5 phút/1 giờ và độ dài tiền tố tối thiểu theo model.
Kiểm tra tại nguồnBatch tối đa 100.000 request hoặc 256 MB, đa số xong trong 1 giờ, hết hạn sau 24 giờ, kết quả giữ 29 ngày, giảm 50% chi phí.
Kiểm tra tại nguồnMinh bạch license và chứng từ
Nội dung trên trang được định vị cho mua sắm license AI hợp lệ, không phải mua bán tài khoản dùng chung hoặc phần mềm/key không rõ nguồn.
- Không bán tài khoản dùng chung, password/key trôi nổi hoặc tài khoản không rõ nguồn.
- Không tự nhận đại lý chính thức của OpenAI, Anthropic hoặc Google nếu chưa có chứng nhận phù hợp.
- Ưu tiên license gắn với người dùng hoặc workspace rõ ràng, có danh sách bàn giao và lịch gia hạn.
- Hóa đơn VAT, hạch toán và thuế áp dụng theo phạm vi hợp đồng và chính sách của từng doanh nghiệp.
Câu hỏi thường gặp
Claude API giá bao nhiêu một triệu token?
Theo bảng giá Anthropic kiểm tra ngày 28/09/2026, tính bằng USD cho mỗi 1 triệu token input/output: Haiku 4.5 $1/$5, Sonnet 5 $2/$10, Sonnet 4.6 $3/$15, Opus 5.5 $4/$20, Opus 5 và Opus 4.8 $5/$25, Fable 5.1 $10/$50. Giá output luôn gấp 5 lần giá input. Batch API giảm 50%. Đọc cache chỉ bằng 0,1× giá input (Opus 5.5 là 0,05×, Fable 5.1 là 0,025×). Giá VND là quy đổi tham chiếu theo tỷ giá, chưa VAT.
1 triệu token tương đương bao nhiêu chữ tiếng Việt?
Với tiếng Anh, 1 triệu token vào khoảng 750.000 từ (trung bình 4 ký tự mỗi token). Tiếng Việt thường tốn nhiều token hơn cho cùng nội dung vì chữ có dấu dễ bị tách nhỏ, nên 1 triệu token chứa ít chữ tiếng Việt hơn. Không có hệ số cố định dùng được cho mọi loại văn bản. Cách đúng là lấy 10–20 tài liệu thật, đo bằng endpoint count_tokens với đúng model định dùng, rồi lấy số trung bình để dự toán.
Vì sao hóa đơn Claude API thực tế cao hơn con số tôi ước tính?
Các nguyên nhân thường gặp: (1) API không lưu hội thoại, mỗi lượt phải gửi lại toàn bộ lịch sử nên input tăng dần theo độ dài cuộc trò chuyện; (2) token suy luận (thinking) được tính như output; (3) định nghĩa tool, tài liệu RAG và kết quả web search đều tính là token input; (4) model đời mới có thể tạo nhiều hơn tới khoảng 30% token cho cùng văn bản; (5) cache bị vô hiệu khi phần đầu prompt thay đổi, ví dụ do chèn giờ hiện tại. Xem trường usage của từng response để biết chính xác phần nào đang tốn tiền.
Prompt caching và Batch API giúp tiết kiệm bao nhiêu?
Đọc từ cache chỉ tốn 0,1× giá input (Opus 5.5 là 0,05×, Fable 5.1 là 0,025×). Đổi lại, mỗi lần ghi cache tốn 1,25× (TTL 5 phút) hoặc 2× (TTL 1 giờ). Với TTL 5 phút, chỉ cần 2 request dùng chung tiền tố (1 lần ghi + 1 lần đọc) là đã có lời; với TTL 1 giờ cần ít nhất 3 request. Batch API giảm 50% cả input và output, trả kết quả trong vòng 24 giờ và cộng dồn được với caching. Ở ví dụ chatbot 30.000 request/tháng trên Sonnet 5, caching giảm khoảng 45% hóa đơn, phần còn lại chủ yếu là output.
Giá VND của Claude API được tính thế nào, đã gồm VAT chưa?
Anthropic niêm yết và thu tiền bằng USD. Số VND hiển thị trên các trang của Uptech là quy đổi tham chiếu, tức tổng USD nhân với tỷ giá USD/VND tại thời điểm tính, và chưa gồm VAT. Khi mua qua Uptech, khoản nạp credit vào tài khoản Claude Console đứng tên doanh nghiệp được báo giá bằng VND, có hợp đồng và hóa đơn GTGT. Giá cuối cùng phụ thuộc số tiền nạp, tỷ giá ngày chốt và thuế.
Dùng Claude qua AWS, Google Cloud hay Microsoft Foundry có cùng giá với Claude API không?
Không hoàn toàn giống nhau. Claude API trực tiếp của Anthropic, Claude Platform on AWS (tính phí qua AWS Marketplace bằng CCU, 1 CCU = $0,01, trả sau) và Claude in Microsoft Foundry đều áp giá API chuẩn như bảng trên. Amazon Bedrock và Google Vertex AI do đối tác vận hành nên có bảng giá riêng của AWS và Google; nếu dùng endpoint regional hoặc multi-region thì giá cao hơn 10% so với endpoint global. Nên đối chiếu trang giá của từng nền tảng trước khi chốt ngân sách.
Gửi số người dùng, thời hạn, thông tin công ty và yêu cầu VAT. Uptech sẽ phản hồi phương án mua phù hợp.
- Phản hồi trong ngày làm việc khi có đủ số người dùng và gói dự kiến
- Báo giá VND kèm hợp đồng và hóa đơn VAT theo phạm vi thống nhất
- Bàn giao theo người dùng/email và nhắc gia hạn