Liên hệ
    Hướng dẫn · Cập nhật

    Để giảm chi phí Claude API, hãy kết hợp năm việc: bật prompt caching (đọc cache chỉ tốn 0,1× giá input), chạy tác vụ không gấp qua Batch API (−50%), chọn model đúng tầng việc, giới hạn max_tokens vì output đắt gấp 5 lần input, và đo usage theo từng tính năng. Chatbot mẫu trong bài giảm được 49% nhờ caching.

    Cập nhật:

    Nội dung 01

    Hóa đơn Claude API được tạo từ đâu? Xem trước khi tối ưu

    Tiền Claude API bằng số token nhân với đơn giá của từng loại token. Một request có thể có tối đa bốn loại: input thường, input ghi vào cache, input đọc từ cache và output. Ở mọi model hiện hành, output đắt gấp 5 lần input, còn đọc cache chỉ tốn một phần nhỏ giá input. Vì vậy có hai biến quyết định hóa đơn: bạn sinh ra bao nhiêu output, và bao nhiêu phần input lặp lại được đọc từ cache. Theo bảng giá công khai của Anthropic (platform.claude.com/docs/en/about-claude/pricing, kiểm tra ngày 28/09/2026), đơn vị là USD cho mỗi 1 triệu token (MTok). Mọi model đều dùng chung một bộ hệ số: ghi cache TTL 5 phút là 1,25× giá input, ghi cache TTL 1 giờ là 2×, đọc cache là 0,1×. Ngoại lệ là Opus 5.5 (đọc cache 0,05×) và Fable 5.1 (0,025×). Batch API giảm 50% cả input lẫn output. Các model từ 4.6 trở lên được dùng trọn 1M context với giá chuẩn, riêng Haiku 4.5 có context 200K. Ngoài token còn vài khoản phụ hay bị bỏ sót: web search, fast mode và lựa chọn suy luận chỉ tại Mỹ (inference_geo). Anthropic thu tiền bằng USD. Nếu doanh nghiệp mua API chính chủ qua Uptech, giá VND là mức quy đổi tham chiếu theo tỷ giá, chưa gồm VAT. Chuyên trang trang API Claude của Uptech có bảng giá đầy đủ từng model và máy tính chi phí, dùng để ước tính trước khi áp dụng các đòn bẩy bên dưới.

    • Claude Sonnet 5 (claude-sonnet-5): input $2, output $10, ghi cache 5 phút $2,50, ghi cache 1 giờ $4, đọc cache $0,20, Batch $1/$5. Mức $2/$10 nay đã là giá chuẩn.
    • Claude Haiku 4.5 (claude-haiku-4-5): input $1, output $5, ghi cache 5 phút $1,25, đọc cache $0,10, Batch $0,50/$2,50, context 200K.
    • Claude Opus 5.5 (claude-opus-5-5): input $4, output $20, ghi cache 5 phút $5, đọc cache $0,20 (hệ số 0,05×), Batch $2/$10.
    • Claude Opus 5 và Opus 4.8: input $5, output $25, đọc cache $0,50, Batch $2,50/$12,50.
    • Claude Fable 5.1 (claude-fable-5-1): input $10, output $50, ghi cache 5 phút $12,50, đọc cache $0,25 (hệ số 0,025×), Batch $5/$25.
    • Claude Sonnet 4.6: input $3, output $15, đọc cache $0,30, Batch $1,50/$7,50.
    • Khoản phụ: web search $10 cho mỗi 1.000 lượt. Fast mode (research preview, chỉ có trên Claude API trực tiếp) giá $8/$40 với Opus 5.5 và $10/$50 với Opus 5, Opus 4.8. inference_geo "us" nhân giá lên 1,1×.
    Nội dung 02

    Prompt caching: đọc lại phần prompt lặp lại với giá 0,1×

    Prompt caching lưu lại phần đầu cố định (prefix) của prompt, gồm định nghĩa tool, system prompt, chính sách và tài liệu tham chiếu, để các request sau đọc lại với giá 0,1× giá input (Opus 5.5 là 0,05×, Fable 5.1 là 0,025×). Lần ghi đầu tốn 1,25× nếu TTL 5 phút, hoặc 2× nếu TTL 1 giờ. Với TTL 5 phút, chỉ cần hai request dùng chung prefix là đã hòa vốn (1,25× + 0,1× = 1,35×, so với 2× khi không cache). Với TTL 1 giờ cần ít nhất ba request. Cache so khớp theo từng byte của prefix, theo thứ tự tools → system → messages. Chỉ một byte khác ở vị trí nào thì cache từ vị trí đó trở đi coi như mất. Vì vậy phần ổn định phải đặt trước, còn câu hỏi, dữ liệu riêng từng request và thời gian phải đặt sau điểm cache cuối cùng. Cách đơn giản nhất là thêm cache_control {"type": "ephemeral"} ở cấp request để hệ thống tự đặt điểm cache. Mỗi request được tối đa 4 điểm cache. Prefix ngắn hơn mức tối thiểu sẽ không được cache, và API cũng không báo lỗi: mức này là 512 token với Opus 5 và Fable 5.1, 1.024 token với Sonnet 5, 4.096 token với Haiku 4.5. Ví dụ trên Sonnet 5: chatbot CSKH nhận 30.000 request/tháng. Mỗi request có 5.000 token prefix cố định (system prompt, chính sách đổi trả, FAQ) và 1.000 token câu hỏi kèm lịch sử, trả về 400 token. Không cache: input 180 MTok × $2 = $360, output 12 MTok × $10 = $120, tổng $480/tháng. Bật caching, giả định 90% request đọc được cache và 10% rơi vào lúc cache đã hết hạn nên phải ghi lại: đọc cache 135 MTok × $0,20 = $27, ghi cache 15 MTok × $2,50 = $37,50, phần thay đổi 30 MTok × $2 = $60, output giữ nguyên $120. Tổng còn $244,50/tháng, giảm khoảng 49% mà không phải đổi model hay hạ chất lượng câu trả lời.

    • Không đưa timestamp, ID phiên hay số ngẫu nhiên vào system prompt. Đây là lý do phổ biến nhất khiến cache không bao giờ trúng.
    • Sắp xếp khóa JSON và giữ danh sách tool cố định giữa các request. Chỉ cần đổi thứ tự là prefix đã khác.
    • Cache gắn với từng model: chuyển request sang model khác thì phải ghi cache lại từ đầu.
    • Chọn TTL theo khoảng cách giữa hai request dùng chung prefix. Dưới 5 phút thì giữ TTL mặc định, vì mỗi lần đọc cache lại làm mới thời hạn mà không mất thêm phí. Chỉ dùng TTL 1 giờ khi lưu lượng ngắt quãng từ 5 đến 60 phút.
    • Kiểm tra trường usage.cache_read_input_tokens. Nếu số này vẫn bằng 0 sau nhiều request có cùng prefix, cache đang bị vô hiệu ở đâu đó.
    Nội dung 03

    Batch API: giảm 50% cho mọi tác vụ không cần trả lời ngay

    Batch API (Message Batches) xử lý request theo kiểu bất đồng bộ với giá bằng 50% cả input lẫn output. Ví dụ, Sonnet 5 còn $1/$5 và Opus 5.5 còn $2/$10 mỗi MTok. Đổi lại, kết quả không trả về ngay: phần lớn batch xong trong vòng 1 giờ, lâu nhất 24 giờ. Tác vụ nào không có người đang ngồi chờ kết quả đều nên cân nhắc chuyển sang batch. Mỗi batch chứa tối đa 100.000 request hoặc 256 MB. Mỗi request mang một custom_id riêng. Kết quả trả về không theo thứ tự gửi, nên phải ghép theo custom_id chứ không theo vị trí, và kết quả được giữ 29 ngày. Request lỗi hoặc hết hạn cần gửi lại ở batch sau. Giảm giá của batch cộng dồn với prompt caching, nhưng batch xử lý bất đồng bộ nên tỷ lệ trúng cache không được đảm bảo. Fast mode không dùng chung được với Batch API. Ví dụ trên Sonnet 5: tóm tắt 2.000 hợp đồng mỗi tháng, mỗi hợp đồng 20.000 token input và 1.000 token output. Gọi API thường tốn 40 MTok × $2 + 2 MTok × $10 = $100. Gom lại chạy batch mỗi đêm chỉ còn 40 MTok × $1 + 2 MTok × $5 = $50, vẫn cùng model và cùng prompt.

    • Hợp với batch: tóm tắt, phân loại hồ sơ cuối ngày; gắn nhãn và trích xuất dữ liệu hàng loạt; dịch, chuẩn hóa catalog sản phẩm; sinh mô tả sản phẩm; chạy bộ kiểm thử prompt trước mỗi lần đổi model.
    • Không hợp với batch: chatbot trả lời khách theo thời gian thực, agent cần gọi tool nhiều bước có tương tác, hoặc luồng có SLA tính bằng giây.
    • Mẹo vận hành: tách một hàng đợi "không gấp" trong hệ thống, gom request theo chu kỳ (ví dụ mỗi giờ hoặc mỗi đêm), rồi ghi kết quả về theo custom_id.
    Nội dung 04

    Chọn model đúng tầng việc và khóa chặt token đầu ra

    Giữa model rẻ nhất và đắt nhất, đơn giá chênh nhau tới 10 lần: Haiku 4.5 là $1/$5, Fable 5.1 là $10/$50 mỗi MTok. Lấy ví dụ bài toán phân loại ticket 100.000 request/tháng, mỗi request 800 token input và 20 token output. Chi phí khoảng $90 với Haiku 4.5, $180 với Sonnet 5, $360 với Opus 5.5 và $900 với Fable 5.1 (chưa tính chênh lệch tokenizer). Nguyên tắc là chọn model rẻ nhất vẫn đạt chuẩn chất lượng, rồi so chi phí trên mỗi tác vụ hoàn thành. Model rẻ mà phải gọi lại nhiều lần thì chưa chắc đã rẻ. Nâng cấp model đôi khi cũng là một cách giảm giá. Chuyển từ Sonnet 4.6 ($3/$15) sang Sonnet 5 ($2/$10) giảm 33% đơn giá. Chuyển từ Opus 5 hoặc Opus 4.8 ($5/$25) sang Opus 5.5 ($4/$20) giảm 20% đơn giá, còn giá đọc cache giảm từ $0,50 xuống $0,20. Có hai điều cần lưu ý. Thứ nhất, các model từ thế hệ 4.7 trở lên dùng tokenizer mới, có thể sinh nhiều hơn khoảng 30% token cho cùng một văn bản, nên hãy đếm lại bằng count_tokens trên dữ liệu thật. Thứ hai, định tuyến request sang nhiều model sẽ làm mất khả năng dùng chung cache. Output đắt gấp 5 lần input, nên mỗi token trả về thừa đều tốn tiền. max_tokens chỉ là trần cứng, không phải mục tiêu: đặt quá thấp thì câu trả lời bị cắt giữa chừng và phải gọi lại. Hãy đặt trần riêng cho từng loại tác vụ, yêu cầu định dạng gọn (gạch đầu dòng, JSON ít trường), và hạ tham số effort cho việc đơn giản trên các model có hỗ trợ (Sonnet 5, Opus 5, Opus 5.5, Fable 5.1), vì token suy luận cũng tính như output. Quay lại chatbot ở mục caching: nếu rút output trung bình từ 400 xuống 300 token, hóa đơn giảm thêm $30, từ $244,50 còn $214,50. Tổng cộng giảm khoảng 55% so với mức ban đầu $480.

    • Haiku 4.5: phân loại, định tuyến, trích xuất trường dữ liệu, kiểm tra định dạng. Lưu ý prefix phải từ 4.096 token trở lên mới cache được.
    • Sonnet 5: lựa chọn mặc định cho production như chatbot, RAG, tóm tắt, soạn nội dung.
    • Opus 5.5 hoặc Opus 5: coding, agent nhiều bước, phân tích phức tạp.
    • Fable 5.1: chỉ dành cho bài toán suy luận khó nhất, nơi chất lượng đáng giá gấp nhiều lần chi phí.
    • Không nhồi cả kho tài liệu vào context chỉ vì model hỗ trợ 1M token. Một lượt gửi 500.000 token trên Sonnet 5 tốn $1 tiền input nếu không cache, nên hãy truy xuất (RAG) đúng đoạn cần dùng.
    • Chỉ bật fast mode khi tốc độ thật sự tạo ra giá trị, vì đơn giá gấp đôi. Giới hạn số lượt web search mỗi request. Chỉ dùng inference_geo "us" khi có yêu cầu tuân thủ.
    Nội dung 05

    Đo usage và giữ kỷ luật chi phí hằng tháng

    Không đo thì không tối ưu được. Mỗi response của Claude API trả về trường usage gồm input_tokens (phần không cache), output_tokens, cache_creation_input_tokens và cache_read_input_tokens. Chỉ cần ghi bốn số này vào log kèm tên tính năng, model và workspace là đủ để tính chi phí từng request, tỷ lệ trúng cache và chi phí trên mỗi tác vụ hoàn thành, chẳng hạn chi phí cho một ticket được giải quyết. Trước khi đưa một luồng mới lên production, dùng endpoint count_tokens để đếm token của prompt thật. Endpoint này miễn phí nhưng có giới hạn tần suất gọi. Lấy số đếm được nhân với bảng giá sẽ ra ngân sách dự kiến. Khi đã chạy thật, đối chiếu log nội bộ với trang Usage và Cost trong Claude Console. Nên tách workspace theo sản phẩm hoặc môi trường (dev, staging, production), mỗi workspace có API key và mức trần chi tiêu riêng, để một vòng lặp lỗi ở môi trường thử không làm cạn ngân sách production. Hạn mức request được cấp theo tier (Start, Build, Scale) và tăng dần theo lịch sử sử dụng. Uptech hỗ trợ doanh nghiệp mua và nạp Claude API chính chủ: tài khoản Console đứng tên doanh nghiệp, báo giá VND quy đổi tham chiếu theo tỷ giá (chưa VAT), có hợp đồng và hóa đơn GTGT. Uptech cũng rà soát chi phí và tư vấn chọn model, cấu hình caching, batch, giới hạn chi tiêu. Nếu cần tích hợp, đội ngũ triển khai chatbot, RAG nội bộ và agent qua các dịch vụ, và. Uptech không phải đại lý chính thức của Anthropic, không bán key proxy và không bán tài khoản dùng chung.

    • Tỷ lệ trúng cache = cache_read_input_tokens ÷ (input_tokens + cache_creation_input_tokens + cache_read_input_tokens). Với chatbot có prompt dài, nên theo dõi mức này hằng tuần.
    • Tỷ lệ output/input theo từng tính năng: nếu tăng dần, prompt đang để model trả lời dài hơn mức cần.
    • Tỷ trọng lưu lượng có thể chuyển sang batch: mọi request không có người chờ đều là ứng viên giảm 50%.
    • Chi phí trên mỗi tác vụ hoàn thành, không phải trên mỗi request, đặc biệt với agent và luồng có gọi lại.
    • Mỗi tháng rà lại bảng giá chính thức. Khi Anthropic ra model mới hoặc đổi giá, chạy lại bộ kiểm thử để xem có nên chuyển model không.
    Nguồn chính thức

    Nguồn tham khảo chính thức

    Uptech đối chiếu tên gói, phạm vi sử dụng và ghi chú mua sắm với trang chính thức của nhà cung cấp. Giá, tình trạng hỗ trợ và điều kiện có thể thay đổi theo thời điểm mua.

    Claude API Pricing

    Anthropic tính phí Claude API theo triệu token, tách đầu vào và đầu ra; prompt caching đọc chỉ 0,1x giá đầu vào (thấp hơn ở Opus 5.5 và Fable 5.1), Batch API giảm 50%.

    Kiểm tra tại nguồn
    Claude Team Plan

    Claude Team được mô tả cho nhóm 5-150 người, có Standard/Premium seat, admin/billing, SSO/domain capture, JIT, role-based permissioning, spend controls, connectors và enterprise search.

    Kiểm tra tại nguồn
    Claude Enterprise

    Claude Enterprise kế thừa Team và bổ sung SCIM, audit logs, retention controls, usage analytics, spend controls và phân quyền sâu hơn.

    Kiểm tra tại nguồn
    Prompt caching (Anthropic)

    Cách đặt cache_control, thời hạn 5 phút/1 giờ và độ dài tiền tố tối thiểu theo model.

    Kiểm tra tại nguồn
    Message Batches API (Anthropic)

    Batch tối đa 100.000 request hoặc 256 MB, đa số xong trong 1 giờ, hết hạn sau 24 giờ, kết quả giữ 29 ngày, giảm 50% chi phí.

    Kiểm tra tại nguồn
    Bảng giá Claude API (Anthropic)

    Giá theo triệu token từng model, hệ số prompt caching, Batch API, fast mode và giá trên các nền tảng cloud. Kiểm tra 28/09/2026.

    Kiểm tra tại nguồn
    Cam kết minh bạch

    Minh bạch license và chứng từ

    Nội dung trên trang được định vị cho mua sắm license AI hợp lệ, không phải mua bán tài khoản dùng chung hoặc phần mềm/key không rõ nguồn.

    • Không bán tài khoản dùng chung, password/key trôi nổi hoặc tài khoản không rõ nguồn.
    • Không tự nhận đại lý chính thức của OpenAI, Anthropic hoặc Google nếu chưa có chứng nhận phù hợp.
    • Ưu tiên license gắn với người dùng hoặc workspace rõ ràng, có danh sách bàn giao và lịch gia hạn.
    • Hóa đơn VAT, hạch toán và thuế áp dụng theo phạm vi hợp đồng và chính sách của từng doanh nghiệp.
    02

    Câu hỏi thường gặp

    Prompt caching giúp tiết kiệm bao nhiêu tiền Claude API?

    Phần input đọc từ cache chỉ tính 0,1× giá input thường. Với Sonnet 5 là $0,20 thay vì $2 mỗi MTok; riêng Opus 5.5 là 0,05× và Fable 5.1 là 0,025×. Lần ghi cache tốn 1,25× (TTL 5 phút) hoặc 2× (TTL 1 giờ). Mức tiết kiệm thực tế phụ thuộc vào tỷ trọng input lặp lại. Chatbot mẫu trong bài có 5.000 trên 6.000 token là prefix cố định và giảm được khoảng 49% tổng hóa đơn.

    Batch API có cộng dồn với prompt caching không?

    Có. Batch giảm 50% cả input và output, và mức giảm này cộng dồn với hệ số cache. Vì vậy trên các model có hệ số đọc cache 0,1×, phần đọc cache trong batch chỉ còn khoảng 0,05× giá input chuẩn. Lưu ý batch xử lý bất đồng bộ (phần lớn xong trong 1 giờ, lâu nhất 24 giờ) nên tỷ lệ trúng cache không được đảm bảo. Fast mode không dùng chung được với Batch API.

    Vì sao đã thêm cache_control mà cache_read_input_tokens vẫn bằng 0?

    Thường do một trong bốn nguyên nhân. Một là prefix ngắn hơn mức tối thiểu của model (512 token với Opus 5 và Fable 5.1, 1.024 token với Sonnet 5, 4.096 token với Haiku 4.5), khi đó API bỏ qua cache mà không báo lỗi. Hai là prefix chứa nội dung thay đổi như timestamp hoặc JSON không sắp xếp khóa. Ba là khoảng cách giữa hai request dài hơn TTL. Bốn là request sau dùng model khác, vì cache gắn với từng model.

    Có nên đặt max_tokens thật thấp để tiết kiệm không?

    Không nên hạ tùy tiện. max_tokens chỉ là trần cứng: đặt quá thấp thì câu trả lời bị cắt giữa chừng, phải gọi lại và tốn tiền hơn. Cách tốt hơn là đặt trần riêng cho từng loại tác vụ, chừa biên an toàn, yêu cầu định dạng ngắn trong prompt hoặc qua JSON schema, và hạ effort cho việc đơn giản trên model có hỗ trợ. Token suy luận (thinking) cũng tính tiền như output.

    Model Claude mới có tốn nhiều token hơn cho cùng một văn bản không?

    Có thể. Các model từ thế hệ 4.7 trở lên dùng tokenizer mới, có thể sinh nhiều hơn tới khoảng 30% token cho cùng một văn bản. Vì vậy đừng chỉ so đơn giá mỗi MTok. Hãy dùng endpoint count_tokens để đếm trên chính dữ liệu tiếng Việt của bạn, rồi so chi phí trên mỗi tác vụ hoàn thành giữa các model trước khi quyết định chuyển đổi.

    Uptech hỗ trợ gì khi doanh nghiệp muốn tối ưu chi phí Claude API?

    Uptech hỗ trợ doanh nghiệp mua và nạp Claude API chính chủ: tài khoản Console đứng tên doanh nghiệp, hoặc qua Claude Platform on AWS, Amazon Bedrock, Google Vertex AI nếu doanh nghiệp đã dùng cloud. Uptech báo giá VND quy đổi tham chiếu theo tỷ giá (chưa VAT), có hợp đồng và hóa đơn GTGT, đồng thời tư vấn chọn model, cấu hình caching, batch và giới hạn chi tiêu. Bảng giá và máy tính chi phí có trên trang API Claude của Uptech.

    Nhận báo giá

    Gửi số người dùng, thời hạn, thông tin công ty và yêu cầu VAT. Uptech sẽ phản hồi phương án mua phù hợp.

    • Phản hồi trong ngày làm việc khi có đủ số người dùng và gói dự kiến
    • Báo giá VND kèm hợp đồng và hóa đơn VAT theo phạm vi thống nhất
    • Bàn giao theo người dùng/email và nhắc gia hạn
    Yêu cầu báo giá

    Bước 1/3: Gói

    1. 1Gói
    2. 2Công ty
    3. 3Liên hệ
    Gói cần mua3 gói đã chọn · 5-10 người dùng · 12 tháng
    Claude APIAnthropic Claude · API theo token
    Claude TeamAnthropic Claude · Gói đội nhóm
    Claude EnterpriseAnthropic Claude · Gói doanh nghiệp
    Chọn gói
    Gói của Anthropic Claude

    Chọn gói bên dưới để thêm vào yêu cầu.

    Số người dùng
    Thời hạn
    Zalo