Chọn model Claude API theo tác vụ: Haiku 4.5 ($1/$5 mỗi 1M token vào/ra) cho phân loại, định tuyến, trích xuất khối lớn; Sonnet 5 ($2/$10) làm mặc định cho chatbot, RAG, production; Opus 5.5 ($4/$20) cho coding và agent nhiều bước; Fable 5.1 ($10/$50) chỉ cho bài toán suy luận khó nhất. Giá theo Anthropic, kiểm tra 28/09/2026.
Cập nhật:
Bảng gợi ý chọn model Claude API theo tác vụ
Câu trả lời ngắn: dùng Sonnet 5 cho hầu hết ứng dụng production. Tác vụ đơn giản, khối lượng lớn thì hạ xuống Haiku 4.5. Coding và agent nhiều bước thì nâng lên Opus 5.5. Fable 5.1 chỉ dành cho phần việc khó nhất. Giá dưới đây lấy từ trang pricing của Anthropic (kiểm tra ngày 28/09/2026), tính bằng USD cho mỗi 1 triệu token (MTok), ghi theo thứ tự giá đầu vào/giá đầu ra. Cả bốn model hiện hành theo cùng một quy luật: token đầu ra đắt gấp 5 lần token đầu vào. Tính trên mỗi token, Fable 5.1 đắt gấp 2,5 lần Opus 5.5, gấp 5 lần Sonnet 5 và gấp 10 lần Haiku 4.5. Vì vậy, chọn sai tầng model thường là khoản lãng phí lớn nhất trên hóa đơn API, lớn hơn nhiều so với việc cắt bớt vài dòng prompt. Các model đời trước vẫn gọi được, nhưng với dự án mới thì không còn lợi về giá. Opus 5 và Opus 4.8 đều ở mức $5/$25, đắt hơn Opus 5.5 ($4/$20). Sonnet 4.6 ở mức $3/$15, đắt hơn Sonnet 5 ($2/$10). Mức $2/$10 của Sonnet 5 ban đầu là giá giới thiệu và nay đã thành giá chuẩn. Chỉ nên giữ model cũ khi hệ thống đang chạy ổn định và bạn chưa kịp kiểm thử lại trên model mới. Claude Mythos chỉ mở giới hạn qua Project Glasswing nên bài này không xét đến.
- Phân loại, gắn nhãn, định tuyến câu hỏi, trích xuất trường dữ liệu, kiểm duyệt nội dung: Haiku 4.5 (claude-haiku-4-5), $1/$5, context 200K token.
- Chatbot CSKH, RAG trên tài liệu nội bộ, tóm tắt, soạn nội dung và các tác vụ production phổ thông: Sonnet 5 (claude-sonnet-5), $2/$10, context 1M token.
- Viết và sửa code, agent nhiều bước có dùng công cụ, phân tích tài liệu dài nhiều điều kiện: Opus 5.5 (claude-opus-5-5), $4/$20, context 1M token.
- Bài toán suy luận khó nhất, tác vụ agent dài hơi mà sai một bước là tốn kém: Fable 5.1 (claude-fable-5-1), $10/$50, context 1M token.
- Xử lý hàng loạt không cần kết quả ngay (tóm tắt hàng nghìn hồ sơ, gắn nhãn dữ liệu cũ): chọn model phù hợp và chạy qua Batch API để giảm 50% cả đầu vào lẫn đầu ra.
So sánh theo chất lượng, chi phí thực tế và tốc độ
Tóm lại: Haiku 4.5 nhanh và rẻ nhất. Sonnet 5 cân bằng giữa chất lượng và chi phí. Opus 5.5 và Fable 5.1 cho chất lượng cao nhất nhưng chậm hơn và đắt hơn. Khi tính cả prompt caching, khoảng cách giữa Opus 5.5 và Sonnet 5 hẹp hơn nhiều so với bảng giá niêm yết. Lý do là mỗi model có hệ số đọc cache khác nhau: Haiku 4.5, Sonnet 5 và Opus 5 là 0,1 lần giá input, Opus 5.5 là 0,05 lần, Fable 5.1 là 0,025 lần. Quy ra tiền, một triệu token đọc từ cache có giá $0,10 trên Haiku 4.5, $0,20 trên cả Sonnet 5 lẫn Opus 5.5, $0,25 trên Fable 5.1 và $0,50 trên Opus 5. Với ứng dụng có system prompt hoặc bộ tài liệu cố định dài, phần input đã cache của Opus 5.5 rẻ ngang Sonnet 5. Chênh lệch còn lại chủ yếu nằm ở phần input chưa cache và ở output. Về tốc độ, Haiku 4.5 hợp với các luồng cần phản hồi tức thì như định tuyến câu hỏi, gợi ý trong ô nhập hay kiểm duyệt nội dung. Sonnet 5 cân bằng giữa độ trễ và chất lượng. Opus 5.5 và Fable 5.1 luôn bật suy luận (không tắt được thinking) nên thời gian chờ dài hơn. Với tác vụ khó, một request Fable 5.1 có thể chạy nhiều phút, nên cần dùng streaming và có giao diện báo tiến độ cho người dùng. Nếu cần tầng Opus trả lời nhanh hơn thì có fast mode, hiện là bản research preview và chỉ có trên Claude API trực tiếp. Giá fast mode là $8/$40 với Opus 5.5 và $10/$50 với Opus 5 và Opus 4.8. Fast mode không dùng chung được với Batch API. Về context, Sonnet 5, Opus 5.5, Opus 5 và Fable 5.1 đều nhận tới 1 triệu token ở giá chuẩn, còn Haiku 4.5 chỉ tới 200K. Nếu cần đưa cả bộ hồ sơ thầu hoặc một codebase lớn vào một request thì Haiku 4.5 không dùng được. Ngoài ra, có ba điểm dễ bị bỏ sót khi so sánh:
- Token suy luận (thinking) tính tiền như token đầu ra. Các model luôn suy luận như Opus 5.5 và Fable 5.1 có thể sinh nhiều token hơn phần chữ bạn nhìn thấy trong câu trả lời.
- Tham số effort (low, medium, high, xhigh, max) điều chỉnh độ sâu suy luận và lượng token tiêu tốn. Sonnet 5, Opus 5, Opus 5.5 và Fable 5.1 đều hỗ trợ đủ 5 mức. Opus 5.5 mặc định ở mức medium. Haiku 4.5 không có tham số effort.
- Các model từ thế hệ 4.7 trở lên dùng tokenizer mới, với cùng một đoạn văn bản có thể ra nhiều hơn khoảng 30% token so với tokenizer cũ của Haiku 4.5 và Sonnet 4.6. Khi so giá, nên dựa trên số token đo thật bằng endpoint count_tokens.
Ví dụ: chi phí 1.000 request cho cùng một tác vụ trên từng model
Giả định một chatbot tra cứu chính sách nội bộ. Mỗi request có 10.000 token đầu vào, trong đó 8.000 token là system prompt và tài liệu cố định được đọc từ cache, 2.000 token là câu hỏi và lịch sử hội thoại mới. Mỗi câu trả lời có 500 token đầu ra, đã gồm token suy luận. Ví dụ chưa tính chi phí ghi cache lần đầu (1,25 lần giá input với cache 5 phút, 2 lần với cache 1 giờ), vì khoản này được chia nhỏ qua nhiều lần đọc. Chi phí cho 1.000 request như sau: Từ ví dụ này rút ra ba điều. Thứ nhất, Sonnet 5 rẻ hơn Sonnet 4.6 khoảng một phần ba cho cùng khối lượng, và Opus 5.5 rẻ hơn Opus 5 khoảng 26%, nên dự án mới nên dùng model mới nhất ở mỗi tầng. Thứ hai, Haiku 4.5 tốn khoảng một nửa chi phí của Sonnet 5. Nếu chất lượng đạt yêu cầu thì đây là khoản tiết kiệm lớn cho các luồng khối lượng cao. Thứ ba, nếu tác vụ không cần trả lời ngay, Batch API giảm 50% cả input và output và cộng dồn với cache. Khi đó Opus 5.5 chỉ còn khoảng $9,80 cho 1.000 request, thấp hơn Sonnet 5 gọi thời gian thực ($10,60). Sonnet 5 chạy Batch còn khoảng $5,30, ngang Haiku 4.5 gọi thường. Các con số trên chỉ để minh họa với giả định cố định. Chi phí thật phụ thuộc độ dài câu trả lời, mức effort, tỷ lệ cache hit và tokenizer của từng model. Để tính theo khối lượng thực tế của bạn và quy đổi sang VND, hãy dùng máy tính chi phí trên chuyên trang API Claude trên trang API Claude của Uptech. Số tiền VND ở đó là quy đổi tham chiếu theo tỷ giá, chưa gồm VAT.
- Haiku 4.5: khoảng $5,30
- Sonnet 5: khoảng $10,60
- Sonnet 4.6 (đời trước): khoảng $15,90
- Opus 5.5: khoảng $19,60
- Opus 5 (đời trước): khoảng $26,50
- Fable 5.1: khoảng $47,00
Chọn model trong 5 bước, và khi nào nên kết hợp nhiều model
Cách chọn đáng tin nhất là chạy thử trên dữ liệu của chính bạn, thay vì dựa vào benchmark. Một quy trình gọn cho doanh nghiệp gồm 5 bước: Kiến trúc nhiều tầng thường gặp như sau. Haiku 4.5 phân loại ý định và lọc các câu hỏi đơn giản. Sonnet 5 trả lời phần lớn yêu cầu. Chỉ ca khó hoặc có rủi ro cao mới chuyển lên Opus 5.5. Fable 5.1 dành cho khâu phân tích đặc biệt, có người duyệt lại kết quả. Mọi model đều gọi bằng cùng một API key, bạn chỉ cần đổi tham số model trong request. Tuy vậy, định tuyến qua nhiều model cũng có chi phí riêng. Prompt cache tính riêng cho từng model, nên mỗi lần chuyển model là mất phần cache đã tích lũy. Bạn cũng phải duy trì nhiều bộ prompt và nhiều bộ kiểm thử. Trước khi xây hệ định tuyến, hãy đo thử phương án đơn giản hơn là một model mạnh chạy effort thấp cho toàn bộ luồng. Khá nhiều trường hợp phương án này rẻ hơn khi tính trên mỗi tác vụ hoàn thành.
Bước 1: Lấy Sonnet 5 làm mốc so sánh (baseline) và hoàn thiện prompt trên model này.
Bước 2: Gom 30–50 mẫu thật (câu hỏi khách hàng, hợp đồng, ticket, đoạn code) kèm tiêu chí chấm đạt hoặc không đạt thật rõ ràng.
Bước 3: Thử hạ xuống Haiku 4.5. Nếu tỷ lệ đạt gần bằng Sonnet 5 thì chuyển luồng đó sang Haiku để giảm khoảng một nửa chi phí.
Bước 4: Thử nâng lên Opus 5.5 ở effort low hoặc medium trước, sau đó mới thử effort cao hơn hoặc Fable 5.1. Chỉ trả thêm tiền khi bộ kiểm thử cho thấy chất lượng tăng rõ.
Bước 5: So theo chi phí trên mỗi tác vụ hoàn thành, không theo chi phí mỗi request. Một model rẻ mà phải gọi lại hai, ba lần hoặc cần người sửa thì thực tế không còn rẻ.
Lưu ý kỹ thuật khi đổi model và cách mua API chính chủ
Hãy dùng model ID đúng, không kèm hậu tố ngày: claude-haiku-4-5, claude-sonnet-5, claude-opus-5-5, claude-opus-5, claude-fable-5-1. Khi chuyển code từ model đời cũ sang model mới, cần kiểm tra các thay đổi có thể gây lỗi sau: Uptech hỗ trợ doanh nghiệp Việt Nam mua API Claude chính chủ. Tài khoản Claude Console đứng tên doanh nghiệp, hoặc đi qua Claude Platform on AWS, Amazon Bedrock hay Google Vertex AI nếu doanh nghiệp đã dùng các nền tảng cloud này. Uptech báo giá bằng VND (quy đổi tham chiếu theo tỷ giá, chưa VAT), có hợp đồng và hóa đơn GTGT. Uptech không bán key proxy/relay, không bán tài khoản dùng chung và không tự nhận là đại lý chính thức của Anthropic. Một tài khoản chính chủ gọi được mọi model phổ thông trong bảng trên, nên bạn có thể thử, đổi và kết hợp model mà không phải mua lại. Nếu cần người cùng chạy bộ kiểm thử để chọn model, tối ưu chi phí hoặc triển khai chatbot, RAG nội bộ hay agent, bạn có thể xem dịch vụ AI agents và RAG chatbot dữ liệu nội bộ của Uptech. Để nhận báo giá nạp credit, hãy gửi khối lượng dự kiến trên trang trang API Claude của Uptech.
- budget_tokens (cách cấu hình suy luận kiểu cũ) bị từ chối với lỗi 400 trên Sonnet 5, Opus 5, Opus 5.5 và Fable 5.1. Thay bằng thinking adaptive kết hợp tham số effort.
- Assistant prefill (điền sẵn phần đầu câu trả lời) không còn được hỗ trợ trên các model mới. Thay bằng structured outputs hoặc chỉ dẫn trong system prompt.
- Opus 5.5 và Fable 5.1 không cho tắt thinking và trả lỗi 400 khi dùng tool_choice ép buộc (any hoặc tool). Thay bằng tool_choice auto kèm strict: true trên định nghĩa công cụ.
- Fable 5.1 yêu cầu chính sách lưu dữ liệu 30 ngày. Tổ chức đang dùng zero data retention (ZDR) không gọi được model này, trừ khi Anthropic chấp thuận riêng.
- Giá trên Amazon Bedrock và Google Vertex AI do đối tác đặt, endpoint regional hoặc multi-region đắt hơn 10% so với global. Fast mode chỉ có trên Claude API trực tiếp. Tùy chọn inference_geo 'us' tính gấp 1,1 lần giá chuẩn.
Nguồn tham khảo chính thức
Uptech đối chiếu tên gói, phạm vi sử dụng và ghi chú mua sắm với trang chính thức của nhà cung cấp. Giá, tình trạng hỗ trợ và điều kiện có thể thay đổi theo thời điểm mua.
Anthropic tính phí Claude API theo triệu token, tách đầu vào và đầu ra; prompt caching đọc chỉ 0,1x giá đầu vào (thấp hơn ở Opus 5.5 và Fable 5.1), Batch API giảm 50%.
Kiểm tra tại nguồnClaude Team được mô tả cho nhóm 5-150 người, có Standard/Premium seat, admin/billing, SSO/domain capture, JIT, role-based permissioning, spend controls, connectors và enterprise search.
Kiểm tra tại nguồnClaude Enterprise kế thừa Team và bổ sung SCIM, audit logs, retention controls, usage analytics, spend controls và phân quyền sâu hơn.
Kiểm tra tại nguồnDanh sách model hiện hành, model ID và context window.
Kiểm tra tại nguồnGiá theo triệu token từng model, hệ số prompt caching, Batch API, fast mode và giá trên các nền tảng cloud. Kiểm tra 28/09/2026.
Kiểm tra tại nguồnMinh bạch license và chứng từ
Nội dung trên trang được định vị cho mua sắm license AI hợp lệ, không phải mua bán tài khoản dùng chung hoặc phần mềm/key không rõ nguồn.
- Không bán tài khoản dùng chung, password/key trôi nổi hoặc tài khoản không rõ nguồn.
- Không tự nhận đại lý chính thức của OpenAI, Anthropic hoặc Google nếu chưa có chứng nhận phù hợp.
- Ưu tiên license gắn với người dùng hoặc workspace rõ ràng, có danh sách bàn giao và lịch gia hạn.
- Hóa đơn VAT, hạch toán và thuế áp dụng theo phạm vi hợp đồng và chính sách của từng doanh nghiệp.
Câu hỏi thường gặp
Model Claude API nào rẻ nhất hiện nay?
Haiku 4.5 là model rẻ nhất trong nhóm hiện hành: $1 cho mỗi 1 triệu token đầu vào và $5 cho đầu ra. Đọc cache có giá $0,10, còn chạy qua Batch API chỉ còn $0,50/$2,50. Tuy vậy, rẻ nhất trên mỗi token chưa chắc đã rẻ nhất trên mỗi tác vụ. Nếu Haiku 4.5 trả lời sai và phải gọi lại hoặc chuyển lên model khác, tổng chi phí của Sonnet 5 ($2/$10) có thể thấp hơn.
Dự án mới nên chọn Opus 5.5 hay Opus 5?
Opus 5.5 ($4/$20 mỗi 1M token, đọc cache $0,20) rẻ hơn Opus 5 ($5/$25, đọc cache $0,50) và có cùng context 1M token. Vì vậy Opus 5.5 nên là lựa chọn mặc định ở tầng Opus cho dự án mới. Cần lưu ý Opus 5.5 không cho tắt thinking, mặc định effort medium và trả lỗi 400 khi dùng tool_choice ép buộc. Chỉ nên giữ Opus 5 khi code hiện tại phụ thuộc vào các hành vi này, hoặc khi bộ kiểm thử cho thấy Opus 5 cho kết quả tốt hơn.
Chatbot chăm sóc khách hàng tiếng Việt nên dùng Sonnet 5 hay Haiku 4.5?
Nên dùng Sonnet 5 ($2/$10 mỗi 1M token) làm mặc định, vì model này thường xử lý tốt hơn các hội thoại nhiều lượt và chính sách có nhiều điều kiện. Haiku 4.5 ($1/$5) hợp với phần định tuyến, phân loại ý định, trả lời câu hỏi thường gặp ngắn, hoặc những chỗ cần phản hồi nhanh nhất. Cách chắc chắn nhất là chạy thử cả hai trên 30–50 hội thoại thật, rồi so tỷ lệ câu trả lời đạt yêu cầu và chi phí.
Khi nào mới cần dùng Claude Fable 5.1?
Fable 5.1 ($10/$50 mỗi 1M token) là model mạnh nhất mà Anthropic phát hành rộng rãi. Model này hợp với các bài toán suy luận khó nhất và tác vụ agent dài hơi mà sai sót rất tốn kém. Giá mỗi token của Fable 5.1 gấp 2,5 lần Opus 5.5. Model luôn bật thinking, một request khó có thể chạy nhiều phút, và yêu cầu chính sách lưu dữ liệu 30 ngày. Nên thử Opus 5.5 ở effort cao trước, chỉ chuyển lên Fable 5.1 khi bộ kiểm thử cho thấy khác biệt rõ ràng.
Có nên chuyển từ Sonnet 4.6 sang Sonnet 5 không?
Với đa số dự án thì nên chuyển. Sonnet 5 có giá $2/$10 mỗi 1M token, thấp hơn Sonnet 4.6 ($3/$15). Mức $2/$10 ban đầu là giá giới thiệu và nay đã thành giá chuẩn, không tăng lên. Khi chuyển, cần bỏ budget_tokens (Sonnet 5 trả lỗi 400) và thay bằng thinking adaptive kết hợp effort. Ngoài ra nên đo lại số token bằng count_tokens, vì các model từ thế hệ 4.7 trở lên dùng tokenizer mới.
Mua API Claude một lần có dùng được tất cả các model không?
Có. Credit trong tài khoản Claude Console dùng chung cho mọi model trên Claude API, mỗi request được tính theo đơn giá của model bạn ghi trong tham số model. Riêng Fable 5.1 yêu cầu chính sách lưu dữ liệu 30 ngày, còn Claude Mythos chỉ mở giới hạn. Uptech hỗ trợ nạp credit vào tài khoản Console đứng tên doanh nghiệp, báo giá bằng VND (quy đổi tham chiếu theo tỷ giá, chưa VAT) và xuất hóa đơn GTGT.
Gửi số người dùng, thời hạn, thông tin công ty và yêu cầu VAT. Uptech sẽ phản hồi phương án mua phù hợp.
- Phản hồi trong ngày làm việc khi có đủ số người dùng và gói dự kiến
- Báo giá VND kèm hợp đồng và hóa đơn VAT theo phạm vi thống nhất
- Bàn giao theo người dùng/email và nhắc gia hạn