Claude Sonnet 5.5 API: giá, điểm khác Sonnet 5 và cách chuyển đổi
Claude Sonnet 5.5 API có giá $2 mỗi 1 triệu token đầu vào và $10 mỗi 1 triệu token đầu ra, đọc cache $0,20, Batch API $1/$5, bằng đúng Sonnet 5. Ra mắt ngày 28/09/2026, đây là model Sonnet hiện hành, knowledge cutoff 06/2026, cache được từ 512 token. Chi phí mỗi token không đổi, nhưng code đang chạy trên Sonnet 5 phải sửa 5 điểm phá vỡ trước khi chuyển.
Sonnet 5.5 phát hành 28/09/2026 và thay Sonnet 5 trong nhóm model hiện hành, bên cạnh Fable 5.1, Opus 5.5 và Haiku 4.5. Model có context 1 triệu token tính giá chuẩn, output 128.000 token, knowledge cutoff 06/2026 (Sonnet 5 dừng ở 01/2026). Anthropic xếp độ trễ ở mức “nhanh”, chỉ sau Haiku 4.5, và công bố Sonnet 5.5 sinh output nhanh hơn Sonnet 5 trên 30%. Theo Anthropic, model mạnh nhất ở việc hằng ngày có phạm vi rõ: sửa lỗi, soạn tài liệu, slide và bảng tính.
Giá mỗi token và tokenizer giữ nguyên so với Sonnet 5, nên cùng một prompt cho cùng số token và cùng mức giá niêm yết. Khác biệt chi phí đến từ chỗ khác: ngưỡng cache tối thiểu giảm từ 1.024 xuống 512 token, nên system prompt ngắn cũng được giảm giá khi đọc lại; Anthropic cho biết model thường cần ít token hơn cho cùng một việc, nên trong thử nghiệm của họ, chi phí mỗi tác vụ thấp hơn tới 30% so với Sonnet 5. Sonnet 5.5 có hạn mức tốc độ riêng, không gộp với Sonnet 5, nên chạy song song hai model không ăn vào quota của nhau.
Điều cần chuẩn bị là năm thay đổi phá vỡ với code viết cho Sonnet 5: thinking disabled được thay bằng between_tools; tool_choice any hoặc tool bị từ chối; thinking block gắn với model và lịch sử hội thoại; computer_20251124 không còn được nhận trên Claude API và Google Cloud; một số cặp advisor bị từ chối. Ngoài ra, đoạn text dài giữa các lần gọi tool chuyển vào thinking block, các mức effort được hiệu chỉnh lại, và bộ lọc an toàn từ chối theo năm nhóm, nhiều hơn Sonnet 5.
- Model ID:
claude-sonnet-5-5· context 1M token - $2 đầu vào / $10 đầu ra mỗi 1 triệu token (≈ 52.000 ₫ / 259.000 ₫)
- Mặc định cho production: chatbot CSKH, RAG nội bộ, coding agent, viết và tóm tắt nội dung khối lượng lớn
- Mua qua Uptech: tài khoản chính chủ đứng tên doanh nghiệp, báo giá VND, hợp đồng và hóa đơn GTGT
Giá Claude Sonnet 5.5 API theo token
Giá niêm yết của Anthropic cho claude-sonnet-5-5, đơn vị USD mỗi 1 triệu token; dòng dưới là VND quy đổi tham chiếu theo tỷ giá 25.917 ₫/USD, chưa gồm VAT.
Chi phí tháng ở 3 khối lượng mẫu
| Tình huống | Giả định | Chi phí / tháng |
|---|---|---|
| Chatbot CSKH | 30.000 request/tháng · 3.000 token vào (60% đọc cache) · 400 token ra | $202,80≈ 5.256.000 ₫ |
| RAG tài liệu nội bộ | 10.000 request/tháng · 12.000 token vào (40% đọc cache) · 800 token ra | $233,60≈ 6.054.000 ₫ |
| Xử lý tài liệu hàng loạt (Batch) | 50.000 tài liệu/tháng · 4.000 token vào · 600 token ra · Batch API | $350≈ 9.071.000 ₫ |
Nguồn: bảng giá chính thức của Anthropic, kiểm tra 29/09/2026. Ước tính chưa gồm phí ghi cache lần đầu và công cụ đi kèm. Prompt caching chỉ có hiệu lực khi phần lặp lại đủ dài (ngưỡng của Sonnet 5.5: 512 token). So sánh với các model khác trên bảng giá API Claude đầy đủ.
Thông số kỹ thuật Claude Sonnet 5.5
| Model ID | claude-sonnet-5-5, không có hậu tố ngày (Amazon Bedrock: anthropic.claude-sonnet-5-5; Google Cloud, Microsoft Foundry, Claude Platform on AWS: claude-sonnet-5-5) |
|---|---|
| Context window | 1 triệu token, khoảng 555.000 từ tiếng Anh; toàn bộ tính giá chuẩn |
| Output tối đa | 128.000 token; Batch API tới 300.000 token với header output-300k-2026-03-24 |
| Thinking | Adaptive thinking bật mặc định; mức thấp nhất là between_tools (chỉ ở effort low, medium, high); thinking disabled và budget_tokens trả lỗi 400 |
| Effort | low, medium, high, xhigh, max; mặc định high trên Claude API, đã hiệu chỉnh lại so với Sonnet 5 |
| Ngưỡng cache tối thiểu | 512 token (Sonnet 5: 1.024 token) |
| Đầu vào → đầu ra | Văn bản và hình ảnh → văn bản |
| Knowledge cutoff | Tin cậy đến 06/2026; dữ liệu huấn luyện đến 06/2026 |
| Độ trễ tương đối | Nhanh (Fast): sau Haiku 4.5, nhanh hơn Opus 5.5 và Fable 5.1 |
| Rate limit tier Start | 1.000 RPM, 2.000.000 token đầu vào/phút, 400.000 token đầu ra/phút; hạn mức riêng, không gộp với Sonnet 5 |
| Trạng thái | Active (mới nhất), phát hành 28/09/2026, ngừng không sớm hơn 28/09/2027 |
Claude Sonnet 5.5 hợp với việc gì?
Cùng giá, kiến thức mới hơn
$2/$10, Batch API $1/$5, đọc cache $0,20 như Sonnet 5, nhưng knowledge cutoff 06/2026, ngang Opus 5.5 và Fable 5.1. Toàn bộ 1 triệu token context tính giá chuẩn.
Cache được prompt ngắn
Ngưỡng 512 token, bằng nửa Sonnet 5 và một phần tám Haiku 4.5. Token đọc từ cache chỉ $0,20/MTok và không tính vào hạn mức token đầu vào mỗi phút.
Đổi chỉ dẫn, tool và effort giữa hội thoại
Hỗ trợ system message giữa hội thoại, đổi tool giữa hội thoại (beta), khai báo tool ngay trong message (beta) và per-message effort (beta), đều giữ được prompt cache. Sonnet 5 không có các tính năng này. Đầy đủ nhất trên Claude API; Amazon Bedrock và Google Cloud hỗ trợ một phần.
Tắt thinking mà vẫn thấy tiến độ
Chế độ between_tools bỏ phần suy nghĩ trước khi trả lời nhưng vẫn trả ghi chú tiến độ giữa các lần gọi tool; không cần beta header, dùng được trên mọi nền tảng có Sonnet 5.5.
Hỗ trợ zero data retention
Tổ chức có thỏa thuận ZDR với Anthropic dùng được Sonnet 5.5 như với Sonnet 5.
Sửa lỗi và tác vụ code có phạm vi rõ
Anthropic khuyên agent coding bắt đầu ở effort medium với việc mô tả rõ, lên high cho việc khó hơn; đặt max_tokens 128.000 và stream phản hồi.
Soạn tài liệu, slide, bảng tính
Nhóm việc Anthropic nêu là thế mạnh của Sonnet 5.5; đọc được cả ảnh và PDF đính kèm làm nguồn.
Agent gọi tool nhiều bước
System prompt ẩn cho tool use chỉ 286 token. Không ép gọi tool được, nên giữ input đúng schema bằng strict tool use hoặc structured outputs.
Chatbot CSKH cần phản hồi nhanh
Effort low hoặc medium, cache system prompt và chính sách từ 512 token, đổi hướng dẫn giữa phiên bằng system message mà không mất cache.
Computer use và browser use
Trên Claude API và Google Cloud dùng computer_toolset_20260801 hoặc browser use tool; Amazon Bedrock vẫn nhận computer_20251124.
Phiên làm việc dài
Chủ động nén hội thoại bằng compact on demand (beta, chưa có trên Amazon Bedrock) khi ngữ cảnh gần đầy; thinking block ở các lượt giữ lại vẫn dùng được nếu đáp ứng điều kiện Anthropic nêu. Đổi effort theo từng lượt bằng per-message effort (beta) mà không mất cache.
Khi nào nên chọn model khác thay vì Sonnet 5.5?
Không phải lựa chọn tốt nhất cho
- Pipeline ép gọi tool bằng tool_choice any hoặc tool: Sonnet 5.5 trả lỗi 400, kể cả ở endpoint đếm token; trên Amazon Bedrock còn không có strict tool use để thay thế.
- Luồng cần tắt thinking ở effort xhigh hoặc max: between_tools chỉ nhận low, medium, high.
- Ứng dụng sửa lại lịch sử hội thoại (đổi system prompt, tools hoặc lượt cũ) rồi gửi kèm thinking block: tài khoản tạo từ 31/08/2026 nhận lỗi 400.
- Việc phức tạp, mở, cần phán đoán liên tục như thiết kế kiến trúc hay refactor lớn: Anthropic cho biết Opus 5.5 vẫn mạnh hơn rõ rệt; Fable 5.1 dành cho suy luận khó nhất.
- Phân loại, định tuyến khối lượng cực lớn: Haiku 4.5 rẻ bằng nửa.
- Code còn dùng temperature, top_p, top_k khác mặc định hoặc assistant prefill: đều trả lỗi 400.
Model thay thế
- Claude Sonnet 5: $2 / $10
Cùng giá $2/$10, nay là legacy. Giữ tạm nếu còn cần thinking disabled ở xhigh/max, tool_choice ép buộc hoặc computer_20251124 trên Claude API; cũng là đích fallback khi Sonnet 5.5 từ chối nhóm cyber, frontier_llm.
- Claude Opus 5.5: $4 / $20
$4/$20, cùng giá đọc cache $0,20 và ngưỡng cache 512 token. Chọn khi cần agent chạy dài, refactor lớn, suy luận nhiều bước; thinking luôn bật.
- Claude Haiku 4.5: $1 / $5
$1/$5, độ trễ thấp nhất; hợp phân loại, định tuyến. Context 200K token, ngưỡng cache 4.096 token, tokenizer cũ.
Từ Sonnet 5: đổi model ID sang claude-sonnet-5-5 (không có hậu tố ngày); giá và tokenizer giữ nguyên nên không cần tính lại ngân sách token. Sau đó sửa năm điểm: thay thinking disabled bằng between_tools ở effort từ high trở xuống; thay tool_choice any hoặc tool bằng auto kèm strict tool use (trên Amazon Bedrock chưa có strict tool use: gửi auto, nói rõ trong prompt khi nào gọi tool và tự kiểm tra input); giữ lịch sử hội thoại chỉ nối thêm và đổi chỉ dẫn bằng system message giữa hội thoại; trên Claude API và Google Cloud, chuyển computer_20251124 sang computer_toolset_20260801 và bỏ header fine-grained-tool-streaming-2025-05-14; đổi advisor Opus 4.8, Opus 4.7, Opus 4.6, Sonnet 5 hoặc Sonnet 4.6 sang model được hỗ trợ. Rồi đặt thinking.display nếu giao diện hiển thị text giữa các lần gọi tool, xử lý stop_reason refusal và chạy lại effort sweep. Từ Sonnet 4.6: làm các bước trên, thêm: request không có trường thinking giờ sẽ chạy thinking; bỏ temperature, top_p, top_k; thay budget_tokens bằng effort; đếm lại token (tăng khoảng 30%) và nới max_tokens. Trong Claude Code, lệnh /claude-api migrate có thể tự áp dụng phần lớn thay đổi rồi đưa ra danh sách mục cần kiểm tra tay.
Tính chi phí Sonnet 5.5 API theo khối lượng của bạn
Nhập số request và token trung bình; kết quả so sánh luôn với các model Claude khác.
- Tổng token vào
- 30.000.000
- Tổng token ra
- 5.000.000
- Chi phí / 1.000 request
- $9,38
Cùng khối lượng trên các model khác
Cách giảm chi phí khi dùng Sonnet 5.5
- Chạy lại effort sweep thay vì giữ mức đã dùng trên Sonnet 5, vì các mức đã được hiệu chỉnh lại. Điểm khởi đầu Anthropic gợi ý: agent coding ở medium, chat ở medium hoặc low, việc còn lại ở high; chỉ dùng xhigh, max khi eval cho thấy có lợi. Token thinking tính như token đầu ra $10/MTok.
- Luồng đơn giản không cần suy nghĩ trước: gửi thinking between_tools ở effort low đến high. Khi đã dùng between_tools thì không đổi effort giữa hội thoại được.
- Rà các phần prompt cố định dài 512–1.023 token như system prompt ngắn hay bộ định nghĩa tool nhỏ: Sonnet 5 không cache được độ dài này, Sonnet 5.5 thì cache được, mỗi lần đọc lại chỉ bằng 1/10 giá đầu vào. Đặt breakpoint ngay sau phần cố định, đẩy phần thay đổi xuống cuối.
- Đổi hướng dẫn, tool hay effort bằng message giữa hội thoại thay vì sửa system prompt: vừa giữ cache, vừa tránh lỗi 400 do thinking block gắn với lịch sử.
- Việc không gấp chạy Batch API: $1/$5, cộng dồn với giảm giá cache; batch nhận output tới 300.000 token với header output-300k-2026-03-24.
- Chỉ đặt inference_geo us khi bắt buộc suy luận tại Mỹ: mọi loại token nhân 1,1 lần.
Gọi Claude Sonnet 5.5 qua API
Dùng SDK chính thức của Anthropic, gọi thẳng api.anthropic.com với model ID claude-sonnet-5-5. Đặt key vào biến môi trường ANTHROPIC_API_KEY, không nhúng vào mã frontend.
# pip install anthropic
import anthropic
client = anthropic.Anthropic() # đọc ANTHROPIC_API_KEY từ biến môi trường
response = client.messages.create(
model="claude-sonnet-5-5",
max_tokens=16000,
messages=[{"role": "user", "content": "Tóm tắt hợp đồng này thành 5 ý chính."}],
)
for block in response.content:
if block.type == "text":
print(block.text)// npm install @anthropic-ai/sdk
import Anthropic from "@anthropic-ai/sdk";
const client = new Anthropic(); // đọc ANTHROPIC_API_KEY từ biến môi trường
const response = await client.messages.create({
model: "claude-sonnet-5-5",
max_tokens: 16000,
messages: [{ role: "user", content: "Tóm tắt hợp đồng này thành 5 ý chính." }],
});
for (const block of response.content) {
if (block.type === "text") console.log(block.text);
}curl https://api.anthropic.com/v1/messages \
-H "Content-Type: application/json" \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-sonnet-5-5",
"max_tokens": 16000,
"messages": [
{"role": "user", "content": "Tóm tắt hợp đồng này thành 5 ý chính."}
]
}'Câu hỏi thường gặp về Claude Sonnet 5.5 API
Claude Sonnet 5.5 API giá bao nhiêu?
Theo bảng giá Anthropic kiểm tra ngày 29/09/2026: $2 mỗi 1 triệu token đầu vào, $10 mỗi 1 triệu token đầu ra; ghi cache 5 phút $2,50, 1 giờ $4, đọc cache $0,20; Batch API $1/$5, bằng đúng Sonnet 5. Ví dụ 20.000 request mỗi tháng, mỗi request 3.000 token vào và 400 token ra, tốn khoảng $200; nếu 2.000 token đầu là system prompt được cache, còn khoảng $128 (chưa tính phí ghi cache lần đầu). Token thinking tính như token đầu ra. Số tiền VND trên trang là quy đổi tham khảo theo tỷ giá ngày, chưa gồm VAT.
Sonnet 5.5 khác Sonnet 5 ở điểm nào?
Giống nhau: giá, tokenizer, context 1 triệu token, output 128.000 token, effort mặc định high. Khác nhau: knowledge cutoff 06/2026 thay vì 01/2026; ngưỡng cache 512 token thay vì 1.024; có system message, đổi tool và đổi effort giữa hội thoại; Anthropic công bố sinh output nhanh hơn trên 30%. Đổi lại, Sonnet 5.5 không nhận thinking disabled, tool_choice any hoặc tool, computer_20251124 trên Claude API và Google Cloud, hay advisor Opus 4.8, Opus 4.7, Sonnet 5; thinking block gắn với lịch sử hội thoại; text dài giữa các lần gọi tool nằm trong thinking block; bộ lọc an toàn từ chối theo năm nhóm.
Làm sao tắt thinking trên Sonnet 5.5?
Gửi thinking với type between_tools. Đây là mức thấp nhất, không cần beta header, chỉ nhận ở effort low, medium, high; ở xhigh hoặc max sẽ lỗi 400. Không gửi kèm display, budget_tokens hay block_binding. Request không có tool thì phản hồi chỉ có text, giống thinking disabled trên Sonnet 5; request có tool thì ghi chú tiến độ giữa các lần gọi vẫn nằm trong thinking block và cần gửi lại nguyên vẹn. Gửi thinking disabled sẽ nhận lỗi 400 kèm gợi ý dùng between_tools.
Vì sao agent im lặng giữa các lần gọi tool sau khi lên Sonnet 5.5?
Trên Sonnet 5.5, ghi chú dài hơn một hai câu giữa các lần gọi tool trả về dưới dạng thinking block tiến độ, và ở display mặc định omitted thì nội dung rỗng. Request không lỗi nhưng giao diện không có gì để hiển thị. Cách xử lý: đặt display là updates (beta, header thinking-display-updates-2026-08-18) để chỉ nhận ghi chú tiến độ, hoặc summarized để nhận kèm tóm tắt suy luận, rồi hiển thị mỗi thinking block không rỗng trước tool_use theo sau. Dùng between_tools thì text quay lại mà không cần display.
Sonnet 5.5 từ chối yêu cầu thì xử lý thế nào, có bị tính tiền không?
Yêu cầu bị từ chối vẫn trả HTTP 200 với stop_reason refusal, kèm stop_details nêu một trong năm nhóm: cyber, bio, frontier_llm, reasoning_extraction, general_harms. Server-side fallback (beta, chỉ Claude API) tự chạy lại nhóm cyber và frontier_llm trên Sonnet 5, không chạy lại ba nhóm còn lại. Refusal xảy ra trước khi có output có bị tính tiền hay không tùy nhóm; theo quy định Anthropic áp dụng từ 24/09/2026, nhóm bio, frontier_llm, reasoning_extraction bị tính, và mọi refusal đều tính vào rate limit. Tránh prompt đòi model chép lại toàn bộ suy luận nội bộ vào câu trả lời, vì đó là nhóm reasoning_extraction.
Đang dùng Sonnet 4.6, chuyển thẳng lên Sonnet 5.5 được không?
Được, hướng dẫn chuyển đổi của Anthropic có lộ trình riêng cho Sonnet 4.6. Ngoài năm điểm phá vỡ như khi đi từ Sonnet 5, cần chuẩn bị cho thinking tự bật ở request không có trường thinking, thay budget_tokens bằng effort, bỏ temperature, top_p, top_k, đặt display summarized nếu đang hiển thị thinking, và đếm lại token vì cùng văn bản cho khoảng 30% token nhiều hơn. Ảnh cũng tốn token hơn: Sonnet 5.5 đọc ảnh tới 2.576 pixel cạnh dài, ảnh 2000×1500 tốn khoảng 2,5 lần token so với Sonnet 4.6. Còn ở Sonnet 4.5 thì bỏ thêm assistant prefill.
Mua API Sonnet 5.5 cho doanh nghiệp ở Việt Nam, có phải tạo key mới không?
Không. API key và credit gắn với tổ chức trên Claude Console, gọi được mọi model đang hoạt động; lên Sonnet 5.5 chỉ là đổi model ID. Model có trên Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry và Claude Platform on AWS. Mua qua Uptech, doanh nghiệp thanh toán VND, có hợp đồng và hóa đơn GTGT cho dịch vụ hỗ trợ mua sắm, thanh toán và triển khai; tài khoản Anthropic vẫn đứng tên doanh nghiệp, doanh nghiệp giữ quyền Admin và tự quản lý key.
Nguồn tham khảo: Bảng giá Claude API (Anthropic) · Claude Sonnet 5.5 – model overview (Anthropic) · What's new in Claude Sonnet 5.5 (Anthropic) · Migrating to Claude Sonnet 5.5 (Anthropic) · Effort (Anthropic) · Rate limits (Anthropic) · Pricing (Anthropic) · Giới thiệu Claude Sonnet 5.5 (Anthropic).
Báo giá Claude Sonnet 5.5 API bằng VND, có hợp đồng và hóa đơn GTGT
Gửi use case và khối lượng dự kiến. Uptech phản hồi phương án model, kênh mua và báo giá VND kèm hợp đồng, VAT và kế hoạch kích hoạt tài khoản chính chủ đứng tên doanh nghiệp.
- Phản hồi trong ngày làm việc gần nhất
- Tài khoản và key chính chủ, không proxy
Cần trao đổi nhanh? Chat Zalo hoặc gọi 0968 726 135.