Liên hệ
    AI Store · Claude API · Haiku 4.5 · Giá kiểm tra

    Claude Haiku 4.5 API: giá rẻ nhất, hợp việc gì và lưu ý khi triển khai

    Claude Haiku 4.5 API có giá $1 mỗi 1 triệu token đầu vào và $5 mỗi 1 triệu token đầu ra, đọc cache $0,10, Batch API $0,50/$2,50. Đây là model rẻ và nhanh nhất trong dòng Claude hiện hành, hợp phân loại, trích xuất, định tuyến và tác vụ khối lượng lớn. Đổi lại: context 200K token, ngưỡng cache tối thiểu 4.096 token và knowledge cutoff 02/2025.

    Haiku 4.5 phát hành 15/10/2025, được Anthropic mô tả là model nhanh nhất với trí tuệ gần mức frontier. Context 200.000 token (khoảng 150.000 từ tiếng Anh), output tối đa 64.000 token. Model nhận văn bản và hình ảnh, trả về văn bản. Ở tier Start, hạn mức tốc độ của Haiku 4.5 ngang Sonnet 5 và Opus 5.5: 1.000 request, 2 triệu token đầu vào mỗi phút.

    Haiku 4.5 là model hiện hành duy nhất vẫn dùng extended thinking thủ công: bật bằng thinking enabled kèm budget_tokens (tối thiểu 1.024 và nhỏ hơn max_tokens), không hỗ trợ tham số effort, không có interleaved thinking. Model dùng tokenizer thế hệ cũ, nên cùng một đoạn văn cho ít token hơn Sonnet 5 hay Opus 5.5; khi so với Sonnet 5, chênh lệch chi phí thực tế thường lớn hơn mức 2 lần trên bảng giá.

    Về vòng đời: trang Model deprecations ghi Haiku 4.5 ngừng không sớm hơn 15/10/2026. Tính đến 28/09/2026, Anthropic chưa công bố thông báo ngừng và cam kết báo trước ít nhất 60 ngày, nên nếu có thông báo, model vẫn chạy ít nhất 60 ngày kể từ lúc báo. Doanh nghiệp nên để model ID trong file cấu hình và chuẩn bị sẵn bộ eval để đổi model nhanh khi cần.

    • Model ID: claude-haiku-4-5 · context 200K token
    • $1 đầu vào / $5 đầu ra mỗi 1 triệu token (≈ 26.000 ₫ / 130.000 ₫)
    • Phân loại, trích xuất dữ liệu, định tuyến yêu cầu, khối lượng lớn cần độ trễ thấp
    • Mua qua Uptech: tài khoản chính chủ đứng tên doanh nghiệp, báo giá VND, hợp đồng và hóa đơn GTGT
    01 · Bảng giá

    Giá Claude Haiku 4.5 API theo token

    Giá niêm yết của Anthropic cho claude-haiku-4-5, đơn vị USD mỗi 1 triệu token; dòng dưới là VND quy đổi tham chiếu theo tỷ giá 25.937 ₫/USD, chưa gồm VAT.

    Đầu vào (input)$1≈ 26.000 ₫mỗi 1 triệu token
    Đầu ra (output)$5≈ 130.000 ₫mỗi 1 triệu token
    Đọc cache$0,10≈ 2.600 ₫10% giá input
    Ghi cache 5 phút / 1 giờ$1,25 / $2≈ 32.000 ₫ / 52.000 ₫1,25x / 2x giá input
    Batch API vào / ra$0,50 / $2,50≈ 13.000 ₫ / 65.000 ₫giảm 50%, xong trong 24 giờ

    Chi phí tháng ở 3 khối lượng mẫu

    Ước tính chi phí Claude Haiku 4.5 API mỗi tháng theo khối lượng mẫu
    Tình huốngGiả địnhChi phí / tháng
    Chatbot CSKH30.000 request/tháng · 3.000 token vào (60% đọc cache) · 400 token rachưa đủ ngưỡng cache của model$150≈ 3.890.000 ₫
    RAG tài liệu nội bộ10.000 request/tháng · 12.000 token vào (40% đọc cache) · 800 token ra$116,80≈ 3.029.000 ₫
    Xử lý tài liệu hàng loạt (Batch)50.000 tài liệu/tháng · 4.000 token vào · 600 token ra · Batch API$175≈ 4.539.000 ₫

    Nguồn: bảng giá chính thức của Anthropic, kiểm tra 28/09/2026. Ước tính chưa gồm phí ghi cache lần đầu và công cụ đi kèm. Prompt caching chỉ có hiệu lực khi phần lặp lại đủ dài (ngưỡng của Haiku 4.5: 4.096 token). So sánh với các model khác trên bảng giá API Claude đầy đủ.

    02 · Thông số

    Thông số kỹ thuật Claude Haiku 4.5

    Thông số kỹ thuật Claude Haiku 4.5
    Model IDclaude-haiku-4-5-20251001, alias claude-haiku-4-5 (Amazon Bedrock: anthropic.claude-haiku-4-5; Google Cloud: claude-haiku-4-5@20251001)
    Context window200.000 token, khoảng 150.000 từ tiếng Anh
    Output tối đa64.000 token
    ThinkingExtended thinking thủ công (budget_tokens tối thiểu 1.024); không hỗ trợ effort, không có interleaved thinking
    Đầu vào → đầu raVăn bản và hình ảnh → văn bản
    Knowledge cutoffTin cậy đến 02/2025; dữ liệu huấn luyện đến 07/2025
    Độ trễ tương đốiNhanh nhất (Fastest) trong dòng model hiện hành
    Trạng tháiActive, phát hành 15/10/2025, ngừng không sớm hơn 15/10/2026; chưa có thông báo ngừng tính đến 28/09/2026
    03 · Khi nào dùng

    Claude Haiku 4.5 hợp với việc gì?

    Điểm mạnh

    Rẻ và nhanh nhất

    $1/$5 mỗi 1 triệu token, độ trễ thấp nhất dòng hiện hành. Batch API chỉ $0,50/$2,50.

    Điểm mạnh

    Đầu ra rẻ cho tác vụ ngắn

    Phân loại 1.000 ticket, mỗi ticket 800 token vào và 20 token ra, tốn khoảng $0,90; qua Batch API còn khoảng $0,45.

    Điểm mạnh

    Hạn mức rộng như model lớn

    Tier Start: 1.000 RPM, 2 triệu ITPM, 400.000 OTPM, ngang Sonnet 5 và Opus 5.5. Token đọc từ cache không tính vào ITPM.

    Điểm mạnh

    Chi phí thinking dự đoán được

    Extended thinking với budget_tokens cố định giúp kiểm soát chính xác độ trễ và chi phí suy luận, hợp luồng cần dự toán chặt.

    Ứng dụng

    Phân loại và gắn nhãn

    Gắn nhãn ticket, phân loại email, đánh giá cảm xúc phản hồi khách hàng.

    Ứng dụng

    Trích xuất trường thông tin

    Lấy tên, số điện thoại, mã đơn, ngày tháng từ văn bản hoặc ảnh biểu mẫu.

    Ứng dụng

    Định tuyến yêu cầu

    Quyết định câu hỏi nào tự trả lời, câu nào chuyển lên Sonnet 5 hoặc Opus 5.5.

    Ứng dụng

    Ứng dụng thời gian thực

    Gợi ý trả lời, tóm tắt nhanh, xử lý cần phản hồi tức thì.

    Ứng dụng

    Sub-agent trong hệ nhiều model

    Đọc tài liệu, tìm kiếm, lọc thông tin cho orchestrator là Opus 5.5 hoặc Fable 5.1.

    Ứng dụng

    Xử lý hàng loạt

    Chạy hàng chục nghìn tài liệu qua Batch API, tối đa 100.000 request mỗi batch.

    04 · Cân nhắc

    Khi nào nên chọn model khác thay vì Haiku 4.5?

    Không phải lựa chọn tốt nhất cho

    • Tài liệu hoặc hội thoại dài hơn 200K token: Sonnet 5 và Opus 5.5 có context 1 triệu token.
    • Câu hỏi cần kiến thức mới: knowledge cutoff tin cậy chỉ đến 02/2025.
    • Agent coding nhiều bước, suy luận phức tạp: Sonnet 5 hoặc Opus 5.5 phù hợp hơn.
    • Yêu cầu suy luận chỉ tại Mỹ qua inference_geo: Haiku 4.5 không hỗ trợ, gửi tham số này nhận lỗi 400.

    Model thay thế

    • Claude Sonnet 5: $2 / $10

      Bước lên gần nhất: $2/$10, context 1 triệu token, effort low cho chat khối lượng lớn, ngưỡng cache chỉ 1.024 token.

    • Claude Opus 5.5: $4 / $20

      Làm orchestrator hoặc xử lý ca khó, để Haiku 4.5 làm worker giá rẻ.

    Haiku 4.5 là model Anthropic chỉ định thay cho Haiku 3 và Haiku 3.5, đã ngừng lần lượt ngày 20/04/2026 và 19/02/2026. Hệ thống còn gọi claude-3-haiku-20240307 hoặc claude-3-5-haiku-20241022 sẽ lỗi; đổi sang claude-haiku-4-5. Khi chuyển tiếp từ Haiku 4.5 lên Sonnet 5 sau này: bỏ budget_tokens và dùng adaptive thinking kèm effort (low cho khối lượng lớn), bỏ temperature, top_p, top_k khác mặc định, đếm lại token vì Sonnet 5 dùng tokenizer mới.

    05 · Máy tính chi phí

    Tính chi phí Haiku 4.5 API theo khối lượng của bạn

    Nhập số request và token trung bình; kết quả so sánh luôn với các model Claude khác.

    Mẫu nhanh:
    Chi phí ước tính mỗi tháng$55,00≈ 1.427.000 ₫ / tháng
    Tổng token vào
    30.000.000
    Tổng token ra
    5.000.000
    Chi phí / 1.000 request
    $5,50

    Phần lặp lại ~900 token/request thấp hơn ngưỡng cache tối thiểu của Claude Haiku 4.5 (4.096 token) nên chưa được tính giá đọc cache.

    Nhận báo giá VND + VAT cho mức này

    Cùng khối lượng trên các model khác

    06 · Tối ưu chi phí

    Cách giảm chi phí khi dùng Haiku 4.5

    • Ngưỡng cache của Haiku 4.5 là 4.096 token, cao nhất dòng hiện hành. Phần cố định ngắn hơn sẽ không được cache và API không báo lỗi; nếu usage trả cache_creation_input_tokens và cache_read_input_tokens đều bằng 0 là chưa cache.
    • Nếu phần cố định đã gần 4.096 token, bổ sung ví dụ mẫu hoặc định nghĩa tool để vượt ngưỡng: đọc cache chỉ $0,10/MTok thay vì $1.
    • Với tác vụ phân loại, không bật thinking và đặt max_tokens nhỏ. Token thinking tính như token đầu ra.
    • Gom việc không gấp vào Batch API: $0,50/$2,50, đa số batch xong dưới 1 giờ, kết quả giữ 29 ngày; cộng dồn với giảm giá cache.
    • Nếu prompt cố định dài 1.024–4.096 token, hãy tính thử Sonnet 5 có cache: đọc cache của Sonnet 5 chỉ $0,20/MTok, có thể rẻ hơn phần đầu vào không cache của Haiku 4.5 ($1/MTok).
    07 · Code mẫu

    Gọi Claude Haiku 4.5 qua API

    Dùng SDK chính thức của Anthropic, gọi thẳng api.anthropic.com với model ID claude-haiku-4-5. Đặt key vào biến môi trường ANTHROPIC_API_KEY, không nhúng vào mã frontend.

    # pip install anthropic
    import anthropic
    
    client = anthropic.Anthropic()  # đọc ANTHROPIC_API_KEY từ biến môi trường
    
    response = client.messages.create(
        model="claude-haiku-4-5",
        max_tokens=16000,
        messages=[{"role": "user", "content": "Tóm tắt hợp đồng này thành 5 ý chính."}],
    )
    
    for block in response.content:
        if block.type == "text":
            print(block.text)
    08

    Câu hỏi thường gặp về Claude Haiku 4.5 API

    Claude Haiku 4.5 API giá bao nhiêu?

    Theo bảng giá Anthropic kiểm tra ngày 28/09/2026: $1 mỗi 1 triệu token đầu vào, $5 mỗi 1 triệu token đầu ra; ghi cache 5 phút $1,25, 1 giờ $2, đọc cache $0,10; Batch API $0,50/$2,50. Ví dụ phân loại 1.000 ticket, mỗi ticket 800 token vào và 20 token ra, tốn khoảng $0,90. Quy đổi VND ở bảng giá chỉ mang tính tham chiếu, chưa gồm VAT.

    Haiku 4.5 có sắp bị ngừng không?

    Chưa. Trang Model deprecations ghi Haiku 4.5 đang Active, ngừng không sớm hơn 15/10/2026; đó là mốc sớm nhất có thể, chưa phải ngày ngừng. Tính đến 28/09/2026 chưa có thông báo deprecate, và Anthropic cam kết báo trước ít nhất 60 ngày qua email và tài liệu, nên model vẫn chạy ít nhất 60 ngày sau khi có thông báo. Nên để model ID trong cấu hình và theo dõi trang này.

    Vì sao prompt caching không có tác dụng với Haiku 4.5?

    Thường do phần được đánh dấu cache ngắn hơn 4.096 token, ngưỡng tối thiểu của Haiku 4.5. Khi đó API xử lý bình thường nhưng không cache và không báo lỗi. Kiểm tra usage: nếu cache_creation_input_tokens và cache_read_input_tokens đều bằng 0 thì chưa cache. Ngoài ra, cache chỉ khớp khi phần đầu prompt giống hệt giữa các request.

    Haiku 4.5 có dùng thinking được không?

    Có, bằng extended thinking thủ công: thinking type enabled kèm budget_tokens tối thiểu 1.024 và nhỏ hơn max_tokens. Haiku 4.5 không nhận adaptive thinking (trả lỗi 400) và không hỗ trợ tham số effort. Token thinking tính như token đầu ra; thinking block của các lượt trước bị loại khỏi ngữ cảnh nên không tính thành token đầu vào ở lượt sau.

    Chatbot nên dùng Haiku 4.5 hay Sonnet 5?

    Haiku 4.5 hợp chatbot trả lời câu hỏi thường gặp, định tuyến và tra cứu đơn giản, nơi tốc độ và giá quan trọng nhất. Khi câu hỏi cần suy luận, đọc tài liệu dài hơn 200K token hoặc kiến thức sau 02/2025, Sonnet 5 ở effort low là bước lên hợp lý. Nhiều hệ thống dùng cả hai: Haiku 4.5 phân loại, Sonnet 5 trả lời phần khó.

    Mua API Haiku 4.5 với ngân sách nhỏ được không?

    Được. API tính theo token thực dùng, trả trước bằng credit USD, không có phí cố định hằng tháng. Có thể tự đặt spend limit thấp hơn trần của tier để khống chế chi phí và bật auto-reload để không bị gián đoạn. Credit hết hạn sau 1 năm và không hoàn tiền. Uptech hỗ trợ mua chính chủ với báo giá VND, hợp đồng và hóa đơn GTGT cho dịch vụ hỗ trợ mua sắm, thanh toán và triển khai; tài khoản Anthropic đứng tên doanh nghiệp, doanh nghiệp tự tạo và quản lý key, không đi qua key proxy.

    Nguồn tham khảo: Bảng giá Claude API (Anthropic) · Claude Haiku 4.5 – model overview (Anthropic) · Prompt caching (Anthropic) · Extended thinking (Anthropic) · Rate limits (Anthropic) · Model deprecations (Anthropic).

    Nhận báo giá

    Báo giá Claude Haiku 4.5 API bằng VND, có hợp đồng và hóa đơn GTGT

    Gửi use case và khối lượng dự kiến. Uptech phản hồi phương án model, kênh mua và báo giá VND kèm hợp đồng, VAT và kế hoạch kích hoạt tài khoản chính chủ đứng tên doanh nghiệp.

    • Phản hồi trong ngày làm việc gần nhất
    • Tài khoản và key chính chủ, không proxy

    Cần trao đổi nhanh? Chat Zalo hoặc gọi 0968 726 135.

    Yêu cầu báo giá

    Bước 1/3: Nhu cầu API

    1. 1Nhu cầu API
    2. 2Công ty
    3. 3Liên hệ
    Nhu cầu APIClaude Haiku 4.5 · ngân sách Chưa rõ/tháng
    Ngân sách API dự kiến mỗi tháng (USD)
    Zalo