Bảng giá

So sánh giá LLM API 2026: Công thức chi phí và bảng giá

TTokenhot Team14 tháng 8, 2026Cập nhật 14 tháng 9, 202611 phút đọc
So sánh giá LLM API 2026: Công thức chi phí và bảng giá

So sánh giá LLM API chỉ hữu ích khi mọi con số dùng cùng đơn vị tính phí và phép tính phản ánh đúng workload bạn thực sự chạy. Đầu vào, đầu vào đã cache, lần ghi cache, đầu ra, suy luận ẩn, phụ phí ngữ cảnh dài, công cụ và lần thử lại đều có thể xuất hiện ở những dòng khác nhau trên hóa đơn.

Hướng dẫn này cung cấp một ảnh chụp giới hạn nhưng có thể tái tạo về giá niêm yết model văn bản của chính nhà cung cấp, được kiểm tra ngày 14/9/2026. Sau đó, bài viết trình bày cách chuyển telemetry của yêu cầu thành ước tính hằng tháng. Giá tính bằng USD, chưa gồm thuế, chiết khấu doanh nghiệp, điều chỉnh trên marketplace đám mây hoặc phụ phí khu vực. Luôn kiểm tra lại nguồn được liên kết trước khi chốt ngân sách.

Ảnh chụp giá API model văn bản năm 2026

Bảng này là mẫu thực tế, không phải danh mục mọi model. Trừ khi có điều kiện đi kèm, mức giá tính trên một triệu token ở dịch vụ tiêu chuẩn trực tiếp từ từng nhà cung cấp. Giá token thấp hơn không chứng minh rằng chất lượng, độ trễ, độ tin cậy hoặc cách token hóa giữa các model là tương đương.

Nhà cung cấp và model Đầu vào tiêu chuẩn Đầu vào đã cache hoặc cache hit Đầu ra Điều kiện làm thay đổi hóa đơn
OpenAI gpt-6-astra $10.00 $1.00 $50.00 Ghi cache là $12.50. Khi đầu vào vượt 272K token, toàn bộ yêu cầu được tính 2x giá đầu vào/cache và 1,5x giá đầu ra. Batch và Flex bằng 50% Standard; Fast bằng 2x.
OpenAI gpt-5.6-luna $0.20 $0.02 $1.20 Ghi cache bằng 1,25x đầu vào chưa cache, tức $0.25. Khi đầu vào vượt 272K token, toàn bộ yêu cầu có giá đầu vào 2x và đầu ra 1,5x.
Anthropic Claude Sonnet 5 $2.00 $0.20 $10.00 Ghi cache 5 phút là $2.50 và 1 giờ là $4.00. Batch có đầu vào $1.00 và đầu ra $5.00.
Anthropic Claude Haiku 4.5 $1.00 $0.10 $5.00 Ghi cache 5 phút là $1.25 và 1 giờ là $2.00. Batch có đầu vào $0.50 và đầu ra $2.50.
Google gemini-3.7-flash $0.75 $0.075 $3.75 Mức giá này áp dụng đến hết ngày 31/12/2026. Lưu ngữ cảnh đã cache còn tốn $0.50 trên mỗi triệu token mỗi giờ. Đầu vào/đầu ra Batch là $0.375/$1.875.
DeepSeek deepseek-flash $0.15-$0.30 $0.003-$0.006 $0.60-$1.20 Số thấp hơn áp dụng giờ thấp điểm; số cao hơn áp dụng 01:00–04:00 và 06:00–10:00 UTC, từ thứ Hai đến thứ Sáu.
DeepSeek deepseek-v4-pro $0.66-$1.32 $0.022-$0.044 $1.98-$3.96 Áp dụng cùng khung giờ. DeepSeek cho biết dịch vụ V4 Pro tiếp tục sau ngày 14/9/2026 với phương thức tính phí này.
Mistral Mistral Large 3 $0.50 $0.05 $1.50 Bảng của Mistral ghi đây là giá USD tiêu chuẩn; Batch, Priority và suy luận theo khu vực là các lựa chọn riêng.

Các dòng DeepSeek thay thế giá deepseek-chat và deepseek-reasoner cũ vẫn xuất hiện trong những bảng so sánh lỗi thời. Để hiểu ngữ cảnh và lưu ý di chuyển riêng cho model, xem hướng dẫn giá DeepSeek V4 Pro và hướng dẫn dùng DeepSeek API ngoài Trung Quốc.

Giá trực tiếp từ nhà cung cấp không phải giá Tokenhot

Bảng trên là mức cơ sở theo giá niêm yết của nhà cung cấp. Đây không phải báo giá Tokenhot. Tokenhot công bố tuyến gateway và giá hiện tại trong danh mục model; giá có thể khác giá trực tiếp tùy model, kênh hoặc chương trình khuyến mãi. Hãy xác nhận chính xác tuyến và đơn vị tính phí được hiển thị trước khi mua. Các ví dụ bên dưới chỉ dùng giá trực tiếp trong bảng.

Sự phân biệt này cũng quan trọng khi so sánh gateway. Một nhà cung cấp có thể gộp định tuyến, thanh toán, fallback hoặc quyền truy cập model vào một mức giá khác. Hướng dẫn các lựa chọn thay thế OpenRouter trình bày những câu hỏi vận hành cần so sánh cùng đơn giá.

Công thức chi phí LLM API

Bắt đầu từ mức sử dụng đo được, không phải số từ. Mỗi lượng token phải là tổng của các lệnh gọi thành công và mọi lệnh gọi thất bại hoặc thử lại có tính phí:

token_cost = (
    standard_input_tokens * standard_input_rate
  + cache_write_tokens     * cache_write_rate
  + cached_input_tokens    * cached_input_rate
  + billed_output_tokens   * output_rate
) / 1,000,000

total_cost = token_cost
           + cache_storage_cost
           + tool_call_cost
           + media_or_other_unit_cost

Dùng đối tượng usage hoặc hóa đơn của nhà cung cấp để điền các nhóm. Đừng ước tính token từ số ký tự giữa các nhà cung cấp vì tokenizer khác nhau. Đừng cộng token suy luận hai lần. Nếu API báo cáo token suy luận hoặc thinking trong đầu ra có tính phí, billed_output_tokens đã bao gồm chúng. Google ghi rõ đầu ra bao gồm token thinking; bản ghi usage của OpenAI cung cấp token suy luận như một phần phân tích của token đầu ra.

Ví dụ tính toán: cache và chi phí thử lại

Giả sử một workload gpt-5.6-luna hằng tháng, trong đó mọi yêu cầu đều dưới ngưỡng giá ngữ cảnh dài, ghi nhận:

  • 10 triệu token đầu vào thông thường
  • 5 triệu token ghi cache
  • 80 triệu token đầu vào đã cache
  • 10 triệu token đầu ra có tính phí, gồm cả token suy luận nếu có

Theo mức giá ngày 14/9, hóa đơn token là:

(10 * $0.20) + (5 * $0.25) + (80 * $0.02) + (10 * $1.20)
= $2.00 + $1.25 + $1.60 + $12.00
= $16.85

Nếu cùng 95 triệu token đầu vào đều bị tính như đầu vào thông thường, hóa đơn sẽ là $19.00 + $12.00 = $31.00. Với các giả định này, cache tiết kiệm $14.15 trước mọi phí công cụ bổ sung.

Giờ hãy thêm một kịch bản ngân sách trong đó lần thử lại phát lại cùng tổ hợp token và làm mức dùng token tăng 5%. Ước tính trở thành $16.85 x 1.05 = $17.6925, hay $17.69 sau khi làm tròn ở bước cuối. Trong production, hãy tính chi phí thử lại từ mức dùng trùng lặp thực tế vì hết thời gian chờ trước khi có đầu ra, cache hit và phát lại toàn bộ không có cùng chi phí.

Sáu chi tiết tính phí làm thay đổi kết quả

1. Đầu ra và suy luận có thể chiếm phần lớn chi phí

Đầu ra thường đắt gấp nhiều lần đầu vào thông thường. Vòng lặp agent còn có thể tạo token suy luận không hiển thị trong câu trả lời cuối. Hãy đặt giới hạn đầu ra và suy luận khi API hỗ trợ, đồng thời ghi log toàn bộ bản ghi usage. Một yêu cầu trả về 300 token nhìn thấy được vẫn có thể có số token đầu ra tính phí lớn hơn đáng kể.

2. Cache có lượt ghi, lượt đọc và đôi khi có phí lưu trữ

Cache hit chỉ rẻ hơn sau khi nội dung đã được ghi và tái sử dụng. OpenAI và Anthropic tính phí cao hơn cho lượt ghi cache trong các ví dụ trên. Google liệt kê cả giá token đã cache và phí lưu trữ theo token-giờ. Hãy dự báo riêng tiền tố prompt ổn định và nội dung người dùng thay đổi, sau đó đo tỷ lệ hit thay vì giả định mọi prompt đủ điều kiện đều được cache.

3. Giảm giá Batch đổi tốc độ lấy giá thấp hơn

Tài liệu chính thức của OpenAI GPT-6 Astra, các model Anthropic được liệt kê và Google Gemini 3.7 Flash đều có giá token Batch bằng 50%. Tác vụ Batch chạy bất đồng bộ và phụ thuộc endpoint cùng khoảng thời gian hoàn thành mà từng nhà cung cấp hỗ trợ. Giữ lưu lượng tương tác ở giá tiêu chuẩn và chỉ chuyển công việc chấp nhận độ trễ, như phân loại ngoại tuyến, đánh giá hoặc backfill.

4. Ngữ cảnh dài có thể kích hoạt hệ số cho toàn bộ yêu cầu

Đừng chỉ nhân số token vượt ngưỡng trừ khi nhà cung cấp nói rõ. Khi đầu vào vượt 272K token, GPT-6 Astra áp dụng rõ ràng 2x giá đầu vào/cache và 1,5x giá đầu ra cho toàn bộ yêu cầu. Trang GPT-5.6 Luna ghi 2x đầu vào và 1,5x đầu ra nhưng không xác định rõ hệ số cho đầu vào đã cache; hãy xác nhận cách xử lý cache trước khi ước tính một yêu cầu lớn có cache. Anthropic cho biết Claude 4.6 và các model mới hơn bao gồm toàn bộ ngữ cảnh một triệu token ở giá tiêu chuẩn. Quy tắc khác nhau theo model, vì vậy hãy ghi kích thước prompt theo từng yêu cầu thay vì áp dụng một giả định chung.

5. Công cụ và lần thử lại nằm ngoài bảng giá nổi bật

Tìm kiếm phía máy chủ, thực thi code, grounding, lưu trữ và các công cụ khác có thể thêm phí trên mỗi lượt gọi hoặc theo mức sử dụng. Lần thử lại có thể nhân đôi phí token và công cụ dù ứng dụng chỉ hiển thị một thao tác logic của người dùng. Dùng exponential backoff có giới hạn, chỉ thử lại lỗi được ghi nhận là tạm thời và gắn ID yêu cầu ứng dụng để truy vết công việc trùng lặp.

6. Giá hình ảnh và video dùng đơn vị khác nhau

Giá token của model văn bản không thể định giá mọi workload đa phương thức. API hình ảnh có thể tính phí theo hình được tạo, mỗi lượt gọi hoặc token hình ảnh và chất lượng. API video thường dùng số giây, độ phân giải hoặc tầng tạo. Hãy dùng các công thức riêng rồi cộng tổng phụ.

Seedream dùng để tạo hình ảnh; Seedance là họ video của ByteDance. Hãy tách riêng giá và đơn vị tính phí. Nếu đang đổi nhà cung cấp video, dùng phép so sánh dành cho video và các bước kiểm tra vòng đời tác vụ trong hướng dẫn di chuyển Sora API.

Cách lựa chọn theo chi phí workload thực

Xuất ít nhất một tuần sử dụng đại diện theo model và endpoint. Tách đầu vào tiêu chuẩn, lượt ghi cache, cache hit, đầu ra có tính phí, lần thử lại, yêu cầu ngữ cảnh dài, lưu lượng Batch và công cụ. Chạy lại một tập đánh giá cố định trên các model ứng viên, rồi so sánh tỷ lệ tác vụ thành công, phân bố độ trễ, giới hạn tốc độ và tổng đơn vị tính phí. Dòng rẻ nhất chỉ hữu ích nếu model đáp ứng yêu cầu chất lượng và vận hành.

Tính lại sau mọi thay đổi về alias model, prompt, thiết lập suy luận, giới hạn đầu ra, quy tắc định tuyến hoặc tokenizer. Giữ URL trang giá và ngày của mỗi ảnh chụp giá trong bảng tính hoặc dịch vụ chi phí để có thể giải thích chênh lệch hóa đơn sau này.

Câu hỏi thường gặp

LLM API nào rẻ nhất năm 2026?

Không có API rẻ nhất cho mọi trường hợp. Trong mẫu có ngày này, DeepSeek Flash có giá cache hit thấp điểm thấp nhất được liệt kê, còn GPT-5.6 Luna có mức giá tiêu chuẩn thấp và đơn giản. Lựa chọn hợp lệ rẻ nhất cho bạn phụ thuộc lượng đầu ra, tái sử dụng cache, khung giờ, công cụ, lần thử lại, chất lượng và khả năng chấp nhận xử lý Batch.

Token suy luận có bị tính phí không?

Thường là có. Google cho biết giá đầu ra bao gồm token thinking, còn OpenAI báo cáo token suy luận trong chi tiết token đầu ra. Hãy dùng tổng đầu ra có tính phí và tài liệu của nhà cung cấp cho đúng model; đừng suy ra chi phí từ độ dài câu trả lời nhìn thấy được.

Prompt caching có luôn giảm chi phí không?

Không. Workload phải tái sử dụng một tiền tố ổn định đủ điều kiện đủ nhiều lần để bù phí ghi cache và phí lưu trữ nếu có. Theo dõi trường ghi cache và đọc cache, sau đó tính điểm hòa vốn bằng giá của model đó.

Có nên chỉ dùng giá đầu vào để so sánh model không?

Không. Hãy dùng công thức đầy đủ của workload. Tạo nội dung nhiều đầu ra, suy luận agent, công cụ và lần thử lại có thể lớn hơn giá đầu vào, còn Batch và cache hit có thể làm giảm giá.

Giá trong bài viết này có phải giá Tokenhot không?

Không. Bảng so sánh và ví dụ tính toán dùng giá niêm yết trực tiếp của nhà cung cấp, được kiểm tra ngày 14/9/2026. Hãy kiểm tra riêng danh mục model Tokenhot để biết tuyến gateway, giá và đơn vị tính phí hiện tại.

Tóm tắt

Bản so sánh giá LLM API có ghi ngày kiểm tra, kèm công thức chi phí có thể tái tạo, ví dụ tính toán và những chi tiết tính phí mà giá token nổi bật thường bỏ qua.

Bài viết liên quan