定价

2026 年 LLM API 定价比较:成本公式与费率

TTokenhot Team2026年8月14日更新于 2026年9月14日约 11 分钟阅读
2026 年 LLM API 定价比较:成本公式与费率

只有当每个数字使用相同计费单位,并且计算反映你实际运行的工作负载时,LLM API 定价比较才有用。输入、缓存输入、缓存写入、输出、隐藏推理、长上下文附加费、工具和重试都可能出现在账单的不同项目中。

本指南提供截至 2026 年 9 月 14 日核查的第一方文本模型标价的有限、可复现快照,然后说明如何将请求遥测数据转化为月度估算。价格均为税前美元,未包含企业折扣、云市场调整或区域溢价。提交预算前务必重新核查所链接来源。

2026 年文本模型 API 定价快照

此表是实用样本,不是所有模型的目录。除非注明条件,费率均为各供应商第一方标准服务每百万 token 的价格。较低 token 价格并不代表模型在质量、延迟、可靠性或 tokenization 上相同。

供应商和模型 标准输入 缓存输入或缓存命中 输出 会改变账单的条件
OpenAI gpt-6-astra $10.00 $1.00 $50.00 缓存写入为 $12.50。输入超过 272K token 时,整次请求按 2x 输入/缓存费率和 1.5x 输出计费。Batch 和 Flex 为 Standard 的 50%;Fast 为 2x。
OpenAI gpt-5.6-luna $0.20 $0.02 $1.20 缓存写入为未缓存输入的 1.25x,即 $0.25。输入超过 272K token 时,整次请求为 2x 输入和 1.5x 输出。
Anthropic Claude Sonnet 5 $2.00 $0.20 $10.00 5 分钟缓存写入为 $2.50,1 小时写入为 $4.00。Batch 输入为 $1.00,输出为 $5.00。
Anthropic Claude Haiku 4.5 $1.00 $0.10 $5.00 5 分钟缓存写入为 $1.25,1 小时写入为 $2.00。Batch 输入为 $0.50,输出为 $2.50。
Google gemini-3.7-flash $0.75 $0.075 $3.75 此费率截至 2026 年 12 月 31 日有效。缓存上下文还须按每百万 token 每小时 $0.50 支付存储费。Batch 输入/输出为 $0.375/$1.875。
DeepSeek deepseek-flash $0.15-$0.30 $0.003-$0.006 $0.60-$1.20 较低数字为非高峰;周一至周五 UTC 01:00-04:00 和 06:00-10:00 使用较高数字。
DeepSeek deepseek-v4-pro $0.66-$1.32 $0.022-$0.044 $1.98-$3.96 使用相同时段。DeepSeek 称 V4 Pro 服务在 2026 年 9 月 14 日后继续,并沿用此计费方式。
Mistral Mistral Large 3 $0.50 $0.05 $1.50 Mistral 的表将其标为标准美元费率;Batch、Priority 和区域推理是独立选项。

DeepSeek 两行取代了仍见于过时比较中的旧 deepseek-chat 和 deepseek-reasoner 价格。有关模型特定上下文和迁移考虑,请参阅我们的 DeepSeek V4 Pro 定价指南和在中国境外使用 DeepSeek API 指南。

第一方价格不是 Tokenhot 价格

上表是供应商标价基线,不是 Tokenhot 报价。Tokenhot 在其模型目录中发布网关路径和当前费率,这些费率可能因模型、渠道或促销而与第一方定价不同。购买前确认准确路径和显示的计费单位。以下示例只使用表中的第一方费率。

比较网关时,这一区分同样重要。供应商可能将路由、付款、回退或模型访问打包为不同价格。我们的 OpenRouter 替代方案指南涵盖除单位成本外应比较的运营问题。

LLM API 成本公式

从计量使用量而非字数开始。让每个 token 数量表示成功调用以及任何已计费失败或重试调用的总数:

token_cost = (
    standard_input_tokens * standard_input_rate
  + cache_write_tokens     * cache_write_rate
  + cached_input_tokens    * cached_input_rate
  + billed_output_tokens   * output_rate
) / 1,000,000

total_cost = token_cost
           + cache_storage_cost
           + tool_call_cost
           + media_or_other_unit_cost

使用供应商的 usage 对象或发票填充这些分桶。不要按字符估算跨供应商 token:tokenizer 不同。不要重复加入推理 token。如果 API 在已计费输出中报告推理或思考 token,billed_output_tokens 已包括它们。Google 明确对包含思考 token 的输出定价;OpenAI 使用记录将推理 token 作为输出 token 的细分公开。

计算示例:缓存加重试开销

假设一个月度 gpt-5.6-luna 工作负载,每个请求都低于长上下文定价阈值,记录如下:

  • 1000 万普通输入 token
  • 500 万缓存写入 token
  • 8000 万缓存输入 token
  • 1000 万已计费输出 token,包括任何推理 token

按 9 月 14 日费率,token 账单为:

(10 * $0.20) + (5 * $0.25) + (80 * $0.02) + (10 * $1.20)
= $2.00 + $1.25 + $1.60 + $12.00
= $16.85

如果相同的 9500 万输入 token 全部按普通输入计费,账单将为 $19.00 + $12.00 = $31.00。在这些假设下,缓存会在额外工具费用之前节省 $14.15。

现在加入一个预算情境:重试重放相同 token 组合,使 token 使用量增加 5%。估算变为 $16.85 x 1.05 = $17.6925,最后四舍五入至两位小数后为 $17.69。在生产中,应根据实际重复使用量计算重试成本,因为输出前超时、缓存命中和完整重放的成本不同。

六个会改变答案的计费细节

1. 输出和推理可能主导成本

输出的成本通常是普通输入的数倍。智能体循环还可能生成最终回答中不可见的推理 token。在 API 支持时设置输出和推理限制,并记录完整 usage 记录。一个返回 300 个可见 token 的请求,已计费输出数量仍可能明显更多。

2. 缓存有写入、读取,有时还有存储

只有内容被写入并重复使用后,缓存命中才更便宜。上例中 OpenAI 和 Anthropic 对缓存写入收取溢价。Google 同时列出缓存 token 费率和 token-hour 存储费。分别预测稳定的提示词前缀和变化的用户内容,然后测量命中率,而不是假设每个符合条件的提示词都会被缓存。

3. Batch 折扣以速度换价格

OpenAI GPT-6 Astra、Anthropic 所列模型和 Google Gemini 3.7 Flash 在官方文档中均显示 50% 的 Batch token 费率。Batch 任务是异步的,并受各供应商支持的端点和完成窗口限制。保持交互流量使用标准费率,只将离线分类、评估或回填等可容忍延迟的工作转入 Batch。

4. 长上下文可能触发整次请求倍率

除非供应商如此说明,不要只对阈值之上的 token 使用倍率。GPT-6 Astra 明确规定:输入超过 272K token 时,整次请求的输入/缓存费率为 2x,输出为 1.5x。GPT-5.6 Luna 页面规定 2x 输入和 1.5x 输出,却未明确缓存输入倍率;估算大型缓存请求前确认该缓存处理。Anthropic 称 Claude 4.6 及以后模型的完整 100 万 token 上下文采用标准定价。规则因模型而异,因此应记录每次请求的提示词大小,而不是套用一个全局假设。

5. 工具和重试在标题表之外

服务器端搜索、代码执行、grounding、存储和其他工具可能增加按调用或按使用量计的费用。即使应用显示一次逻辑用户操作,重试也可能重复 token 和工具费用。采用设上限的指数退避,只重试文档规定为瞬态的错误,并附加应用请求 ID,以便追踪重复工作。

6. 图像和视频价格采用不同单位

文本模型 token 费率无法为每种多模态工作负载定价。图像 API 可能按生成图像、每次调用,或按图像 token 和质量收费。视频 API 通常使用秒数、分辨率或生成层级。请保留单独公式,并对结果分类汇总。

Seedream 用于图像生成;Seedance 是字节跳动的视频家族。请让它们的价格和计费单位保持分离。如果你正在变更视频供应商,请使用视频特定比较及我们的 Sora API 迁移指南中的任务生命周期检查。

如何依据真实工作负载选择

按模型和端点导出至少一周有代表性的使用量。分离标准输入、缓存写入、缓存命中、已计费输出、重试、长上下文请求、Batch 流量和工具。针对候选模型重放固定评估集,然后比较任务成功、延迟分布、速率限制和总计费单位。最便宜的一行只有在模型满足质量和运行要求时才有价值。

在任何模型别名、提示词、推理设置、输出上限、路由规则或 tokenizer 变更后重新计算。将每个费率快照的定价页面 URL 和日期保存在电子表格或成本服务中,以便解释后续发票差异。

常见问题

2026 年最便宜的 LLM API 是什么?

不存在通用的最便宜 API。在这个带日期的样本中,DeepSeek Flash 的列出非高峰缓存命中费率最低,而 GPT-5.6 Luna 有简单的低标准费率。你最便宜的有效选项取决于输出量、缓存复用、时段、工具、重试、质量,以及是否可接受批处理。

推理 token 会计费吗?

通常会。Google 表示其输出价格包括思考 token,OpenAI 在输出 token 详情中报告推理 token。请使用供应商的已计费输出总额和该模型文档;不要从可见答案长度推断成本。

提示词缓存总能降低成本吗?

不能。工作负载必须充分重复符合条件的稳定前缀,才能收回缓存写入和任何存储费用。跟踪缓存写入和缓存读取字段,然后按该模型费率计算盈亏平衡点。

我应该只用输入价格比较模型吗?

不应该。使用完整工作负载公式。输出密集生成、智能体推理、工具和重试可能超过输入价格,而 Batch 和缓存命中可以降低成本。

本文价格是 Tokenhot 价格吗?

不是。比较表和计算示例采用的是截至 2026 年 9 月 14 日核查的第一方供应商标价。请单独查看 Tokenhot 模型目录,了解当前网关路径、价格和计费单位。

总结

一份带日期的 LLM API 定价比较,包含可复现的成本公式、一个计算示例,以及标题 token 费率未体现的计费细节。

相关文章