2026 年 LLM API 定价比较:成本公式与费率

只有当每个数字使用相同计费单位,并且计算反映你实际运行的工作负载时,LLM API 定价比较才有用。输入、缓存输入、缓存写入、输出、隐藏推理、长上下文附加费、工具和重试都可能出现在账单的不同项目中。
本指南提供截至 2026 年 9 月 14 日核查的第一方文本模型标价的有限、可复现快照,然后说明如何将请求遥测数据转化为月度估算。价格均为税前美元,未包含企业折扣、云市场调整或区域溢价。提交预算前务必重新核查所链接来源。
2026 年文本模型 API 定价快照
此表是实用样本,不是所有模型的目录。除非注明条件,费率均为各供应商第一方标准服务每百万 token 的价格。较低 token 价格并不代表模型在质量、延迟、可靠性或 tokenization 上相同。
| 供应商和模型 | 标准输入 | 缓存输入或缓存命中 | 输出 | 会改变账单的条件 |
|---|---|---|---|---|
OpenAI gpt-6-astra |
$10.00 | $1.00 | $50.00 | 缓存写入为 $12.50。输入超过 272K token 时,整次请求按 2x 输入/缓存费率和 1.5x 输出计费。Batch 和 Flex 为 Standard 的 50%;Fast 为 2x。 |
OpenAI gpt-5.6-luna |
$0.20 | $0.02 | $1.20 | 缓存写入为未缓存输入的 1.25x,即 $0.25。输入超过 272K token 时,整次请求为 2x 输入和 1.5x 输出。 |
| Anthropic Claude Sonnet 5 | $2.00 | $0.20 | $10.00 | 5 分钟缓存写入为 $2.50,1 小时写入为 $4.00。Batch 输入为 $1.00,输出为 $5.00。 |
| Anthropic Claude Haiku 4.5 | $1.00 | $0.10 | $5.00 | 5 分钟缓存写入为 $1.25,1 小时写入为 $2.00。Batch 输入为 $0.50,输出为 $2.50。 |
Google gemini-3.7-flash |
$0.75 | $0.075 | $3.75 | 此费率截至 2026 年 12 月 31 日有效。缓存上下文还须按每百万 token 每小时 $0.50 支付存储费。Batch 输入/输出为 $0.375/$1.875。 |
DeepSeek deepseek-flash |
$0.15-$0.30 | $0.003-$0.006 | $0.60-$1.20 | 较低数字为非高峰;周一至周五 UTC 01:00-04:00 和 06:00-10:00 使用较高数字。 |
DeepSeek deepseek-v4-pro |
$0.66-$1.32 | $0.022-$0.044 | $1.98-$3.96 | 使用相同时段。DeepSeek 称 V4 Pro 服务在 2026 年 9 月 14 日后继续,并沿用此计费方式。 |
| Mistral Mistral Large 3 | $0.50 | $0.05 | $1.50 | Mistral 的表将其标为标准美元费率;Batch、Priority 和区域推理是独立选项。 |
DeepSeek 两行取代了仍见于过时比较中的旧 deepseek-chat 和 deepseek-reasoner 价格。有关模型特定上下文和迁移考虑,请参阅我们的 DeepSeek V4 Pro 定价指南和在中国境外使用 DeepSeek API 指南。
第一方价格不是 Tokenhot 价格
上表是供应商标价基线,不是 Tokenhot 报价。Tokenhot 在其模型目录中发布网关路径和当前费率,这些费率可能因模型、渠道或促销而与第一方定价不同。购买前确认准确路径和显示的计费单位。以下示例只使用表中的第一方费率。
比较网关时,这一区分同样重要。供应商可能将路由、付款、回退或模型访问打包为不同价格。我们的 OpenRouter 替代方案指南涵盖除单位成本外应比较的运营问题。
LLM API 成本公式
从计量使用量而非字数开始。让每个 token 数量表示成功调用以及任何已计费失败或重试调用的总数:
token_cost = (
standard_input_tokens * standard_input_rate
+ cache_write_tokens * cache_write_rate
+ cached_input_tokens * cached_input_rate
+ billed_output_tokens * output_rate
) / 1,000,000
total_cost = token_cost
+ cache_storage_cost
+ tool_call_cost
+ media_or_other_unit_cost
使用供应商的 usage 对象或发票填充这些分桶。不要按字符估算跨供应商 token:tokenizer 不同。不要重复加入推理 token。如果 API 在已计费输出中报告推理或思考 token,billed_output_tokens 已包括它们。Google 明确对包含思考 token 的输出定价;OpenAI 使用记录将推理 token 作为输出 token 的细分公开。
计算示例:缓存加重试开销
假设一个月度 gpt-5.6-luna 工作负载,每个请求都低于长上下文定价阈值,记录如下:
- 1000 万普通输入 token
- 500 万缓存写入 token
- 8000 万缓存输入 token
- 1000 万已计费输出 token,包括任何推理 token
按 9 月 14 日费率,token 账单为:
(10 * $0.20) + (5 * $0.25) + (80 * $0.02) + (10 * $1.20)
= $2.00 + $1.25 + $1.60 + $12.00
= $16.85
如果相同的 9500 万输入 token 全部按普通输入计费,账单将为 $19.00 + $12.00 = $31.00。在这些假设下,缓存会在额外工具费用之前节省 $14.15。
现在加入一个预算情境:重试重放相同 token 组合,使 token 使用量增加 5%。估算变为 $16.85 x 1.05 = $17.6925,最后四舍五入至两位小数后为 $17.69。在生产中,应根据实际重复使用量计算重试成本,因为输出前超时、缓存命中和完整重放的成本不同。
六个会改变答案的计费细节
1. 输出和推理可能主导成本
输出的成本通常是普通输入的数倍。智能体循环还可能生成最终回答中不可见的推理 token。在 API 支持时设置输出和推理限制,并记录完整 usage 记录。一个返回 300 个可见 token 的请求,已计费输出数量仍可能明显更多。
2. 缓存有写入、读取,有时还有存储
只有内容被写入并重复使用后,缓存命中才更便宜。上例中 OpenAI 和 Anthropic 对缓存写入收取溢价。Google 同时列出缓存 token 费率和 token-hour 存储费。分别预测稳定的提示词前缀和变化的用户内容,然后测量命中率,而不是假设每个符合条件的提示词都会被缓存。
3. Batch 折扣以速度换价格
OpenAI GPT-6 Astra、Anthropic 所列模型和 Google Gemini 3.7 Flash 在官方文档中均显示 50% 的 Batch token 费率。Batch 任务是异步的,并受各供应商支持的端点和完成窗口限制。保持交互流量使用标准费率,只将离线分类、评估或回填等可容忍延迟的工作转入 Batch。
4. 长上下文可能触发整次请求倍率
除非供应商如此说明,不要只对阈值之上的 token 使用倍率。GPT-6 Astra 明确规定:输入超过 272K token 时,整次请求的输入/缓存费率为 2x,输出为 1.5x。GPT-5.6 Luna 页面规定 2x 输入和 1.5x 输出,却未明确缓存输入倍率;估算大型缓存请求前确认该缓存处理。Anthropic 称 Claude 4.6 及以后模型的完整 100 万 token 上下文采用标准定价。规则因模型而异,因此应记录每次请求的提示词大小,而不是套用一个全局假设。
5. 工具和重试在标题表之外
服务器端搜索、代码执行、grounding、存储和其他工具可能增加按调用或按使用量计的费用。即使应用显示一次逻辑用户操作,重试也可能重复 token 和工具费用。采用设上限的指数退避,只重试文档规定为瞬态的错误,并附加应用请求 ID,以便追踪重复工作。
6. 图像和视频价格采用不同单位
文本模型 token 费率无法为每种多模态工作负载定价。图像 API 可能按生成图像、每次调用,或按图像 token 和质量收费。视频 API 通常使用秒数、分辨率或生成层级。请保留单独公式,并对结果分类汇总。
Seedream 用于图像生成;Seedance 是字节跳动的视频家族。请让它们的价格和计费单位保持分离。如果你正在变更视频供应商,请使用视频特定比较及我们的 Sora API 迁移指南中的任务生命周期检查。
如何依据真实工作负载选择
按模型和端点导出至少一周有代表性的使用量。分离标准输入、缓存写入、缓存命中、已计费输出、重试、长上下文请求、Batch 流量和工具。针对候选模型重放固定评估集,然后比较任务成功、延迟分布、速率限制和总计费单位。最便宜的一行只有在模型满足质量和运行要求时才有价值。
在任何模型别名、提示词、推理设置、输出上限、路由规则或 tokenizer 变更后重新计算。将每个费率快照的定价页面 URL 和日期保存在电子表格或成本服务中,以便解释后续发票差异。
常见问题
2026 年最便宜的 LLM API 是什么?
不存在通用的最便宜 API。在这个带日期的样本中,DeepSeek Flash 的列出非高峰缓存命中费率最低,而 GPT-5.6 Luna 有简单的低标准费率。你最便宜的有效选项取决于输出量、缓存复用、时段、工具、重试、质量,以及是否可接受批处理。
推理 token 会计费吗?
通常会。Google 表示其输出价格包括思考 token,OpenAI 在输出 token 详情中报告推理 token。请使用供应商的已计费输出总额和该模型文档;不要从可见答案长度推断成本。
提示词缓存总能降低成本吗?
不能。工作负载必须充分重复符合条件的稳定前缀,才能收回缓存写入和任何存储费用。跟踪缓存写入和缓存读取字段,然后按该模型费率计算盈亏平衡点。
我应该只用输入价格比较模型吗?
不应该。使用完整工作负载公式。输出密集生成、智能体推理、工具和重试可能超过输入价格,而 Batch 和缓存命中可以降低成本。
本文价格是 Tokenhot 价格吗?
不是。比较表和计算示例采用的是截至 2026 年 9 月 14 日核查的第一方供应商标价。请单独查看 Tokenhot 模型目录,了解当前网关路径、价格和计费单位。
一份带日期的 LLM API 定价比较,包含可复现的成本公式、一个计算示例,以及标题 token 费率未体现的计费细节。


