2026 年 LLM API 定價比較:成本公式與費率

只有每個數字都使用相同計費單位,且計算反映你實際執行的工作負載時,LLM API 定價比較才有用。輸入、快取輸入、快取寫入、輸出、隱藏推理、長上下文加價、工具和重試,都可能出現在帳單的不同項目。
本指南提供截至 2026 年 9 月 14 日查核的第一方文字模型牌價之有限、可重現快照,接著說明如何將請求遙測資料轉為每月估算。價格皆為稅前美元,未含企業折扣、雲端市集調整或區域溢價。承諾預算前,務必重新查核連結來源。
2026 年文字模型 API 定價快照
此表是實用樣本,不是每個模型的目錄。除非註明條件,費率皆為各供應商第一方標準服務每百萬 token 的價格。較低的 token 價格不代表模型在品質、延遲、可靠性或 tokenization 上相同。
| 供應商和模型 | 標準輸入 | 快取輸入或快取命中 | 輸出 | 會改變帳單的條件 |
|---|---|---|---|---|
OpenAI gpt-6-astra |
$10.00 | $1.00 | $50.00 | 快取寫入為 $12.50。輸入超過 272K token 時,整個請求按 2x 輸入/快取費率和 1.5x 輸出計費。Batch 和 Flex 為 Standard 的 50%;Fast 為 2x。 |
OpenAI gpt-5.6-luna |
$0.20 | $0.02 | $1.20 | 快取寫入為未快取輸入的 1.25x,即 $0.25。輸入超過 272K token 時,整個請求為 2x 輸入和 1.5x 輸出。 |
| Anthropic Claude Sonnet 5 | $2.00 | $0.20 | $10.00 | 5 分鐘快取寫入為 $2.50,1 小時寫入為 $4.00。Batch 輸入為 $1.00,輸出為 $5.00。 |
| Anthropic Claude Haiku 4.5 | $1.00 | $0.10 | $5.00 | 5 分鐘快取寫入為 $1.25,1 小時寫入為 $2.00。Batch 輸入為 $0.50,輸出為 $2.50。 |
Google gemini-3.7-flash |
$0.75 | $0.075 | $3.75 | 此費率適用至 2026 年 12 月 31 日。快取上下文另按每百萬 token 每小時 $0.50 收取儲存費。Batch 輸入/輸出為 $0.375/$1.875。 |
DeepSeek deepseek-flash |
$0.15-$0.30 | $0.003-$0.006 | $0.60-$1.20 | 較低數字為離峰;週一至週五 UTC 01:00-04:00 和 06:00-10:00 使用較高數字。 |
DeepSeek deepseek-v4-pro |
$0.66-$1.32 | $0.022-$0.044 | $1.98-$3.96 | 使用相同時段。DeepSeek 表示 V4 Pro 服務於 2026 年 9 月 14 日後持續,並沿用此計費方式。 |
| Mistral Mistral Large 3 | $0.50 | $0.05 | $1.50 | Mistral 的表格將其標為標準美元費率;Batch、Priority 和區域推理是獨立選項。 |
DeepSeek 兩列取代了仍出現在過時比較中的舊 deepseek-chat 和 deepseek-reasoner 價格。模型特定上下文和遷移考量請見 DeepSeek V4 Pro 定價指南與在中國境外使用 DeepSeek API 指南。
第一方價格不是 Tokenhot 價格
上表是供應商牌價基線,不是 Tokenhot 報價。Tokenhot 在其模型目錄發布閘道路徑與現行費率;這些費率可能依模型、管道或促銷而與第一方定價不同。購買前確認精確路徑和顯示的計費單位。以下範例僅使用表中的第一方費率。
比較閘道時,這項區分同樣重要。供應商可能將路由、付款、備援或模型存取打包為不同價格。我們的 OpenRouter 替代方案指南涵蓋除了單位成本以外應比較的營運問題。
LLM API 成本公式
從計量使用量而非字數開始。讓每個 token 數量表示成功呼叫以及所有已計費失敗或重試呼叫的總數:
token_cost = (
standard_input_tokens * standard_input_rate
+ cache_write_tokens * cache_write_rate
+ cached_input_tokens * cached_input_rate
+ billed_output_tokens * output_rate
) / 1,000,000
total_cost = token_cost
+ cache_storage_cost
+ tool_call_cost
+ media_or_other_unit_cost
用供應商的 usage 物件或發票填入這些分桶。不要依字元估算跨供應商 token:tokenizer 不同。不要重複加入推理 token。若 API 在已計費輸出內報告推理或思考 token,billed_output_tokens 已包含它們。Google 明確為包含 thinking tokens 的輸出定價;OpenAI 使用紀錄把推理 token 作為輸出 token 細分公開。
計算範例:快取加重試額外負擔
假設月度 gpt-5.6-luna 工作負載的每個請求都低於長上下文定價門檻,紀錄如下:
- 1,000 萬普通輸入 token
- 500 萬快取寫入 token
- 8,000 萬快取輸入 token
- 1,000 萬已計費輸出 token,包括任何推理 token
依 9 月 14 日費率,token 帳單為:
(10 * $0.20) + (5 * $0.25) + (80 * $0.02) + (10 * $1.20)
= $2.00 + $1.25 + $1.60 + $12.00
= $16.85
若同樣的 9,500 萬輸入 token 全按普通輸入計費,帳單會是 $19.00 + $12.00 = $31.00。在這些假設下,快取會在額外工具費之前節省 $14.15。
現在加入一個預算情境:重試重播相同 token 組合,使 token 使用量提高 5%。估算變成 $16.85 x 1.05 = $17.6925,最後四捨五入至小數點後兩位為 $17.69。正式環境中,應依實際重複使用量計算重試成本,因為輸出前逾時、快取命中和完整重播的成本不同。
六個會改變答案的計費細節
1. 輸出和推理可能主導成本
輸出通常比普通輸入貴數倍。Agent 迴圈也可能產生最終回答看不到的推理 token。API 支援時設定輸出和推理限制,並記錄完整 usage 紀錄。回傳 300 個可見 token 的請求,已計費輸出數仍可能大得多。
2. 快取有寫入、讀取,有時還有儲存
內容寫入並重複使用後,快取命中才較便宜。上述例子中 OpenAI 和 Anthropic 對快取寫入收取溢價。Google 同時列出快取 token 費率和 token-hour 儲存費。分別預測穩定的提示詞前綴與變動的使用者內容,然後量測命中率,不要假設每個合格提示詞都會快取。
3. Batch 折扣以速度交換價格
OpenAI GPT-6 Astra、Anthropic 所列模型和 Google Gemini 3.7 Flash 的官方文件都顯示 50% Batch token 費率。Batch 工作為非同步,受各供應商支援端點和完成窗口限制。互動流量維持標準費率,只把離線分類、評估或回填等可容忍延遲的工作移至 Batch。
4. 長上下文可能觸發整個請求倍率
除非供應商如此說明,別只對門檻以上的 token 套用倍率。GPT-6 Astra 明確規定輸入超過 272K token 時,整個請求的輸入/快取費率為 2x、輸出為 1.5x。GPT-5.6 Luna 頁面規定 2x 輸入和 1.5x 輸出,卻未明定快取輸入倍率;估算大型快取請求前先確認其快取處理。Anthropic 表示 Claude 4.6 及後續模型的完整一百萬 token 上下文採標準定價。規則依模型而異,應記錄每次請求的提示詞大小,而非套用全域假設。
5. 工具和重試位於標題表之外
伺服器端搜尋、程式碼執行、grounding、儲存和其他工具可能增加每次呼叫或依使用量計費。即使應用程式顯示一次邏輯使用者操作,重試也可能重複 token 和工具費用。採用有上限的指數退避,只重試文件列為暫時性的錯誤,並附上應用程式請求 ID 以追蹤重複工作。
6. 圖像和影片價格採不同單位
文字模型 token 費率不能為每一種多模態工作負載定價。圖像 API 可能按生成圖像、每次呼叫,或按圖像 token 和品質收費;影片 API 常用秒數、解析度或生成層級。請保留獨立公式並彙總分類結果。
Seedream 用於圖像生成;Seedance 是字節跳動影片家族。請將它們的價格和計費單位分開。若正在更換影片供應商,請使用影片特定比較及 Sora API 遷移指南中的任務生命週期檢查。
如何依真實工作負載選擇
依模型和端點匯出至少一週有代表性的使用量。分開標準輸入、快取寫入、快取命中、已計費輸出、重試、長上下文請求、Batch 流量和工具。針對候選模型重播固定評估集,再比較任務成功、延遲分布、速率限制和總計費單位。最便宜的一列僅在模型符合品質和營運要求時才有價值。
任何模型別名、提示詞、推理設定、輸出上限、路由規則或 tokenizer 改變後都要重新計算。將每個費率快照的定價頁 URL 和日期保存於試算表或成本服務,以便解釋日後的發票差異。
常見問題
2026 年最便宜的 LLM API 是什麼?
沒有通用最便宜的 API。在這個附日期樣本中,DeepSeek Flash 的列出離峰快取命中費率最低,而 GPT-5.6 Luna 有簡單的低標準費率。最便宜的有效選項取決於輸出量、快取重用、時段、工具、重試、品質,以及是否可接受批次處理。
推理 token 會計費嗎?
通常會。Google 表示其輸出價格包含 thinking tokens,OpenAI 在輸出 token 詳細資料中回報推理 token。請使用供應商的已計費輸出總額和模型文件;不要從可見答案長度推斷成本。
提示詞快取一定能降低成本嗎?
不一定。工作負載必須充分重複合格的穩定前綴,才能回收快取寫入及任何儲存費。追蹤快取寫入和快取讀取欄位,再以該模型費率計算損益平衡點。
我應該只用輸入價格比較模型嗎?
不應該。請使用完整工作負載公式。輸出密集生成、Agent 推理、工具和重試可能超過輸入價格,而 Batch 和快取命中可降低成本。
本文價格是 Tokenhot 價格嗎?
不是。比較表和計算範例採用截至 2026 年 9 月 14 日查核的第一方供應商牌價。請另外查看 Tokenhot 模型目錄,取得現行閘道路徑、價格和計費單位。
一份附日期的 LLM API 定價比較,包含可重現的成本公式、計算範例,以及標題 token 費率未呈現的計費細節。


