定價

2026 年 LLM API 定價比較:成本公式與費率

TTokenhot Team2026年8月14日更新於 2026年9月14日約 11 分鐘閱讀
2026 年 LLM API 定價比較:成本公式與費率

只有每個數字都使用相同計費單位,且計算反映你實際執行的工作負載時,LLM API 定價比較才有用。輸入、快取輸入、快取寫入、輸出、隱藏推理、長上下文加價、工具和重試,都可能出現在帳單的不同項目。

本指南提供截至 2026 年 9 月 14 日查核的第一方文字模型牌價之有限、可重現快照,接著說明如何將請求遙測資料轉為每月估算。價格皆為稅前美元,未含企業折扣、雲端市集調整或區域溢價。承諾預算前,務必重新查核連結來源。

2026 年文字模型 API 定價快照

此表是實用樣本,不是每個模型的目錄。除非註明條件,費率皆為各供應商第一方標準服務每百萬 token 的價格。較低的 token 價格不代表模型在品質、延遲、可靠性或 tokenization 上相同。

供應商和模型 標準輸入 快取輸入或快取命中 輸出 會改變帳單的條件
OpenAI gpt-6-astra $10.00 $1.00 $50.00 快取寫入為 $12.50。輸入超過 272K token 時,整個請求按 2x 輸入/快取費率和 1.5x 輸出計費。Batch 和 Flex 為 Standard 的 50%;Fast 為 2x。
OpenAI gpt-5.6-luna $0.20 $0.02 $1.20 快取寫入為未快取輸入的 1.25x,即 $0.25。輸入超過 272K token 時,整個請求為 2x 輸入和 1.5x 輸出。
Anthropic Claude Sonnet 5 $2.00 $0.20 $10.00 5 分鐘快取寫入為 $2.50,1 小時寫入為 $4.00。Batch 輸入為 $1.00,輸出為 $5.00。
Anthropic Claude Haiku 4.5 $1.00 $0.10 $5.00 5 分鐘快取寫入為 $1.25,1 小時寫入為 $2.00。Batch 輸入為 $0.50,輸出為 $2.50。
Google gemini-3.7-flash $0.75 $0.075 $3.75 此費率適用至 2026 年 12 月 31 日。快取上下文另按每百萬 token 每小時 $0.50 收取儲存費。Batch 輸入/輸出為 $0.375/$1.875。
DeepSeek deepseek-flash $0.15-$0.30 $0.003-$0.006 $0.60-$1.20 較低數字為離峰;週一至週五 UTC 01:00-04:00 和 06:00-10:00 使用較高數字。
DeepSeek deepseek-v4-pro $0.66-$1.32 $0.022-$0.044 $1.98-$3.96 使用相同時段。DeepSeek 表示 V4 Pro 服務於 2026 年 9 月 14 日後持續,並沿用此計費方式。
Mistral Mistral Large 3 $0.50 $0.05 $1.50 Mistral 的表格將其標為標準美元費率;Batch、Priority 和區域推理是獨立選項。

DeepSeek 兩列取代了仍出現在過時比較中的舊 deepseek-chat 和 deepseek-reasoner 價格。模型特定上下文和遷移考量請見 DeepSeek V4 Pro 定價指南與在中國境外使用 DeepSeek API 指南。

第一方價格不是 Tokenhot 價格

上表是供應商牌價基線,不是 Tokenhot 報價。Tokenhot 在其模型目錄發布閘道路徑與現行費率;這些費率可能依模型、管道或促銷而與第一方定價不同。購買前確認精確路徑和顯示的計費單位。以下範例僅使用表中的第一方費率。

比較閘道時,這項區分同樣重要。供應商可能將路由、付款、備援或模型存取打包為不同價格。我們的 OpenRouter 替代方案指南涵蓋除了單位成本以外應比較的營運問題。

LLM API 成本公式

從計量使用量而非字數開始。讓每個 token 數量表示成功呼叫以及所有已計費失敗或重試呼叫的總數:

token_cost = (
    standard_input_tokens * standard_input_rate
  + cache_write_tokens     * cache_write_rate
  + cached_input_tokens    * cached_input_rate
  + billed_output_tokens   * output_rate
) / 1,000,000

total_cost = token_cost
           + cache_storage_cost
           + tool_call_cost
           + media_or_other_unit_cost

用供應商的 usage 物件或發票填入這些分桶。不要依字元估算跨供應商 token:tokenizer 不同。不要重複加入推理 token。若 API 在已計費輸出內報告推理或思考 token,billed_output_tokens 已包含它們。Google 明確為包含 thinking tokens 的輸出定價;OpenAI 使用紀錄把推理 token 作為輸出 token 細分公開。

計算範例:快取加重試額外負擔

假設月度 gpt-5.6-luna 工作負載的每個請求都低於長上下文定價門檻,紀錄如下:

  • 1,000 萬普通輸入 token
  • 500 萬快取寫入 token
  • 8,000 萬快取輸入 token
  • 1,000 萬已計費輸出 token,包括任何推理 token

依 9 月 14 日費率,token 帳單為:

(10 * $0.20) + (5 * $0.25) + (80 * $0.02) + (10 * $1.20)
= $2.00 + $1.25 + $1.60 + $12.00
= $16.85

若同樣的 9,500 萬輸入 token 全按普通輸入計費,帳單會是 $19.00 + $12.00 = $31.00。在這些假設下,快取會在額外工具費之前節省 $14.15。

現在加入一個預算情境:重試重播相同 token 組合,使 token 使用量提高 5%。估算變成 $16.85 x 1.05 = $17.6925,最後四捨五入至小數點後兩位為 $17.69。正式環境中,應依實際重複使用量計算重試成本,因為輸出前逾時、快取命中和完整重播的成本不同。

六個會改變答案的計費細節

1. 輸出和推理可能主導成本

輸出通常比普通輸入貴數倍。Agent 迴圈也可能產生最終回答看不到的推理 token。API 支援時設定輸出和推理限制,並記錄完整 usage 紀錄。回傳 300 個可見 token 的請求,已計費輸出數仍可能大得多。

2. 快取有寫入、讀取,有時還有儲存

內容寫入並重複使用後,快取命中才較便宜。上述例子中 OpenAI 和 Anthropic 對快取寫入收取溢價。Google 同時列出快取 token 費率和 token-hour 儲存費。分別預測穩定的提示詞前綴與變動的使用者內容,然後量測命中率,不要假設每個合格提示詞都會快取。

3. Batch 折扣以速度交換價格

OpenAI GPT-6 Astra、Anthropic 所列模型和 Google Gemini 3.7 Flash 的官方文件都顯示 50% Batch token 費率。Batch 工作為非同步,受各供應商支援端點和完成窗口限制。互動流量維持標準費率,只把離線分類、評估或回填等可容忍延遲的工作移至 Batch。

4. 長上下文可能觸發整個請求倍率

除非供應商如此說明,別只對門檻以上的 token 套用倍率。GPT-6 Astra 明確規定輸入超過 272K token 時,整個請求的輸入/快取費率為 2x、輸出為 1.5x。GPT-5.6 Luna 頁面規定 2x 輸入和 1.5x 輸出,卻未明定快取輸入倍率;估算大型快取請求前先確認其快取處理。Anthropic 表示 Claude 4.6 及後續模型的完整一百萬 token 上下文採標準定價。規則依模型而異,應記錄每次請求的提示詞大小,而非套用全域假設。

5. 工具和重試位於標題表之外

伺服器端搜尋、程式碼執行、grounding、儲存和其他工具可能增加每次呼叫或依使用量計費。即使應用程式顯示一次邏輯使用者操作,重試也可能重複 token 和工具費用。採用有上限的指數退避,只重試文件列為暫時性的錯誤,並附上應用程式請求 ID 以追蹤重複工作。

6. 圖像和影片價格採不同單位

文字模型 token 費率不能為每一種多模態工作負載定價。圖像 API 可能按生成圖像、每次呼叫,或按圖像 token 和品質收費;影片 API 常用秒數、解析度或生成層級。請保留獨立公式並彙總分類結果。

Seedream 用於圖像生成;Seedance 是字節跳動影片家族。請將它們的價格和計費單位分開。若正在更換影片供應商,請使用影片特定比較及 Sora API 遷移指南中的任務生命週期檢查。

如何依真實工作負載選擇

依模型和端點匯出至少一週有代表性的使用量。分開標準輸入、快取寫入、快取命中、已計費輸出、重試、長上下文請求、Batch 流量和工具。針對候選模型重播固定評估集,再比較任務成功、延遲分布、速率限制和總計費單位。最便宜的一列僅在模型符合品質和營運要求時才有價值。

任何模型別名、提示詞、推理設定、輸出上限、路由規則或 tokenizer 改變後都要重新計算。將每個費率快照的定價頁 URL 和日期保存於試算表或成本服務,以便解釋日後的發票差異。

常見問題

2026 年最便宜的 LLM API 是什麼?

沒有通用最便宜的 API。在這個附日期樣本中,DeepSeek Flash 的列出離峰快取命中費率最低,而 GPT-5.6 Luna 有簡單的低標準費率。最便宜的有效選項取決於輸出量、快取重用、時段、工具、重試、品質,以及是否可接受批次處理。

推理 token 會計費嗎?

通常會。Google 表示其輸出價格包含 thinking tokens,OpenAI 在輸出 token 詳細資料中回報推理 token。請使用供應商的已計費輸出總額和模型文件;不要從可見答案長度推斷成本。

提示詞快取一定能降低成本嗎?

不一定。工作負載必須充分重複合格的穩定前綴,才能回收快取寫入及任何儲存費。追蹤快取寫入和快取讀取欄位,再以該模型費率計算損益平衡點。

我應該只用輸入價格比較模型嗎?

不應該。請使用完整工作負載公式。輸出密集生成、Agent 推理、工具和重試可能超過輸入價格,而 Batch 和快取命中可降低成本。

本文價格是 Tokenhot 價格嗎?

不是。比較表和計算範例採用截至 2026 年 9 月 14 日查核的第一方供應商牌價。請另外查看 Tokenhot 模型目錄,取得現行閘道路徑、價格和計費單位。

文章精要

一份附日期的 LLM API 定價比較,包含可重現的成本公式、計算範例,以及標題 token 費率未呈現的計費細節。

相關文章