LLM API料金比較2026:コスト計算式と料金一覧

LLM API料金比較が役立つのは、すべての数字を同じ課金単位で揃え、実際に実行するワークロードを計算に反映した場合だけです。入力、キャッシュ済み入力、キャッシュ書き込み、出力、非表示の推論、長文コンテキストの割増、ツール、再試行は、それぞれ請求書の別項目になることがあります。
本ガイドでは、2026年9月14日に確認した原開発元のテキストモデル標準料金から、限定的で再現可能なスナップショットを示します。続いて、リクエストのテレメトリから月額を見積もる方法を説明します。料金は米ドル表示で、税金、法人割引、クラウドマーケットプレイスによる調整、地域別の割増は含みません。予算を確定する前に、リンク先の情報を必ず再確認してください。
2026年テキストモデルAPI料金のスナップショット
この表は実用的なサンプルであり、すべてのモデルを網羅したカタログではありません。条件の記載がない限り、各ベンダーの原開発元による標準サービスでの100万トークンあたりの料金です。トークン単価が低くても、モデル間で品質、レイテンシ、信頼性、トークン化が同等であるとは限りません。
| プロバイダーとモデル | 標準入力 | キャッシュ済み入力またはキャッシュヒット | 出力 | 請求額が変わる条件 |
|---|---|---|---|---|
OpenAI gpt-6-astra |
$10.00 | $1.00 | $50.00 | キャッシュ書き込みは$12.50。入力が272Kトークンを超えると、リクエスト全体が入力/キャッシュ料金2倍、出力料金1.5倍で課金されます。BatchとFlexはStandardの50%、Fastは2倍です。 |
OpenAI gpt-5.6-luna |
$0.20 | $0.02 | $1.20 | キャッシュ書き込みは未キャッシュ入力の1.25倍、つまり$0.25。入力が272Kトークンを超えると、リクエスト全体の入力料金は2倍、出力料金は1.5倍です。 |
| Anthropic Claude Sonnet 5 | $2.00 | $0.20 | $10.00 | 5分のキャッシュ書き込みは$2.50、1時間は$4.00。Batchは入力$1.00、出力$5.00です。 |
| Anthropic Claude Haiku 4.5 | $1.00 | $0.10 | $5.00 | 5分のキャッシュ書き込みは$1.25、1時間は$2.00。Batchは入力$0.50、出力$2.50です。 |
Google gemini-3.7-flash |
$0.75 | $0.075 | $3.75 | この料金は2026年12月31日まで適用。キャッシュ済みコンテキストの保存には、100万トークン1時間あたり$0.50もかかります。Batchの入力/出力は$0.375/$1.875です。 |
DeepSeek deepseek-flash |
$0.15-$0.30 | $0.003-$0.006 | $0.60-$1.20 | 低い方がオフピーク、高い方が月~金曜日の01:00~04:00と06:00~10:00 UTCに適用されます。 |
DeepSeek deepseek-v4-pro |
$0.66-$1.32 | $0.022-$0.044 | $1.98-$3.96 | 同じ時間帯が適用されます。DeepSeekによると、V4 Proサービスは2026年9月14日以降もこの課金方式で継続します。 |
| Mistral Mistral Large 3 | $0.50 | $0.05 | $1.50 | Mistralの表では標準USD料金と表示されています。Batch、Priority、地域別推論は別の選択肢です。 |
DeepSeekの行では、古い比較記事に残っているdeepseek-chatとdeepseek-reasonerの料金を置き換えています。モデル固有のコンテキストと移行時の注意点については、DeepSeek V4 Pro料金ガイドと中国国外からDeepSeek APIを使用するガイドを参照してください。
原開発元の料金はTokenhotの料金ではない
上の表はベンダーの標準価格を基準にしたものです。Tokenhotの見積もりではありません。Tokenhotは、ゲートウェイルートと現在の料金をモデルカタログで公開しており、モデル、チャネル、プロモーションによって原開発元の料金と異なる場合があります。購入前に、正確なルートと表示されている課金単位を確認してください。以下の例では、表にある原開発元の料金だけを使用します。
この区別はゲートウェイを比較する場合にも重要です。プロバイダーは、ルーティング、支払い、フォールバック、モデルへのアクセスを異なる価格に組み込む場合があります。OpenRouter代替サービスガイドでは、単価とあわせて比較すべき運用上の項目を説明しています。
LLM APIのコスト計算式
単語数ではなく、計測された使用量から始めます。各トークン数は、成功した呼び出しに加え、課金対象となった失敗または再試行された呼び出しの合計とします。
token_cost = (
standard_input_tokens * standard_input_rate
+ cache_write_tokens * cache_write_rate
+ cached_input_tokens * cached_input_rate
+ billed_output_tokens * output_rate
) / 1,000,000
total_cost = token_cost
+ cache_storage_cost
+ tool_call_cost
+ media_or_other_unit_cost
各項目には、プロバイダーのusageオブジェクトまたは請求書の値を使用します。ベンダーによってトークナイザーが異なるため、文字数から一律にトークンを推定しないでください。推論トークンを二重に加算してはいけません。APIが推論またはthinkingトークンを課金出力の中で報告する場合、それらはすでにbilled_output_tokensに含まれます。Googleはthinkingトークンを含む出力に明示的に料金を設定し、OpenAIのusage記録では推論トークンが出力トークンの内訳として示されます。
計算例:キャッシュと再試行のオーバーヘッド
長文コンテキスト料金のしきい値を下回るリクエストだけで構成された月間gpt-5.6-lunaワークロードが、次の使用量を記録したとします。
- 通常入力1,000万トークン
- キャッシュ書き込み500万トークン
- キャッシュ済み入力8,000万トークン
- 推論トークンを含む課金出力1,000万トークン
9月14日時点の料金では、トークン料金は次のとおりです。
(10 * $0.20) + (5 * $0.25) + (80 * $0.02) + (10 * $1.20)
= $2.00 + $1.25 + $1.60 + $12.00
= $16.85
同じ9,500万入力トークンがすべて通常入力として課金される場合、請求額は$19.00 + $12.00 = $31.00です。この前提では、追加のツール料金を考慮する前のキャッシュ節約額は$14.15です。
次に、再試行で同じトークン構成が再送され、トークン使用量が5%増える予算シナリオを加えます。見積もりは$16.85 x 1.05 = $17.6925となり、最後に丸めると**$17.69**です。本番では、出力前のタイムアウト、キャッシュヒット、完全な再送では料金が異なるため、実際に重複した使用量から再試行コストを計算してください。
答えを変える6つの課金要素
1. 出力と推論がコストの中心になる場合がある
出力料金は、通常入力料金の数倍になることがよくあります。エージェントループでは、最終回答に表示されない推論トークンが生成される場合もあります。APIが対応している場合は出力と推論に上限を設け、完全なusage記録をログに残してください。表示上は300トークンの回答でも、課金出力数が大幅に多いことがあります。
2. キャッシュには書き込み、読み取り、場合によっては保存料金がある
キャッシュヒットが安くなるのは、コンテンツを書き込み、再利用してからです。上の例ではOpenAIとAnthropicがキャッシュ書き込みに割増料金を設定しています。Googleはキャッシュ済みトークン料金とtoken-hour単位の保存料金を掲載しています。安定したプロンプト接頭辞と変化するユーザーコンテンツを分けて予測し、対象プロンプトがすべてキャッシュされると仮定せず、実際のヒット率を測定してください。
3. バッチ割引は速度と価格を交換する
OpenAI GPT-6 Astra、Anthropicの掲載モデル、Google Gemini 3.7 Flashの公式ドキュメントでは、バッチのトークン料金が50%になっています。バッチジョブは非同期で、各プロバイダーが対応するエンドポイントと完了時間枠に従います。インタラクティブなトラフィックは標準料金のままにし、オフライン分類、評価、バックフィルなど、遅延を許容できる処理だけを移してください。
4. 長文コンテキストでリクエスト全体に倍率が適用される場合がある
ベンダーが明記していない限り、しきい値を超えたトークンだけに倍率を適用してはいけません。GPT-6 Astraは、入力が272Kトークンを超えると、リクエスト全体の入力/キャッシュ料金を2倍、出力料金を1.5倍にすると明記しています。GPT-5.6 Lunaのページでは入力2倍、出力1.5倍としていますが、キャッシュ済み入力への倍率は明示していません。キャッシュを使った大規模リクエストを見積もる前に、その扱いを確認してください。Anthropicによると、Claude 4.6以降のモデルでは100万トークンの全コンテキストが標準料金に含まれます。ルールはモデルごとに異なるため、1つの仮定を全体へ適用せず、リクエスト単位でプロンプトサイズを記録します。
5. ツールと再試行は公称料金表の外にある
サーバー側検索、コード実行、グラウンディング、ストレージなどのツールでは、呼び出し単位または使用量ベースの追加料金が発生する場合があります。アプリケーション上は1つのユーザー操作に見えても、再試行によってトークン料金とツール料金が重複することがあります。上限付き指数バックオフを使い、一時的と文書化されたエラーだけを再試行し、重複処理を追跡できるようアプリケーションのリクエストIDを付けてください。
6. 画像と動画では別の課金単位を使う
テキストモデルのトークン料金だけでは、すべてのマルチモーダルワークロードを計算できません。画像APIは、生成画像単位、呼び出し単位、または画像トークンと品質で課金する場合があります。動画APIでは、秒数、解像度、生成ティアがよく使われます。計算式を分け、最後に小計を合算してください。
Seedreamは画像生成用、SeedanceはByteDanceの動画モデルファミリーです。料金と課金単位を分けてください。動画プロバイダーを変更する場合は、動画固有の比較とSora API移行ガイドにあるタスクライフサイクルの確認事項を使用してください。
実ワークロードのコストで選ぶ方法
モデルとエンドポイント別に、少なくとも代表的な1週間分の使用量をエクスポートします。標準入力、キャッシュ書き込み、キャッシュヒット、課金出力、再試行、長文コンテキストのリクエスト、バッチトラフィック、ツールを分けてください。固定した評価セットを候補モデルで再生し、タスク成功率、レイテンシ分布、レート制限、課金単位の合計を比較します。最も安い行が役立つのは、そのモデルが品質と運用要件を満たす場合だけです。
モデルの別名、プロンプト、推論設定、出力上限、ルーティング規則、トークナイザーが変わるたびに再計算してください。料金ページのURLと各料金スナップショットの日付をスプレッドシートやコスト管理サービスに保存し、後から請求額の差異を説明できるようにします。
よくある質問
2026年で最も安いLLM APIはどれですか?
すべての用途で最も安いAPIはありません。この日付付きサンプルでは、DeepSeek Flashのオフピーク時キャッシュヒット料金が最安で、GPT-5.6 Lunaはシンプルで低い標準料金です。実際に最安となる有効な選択肢は、出力量、キャッシュ再利用、時間帯、ツール、再試行、品質、バッチ処理を許容できるかどうかで変わります。
推論トークンは課金されますか?
多くの場合は課金されます。Googleは出力料金にthinkingトークンが含まれると明記し、OpenAIは出力トークンの詳細内で推論トークンを報告します。表示された回答の長さから推測せず、対象モデルの課金出力合計とプロバイダーのドキュメントを使ってください。
プロンプトキャッシュは必ずコストを削減しますか?
いいえ。キャッシュ書き込みと保存料金がある場合はそれを回収できる回数だけ、対象となる安定した接頭辞を再利用する必要があります。キャッシュ書き込みと読み取りのフィールドを追跡し、そのモデルの料金から損益分岐点を計算してください。
入力料金だけでモデルを比較してもよいですか?
いいえ。ワークロード全体の計算式を使用してください。出力の多い生成、エージェント推論、ツール、再試行が入力料金を上回る場合がある一方、バッチとキャッシュヒットは料金を下げることがあります。
この記事の料金はTokenhotの料金ですか?
いいえ。比較表と計算例には、2026年9月14日に確認した原開発元ベンダーの標準料金を使用しています。現在のゲートウェイルート、料金、課金単位はTokenhotモデルカタログで別途確認してください。
日付付きのLLM API料金比較です。再現可能なコスト計算式、計算例、公称トークン料金だけでは分からない課金の詳細をまとめます。


