Comparaison des tarifs API LLM 2026 : formule de coût et tarifs

Une comparaison de tarifs API LLM n’est utile que si chaque nombre emploie la même unité de facturation et si le calcul reflète la charge réellement exécutée. Entrée, entrée mise en cache, écritures de cache, sortie, raisonnement caché, majorations de contexte long, outils et nouvelles tentatives peuvent tous figurer sur des lignes différentes de la facture.
Ce guide fournit un instantané limité et reproductible des prix catalogue de modèles texte propriétaires vérifiés le 14 septembre 2026. Il montre ensuite comment transformer la télémétrie des requêtes en estimation mensuelle. Les prix sont en dollars US avant impôts, remises entreprise, ajustements de marketplace cloud ou majorations régionales. Vérifiez toujours à nouveau la source liée avant d’engager un budget.
Instantané des tarifs API de modèles texte en 2026
Le tableau est un échantillon pratique, non un catalogue de chaque modèle. Les tarifs sont par million de tokens sur le service standard propriétaire de chaque fournisseur sauf condition indiquée. Un prix de token inférieur ne prouve pas une qualité, latence, fiabilité ou tokenisation identiques entre modèles.
| Fournisseur et modèle | Entrée standard | Entrée mise en cache ou hit de cache | Sortie | Conditions qui modifient la facture |
|---|---|---|---|---|
OpenAI gpt-6-astra |
$10.00 | $1.00 | $50.00 | Les écritures de cache coûtent $12.50. Au-delà de 272K tokens d’entrée, la requête entière est facturée à 2x pour entrée/cache et 1.5x pour sortie. Batch et Flex coûtent 50% de Standard ; Fast coûte 2x. |
OpenAI gpt-5.6-luna |
$0.20 | $0.02 | $1.20 | Les écritures de cache coûtent 1.25x l’entrée non mise en cache, soit $0.25. Au-delà de 272K tokens d’entrée, la requête entière coûte 2x l’entrée et 1.5x la sortie. |
| Anthropic Claude Sonnet 5 | $2.00 | $0.20 | $10.00 | Une écriture de cache de 5 minutes coûte $2.50 et une écriture d’1 heure $4.00. Batch coûte $1.00 en entrée et $5.00 en sortie. |
| Anthropic Claude Haiku 4.5 | $1.00 | $0.10 | $5.00 | Une écriture de cache de 5 minutes coûte $1.25 et une écriture d’1 heure $2.00. Batch coûte $0.50 en entrée et $2.50 en sortie. |
Google gemini-3.7-flash |
$0.75 | $0.075 | $3.75 | Ces tarifs courent jusqu’au 31 décembre 2026. Le contexte mis en cache coûte aussi $0.50 par million de tokens par heure à stocker. L’entrée/sortie Batch est $0.375/$1.875. |
DeepSeek deepseek-flash |
$0.15-$0.30 | $0.003-$0.006 | $0.60-$1.20 | Les chiffres bas sont hors pointe ; les chiffres hauts s’appliquent 01:00-04:00 et 06:00-10:00 UTC, lundi-vendredi. |
DeepSeek deepseek-v4-pro |
$0.66-$1.32 | $0.022-$0.044 | $1.98-$3.96 | Les mêmes plages horaires s’appliquent. DeepSeek indique que le service V4 Pro continue après le 14 septembre 2026 avec cette méthode de facturation. |
| Mistral Mistral Large 3 | $0.50 | $0.05 | $1.50 | Le tableau Mistral les étiquette tarifs USD standard ; Batch, Priority et inférence régionale sont des choix distincts. |
Les lignes DeepSeek remplacent les anciens prix deepseek-chat et deepseek-reasoner encore présents dans des comparaisons obsolètes. Pour le contexte spécifique au modèle et les considérations de migration, consultez notre guide des tarifs DeepSeek V4 Pro et le guide d’utilisation de l’API DeepSeek hors de Chine.
Les prix propriétaires ne sont pas des prix Tokenhot
Le tableau ci-dessus est une base de tarifs catalogue fournisseur. Ce n’est pas un devis Tokenhot. Tokenhot publie les routes de passerelle et tarifs actuels dans son catalogue de modèles, et ces tarifs peuvent différer du prix propriétaire par modèle, canal ou promotion. Confirmez la route exacte et l’unité de facturation affichée avant achat. Les exemples ci-dessous emploient uniquement les tarifs propriétaires du tableau.
Cette séparation importe aussi lors de la comparaison de passerelles. Un fournisseur peut inclure routage, paiement, repli ou accès aux modèles dans un prix différent. Notre guide des alternatives à OpenRouter couvre les questions opérationnelles à comparer avec le coût unitaire.
La formule de coût API LLM
Partez de l’usage mesuré, non des comptages de mots. Chaque quantité de tokens représente le total des appels réussis et des appels facturés échoués ou relancés :
token_cost = (
standard_input_tokens * standard_input_rate
+ cache_write_tokens * cache_write_rate
+ cached_input_tokens * cached_input_rate
+ billed_output_tokens * output_rate
) / 1,000,000
total_cost = token_cost
+ cache_storage_cost
+ tool_call_cost
+ media_or_other_unit_cost
Utilisez l’objet d’usage ou la facture du fournisseur pour remplir les catégories. N’estimez pas les tokens à partir des caractères entre fournisseurs : les tokenizers diffèrent. N’ajoutez pas deux fois les tokens de raisonnement. Si l’API signale les tokens de raisonnement ou thinking dans la sortie facturée, billed_output_tokens les comprend déjà. Google tarifie explicitement la sortie, tokens de thinking inclus ; les relevés d’usage OpenAI exposent les tokens de raisonnement comme ventilation des tokens de sortie.
Exemple chiffré : cache et surcharge de nouvelles tentatives
Supposez une charge mensuelle gpt-5.6-luna, dont chaque requête reste sous le seuil de contexte long, avec :
- 10 millions de tokens d’entrée ordinaires
- 5 millions de tokens d’écriture de cache
- 80 millions de tokens d’entrée mis en cache
- 10 millions de tokens de sortie facturés, y compris les éventuels tokens de raisonnement
Aux tarifs du 14 septembre, la facture de tokens est :
(10 * $0.20) + (5 * $0.25) + (80 * $0.02) + (10 * $1.20)
= $2.00 + $1.25 + $1.60 + $12.00
= $16.85
Si ces 95 millions de tokens d’entrée étaient tous facturés comme entrée ordinaire, la facture serait $19.00 + $12.00 = $31.00. Avec ces hypothèses, le cache économise $14.15 avant les frais d’outils supplémentaires.
Ajoutez maintenant un scénario budgétaire où les nouvelles tentatives rejouent le même mélange de tokens et augmentent l’usage de tokens de 5%. L’estimation devient $16.85 x 1.05 = $17.6925, soit $17.69 après arrondi final. En production, calculez le coût de nouvelle tentative à partir de l’usage dupliqué réel, car un délai avant sortie, un hit de cache et une relecture complète n’ont pas le même coût.
Six détails de facturation qui changent la réponse
1. La sortie et le raisonnement peuvent dominer le coût
La sortie coûte souvent plusieurs fois plus que l’entrée ordinaire. Les boucles d’agents peuvent aussi générer des tokens de raisonnement invisibles dans la réponse finale. Fixez des limites de sortie et de raisonnement lorsque l’API les prend en charge, et journalisez l’enregistrement d’usage complet. Une requête qui renvoie 300 tokens visibles peut néanmoins avoir un compte de sortie facturé sensiblement plus grand.
2. Le cache comprend des écritures, lectures et parfois du stockage
Un hit de cache devient moins cher seulement après l’écriture et la réutilisation du contenu. OpenAI et Anthropic facturent une prime pour les écritures de cache dans les exemples ci-dessus. Prévoyez séparément les préfixes stables de prompt et le contenu utilisateur changeant, puis mesurez le taux de hit au lieu de supposer que chaque prompt éligible est mis en cache.
3. Les remises Batch échangent vitesse contre prix
OpenAI GPT-6 Astra, les modèles Anthropic listés et Google Gemini 3.7 Flash affichent des tarifs de tokens Batch 50% dans leur documentation officielle. Les tâches Batch sont asynchrones et soumises aux endpoints et fenêtres de réalisation pris en charge par chaque fournisseur. Gardez le trafic interactif aux tarifs standard et ne déplacez que les travaux tolérant le délai, tels que classification hors ligne, évaluation ou backfills.
4. Le contexte long peut déclencher un multiplicateur sur toute la requête
Ne multipliez pas uniquement les tokens au-dessus d’un seuil, sauf indication du fournisseur. Au-delà de 272K tokens d’entrée, GPT-6 Astra applique explicitement 2x aux tarifs entrée/cache et 1.5x à la sortie pour la requête entière. La page GPT-5.6 Luna spécifie 2x l’entrée et 1.5x la sortie sans définir explicitement un multiplicateur pour l’entrée mise en cache ; confirmez ce traitement avant d’estimer une grande requête mise en cache. Anthropic indique que les modèles Claude 4.6 et ultérieurs incluent leur contexte entier d’un million de tokens au tarif standard. Les règles variant par modèle, enregistrez la taille du prompt par requête plutôt que d’appliquer une hypothèse globale.
5. Les outils et nouvelles tentatives sont hors du tableau principal
Recherche côté serveur, exécution de code, grounding, stockage et autres outils peuvent ajouter des frais par appel ou basés sur l’usage. Les nouvelles tentatives peuvent dupliquer les frais de tokens et d’outils même si l’application affiche une action utilisateur logique. Utilisez un backoff exponentiel plafonné, ne réessayez que les erreurs documentées comme transitoires et attachez un ID de requête applicatif pour tracer les travaux dupliqués.
6. Les prix d’image et vidéo utilisent d’autres unités
Les tarifs de tokens de modèles texte ne peuvent tarifer chaque charge multimodale. Les API d’image peuvent facturer par image générée, par appel ou selon les tokens d’image et la qualité. Les API vidéo utilisent couramment secondes, résolution ou niveaux de génération. Gardez des formules séparées et faites le sous-total des résultats.
Seedream sert à la génération d’images ; Seedance est la famille vidéo de ByteDance. Gardez séparés leurs prix et unités de facturation. Si vous changez de fournisseur vidéo, utilisez une comparaison spécifique à la vidéo et les contrôles de cycle de vie de tâche de notre guide de migration de l’API Sora.
Comment choisir selon le coût de la charge réelle
Exportez au moins une semaine représentative d’usage par modèle et endpoint. Séparez entrée standard, écritures de cache, hits de cache, sortie facturée, nouvelles tentatives, requêtes de contexte long, trafic Batch et outils. Rejouez un jeu d’évaluation fixe contre des modèles candidats, puis comparez réussite des tâches, distribution de latence, limites de débit et unités totales facturées. La ligne la moins chère n’est utile que si le modèle satisfait vos exigences de qualité et d’exploitation.
Recalculez après tout changement d’alias de modèle, prompt, réglage de raisonnement, plafond de sortie, règle de routage ou tokenizer. Conservez l’URL de la page tarifaire et la date de chaque instantané de tarif dans votre feuille de calcul ou service de coûts pour expliquer les différences de facture ultérieures.
Questions fréquentes
Quelle est l’API LLM la moins chère en 2026 ?
Il n’existe pas d’API universellement la moins chère. Dans cet échantillon daté, DeepSeek Flash a le tarif de hit de cache hors pointe le plus bas, tandis que GPT-5.6 Luna a un tarif standard simple et bas. Votre option valide la moins chère dépend du volume de sortie, de la réutilisation du cache, des plages horaires, outils, nouvelles tentatives, qualité et de l’acceptabilité du traitement Batch.
Les tokens de raisonnement sont-ils facturés ?
Souvent, oui. Google indique que son prix de sortie inclut les tokens de thinking, et OpenAI signale les tokens de raisonnement dans les détails de tokens de sortie. Utilisez le total de sortie facturé et la documentation du fournisseur pour le modèle exact ; ne déduisez pas le coût de la longueur visible de réponse.
La mise en cache des prompts réduit-elle toujours le coût ?
Non. Une charge doit réutiliser assez souvent un préfixe stable éligible pour récupérer les frais d’écriture de cache et de stockage éventuels. Suivez les champs d’écriture et de lecture du cache, puis calculez le point mort avec les tarifs du modèle.
Dois-je utiliser le seul prix d’entrée pour comparer les modèles ?
Non. Utilisez la formule complète de charge. Génération à forte sortie, raisonnement d’agent, outils et nouvelles tentatives peuvent dépasser le prix d’entrée, tandis que Batch et hits de cache peuvent le réduire.
Les prix de cet article sont-ils des prix Tokenhot ?
Non. Le tableau et l’exemple chiffré utilisent les tarifs catalogue propriétaires vérifiés le 14 septembre 2026. Consultez séparément le catalogue de modèles Tokenhot pour la route de passerelle actuelle, le prix et l’unité de facturation.
Une comparaison datée des tarifs API LLM, avec formule de coût reproductible, exemple chiffré et détails de facturation que les tarifs de tokens mis en avant omettent.


