DeepSeek V4 Pro 0813 : tarifs, benchmarks et poids ouverts

DeepSeek V4 Pro 0813 est la version en disponibilité générale du 13 août 2026 du plus grand modèle V4 de DeepSeek. Il associe 1 600 milliards de paramètres totaux à environ 49 milliards de paramètres activés par token, prend en charge une fenêtre de contexte d’un million de tokens et est disponible via l’API DeepSeek ainsi que sous forme de poids sous licence MIT. Ces chiffres sont réels, mais faciles à mal employer. Les paramètres activés décrivent le calcul par token, pas la quantité du checkpoint à stocker.
Ce guide se concentre sur ce que les développeurs peuvent vérifier dans le rapport technique DeepSeek V4, la fiche modèle 0813 et la documentation API actuelle. Les détails produit et tarifs ont été vérifiés le 14 septembre 2026.
DeepSeek V4 Pro 0813 en bref
| Élément | Détail vérifié |
|---|---|
| Publication | GA le 13 août 2026 ; remplace V4 Pro Preview |
| Nom de modèle API | deepseek-v4-pro |
| Taille d’architecture | 1.6T paramètres totaux, environ 49B activés |
| Contexte et sortie | Contexte 1M tokens ; jusqu’à 384K en sortie via l’API documentée |
| Modalités | Texte ; la page tarifaire DeepSeek indique que V4 Pro ne prend pas en charge la vision |
| Interfaces | Chat Completions, Responses API et API compatible Anthropic |
| Poids ouverts | deepseek-ai/DeepSeek-V4-Pro-0813, licence MIT |
| Contrôles de réflexion | low, high et max ; réflexion activée par défaut à high |
Le journal des modifications du 10 septembre de DeepSeek indique aussi que le service API V4 Pro continuera après le 14 septembre, avec une facturation inchangée jusqu’à nouvel avis. Le nom API deepseek-v4-pro correspond toujours à 0813. Cela diffère de la ligne Flash : V4 Flash et V4 Flash Vision Experimental sont retirés et leurs anciens noms redirigent maintenant vers V4.1 Flash. Le nom Flash actuel recommandé est deepseek-flash. C’est l’état actuel, pas une garantie de disponibilité permanente.
Ce que signifie la conception MoE 1.6T/49B
DeepSeek V4 Pro est un modèle mélange d’experts. Le chiffre 1.6T compte l’ensemble complet de paramètres, tandis que le routage active environ 49B paramètres pour le passage avant d’un token. L’activation clairsemée réduit le calcul nécessaire par token par rapport à l’activation de tous les experts. Elle ne transforme pas le checkpoint en modèle 49B pour le stockage ou le déploiement.
Le rapport technique décrit un hybride de Compressed Sparse Attention (CSA) et Heavily Compressed Attention (HCA), avec Manifold-Constrained Hyper-Connections (mHC). DeepSeek indique que les modèles V4 ont été pré-entraînés sur plus de 32 000 milliards de tokens. À un contexte d’un million de tokens, V4 Pro utilise 27% des FLOPs d’inférence à un token et 10% du cache KV de V3.2 dans les tests de DeepSeek. Cette comparaison ne s’applique pas à chaque transformer.
La configuration du checkpoint publié donne d’autres détails : 61 couches cachées, 384 experts routés, six experts routés sélectionnés par token et un expert partagé. Elle définit max_position_embeddings à 1,048,576. Ces champs étayent l’affirmation d’un million de tokens, mais ne promettent pas que chaque déploiement peut servir le contexte maximal à une latence ou concurrence acceptable.
La fiche modèle 0813 indique qu’un module de décodage spéculatif DSpark est attaché et documente des options pour vLLM et SGLang. Mesurez le débit sur votre moteur, matériel, contexte et configuration de lot.
Les benchmarks d’agents officiels et leurs conditions
La publication GA présente plusieurs résultats orientés agents. Les chiffres les plus utiles des suites publiques sont ci-dessous.
| Benchmark | DeepSeek V4 Pro 0813 | À garder en tête |
|---|---|---|
| HLE | 42.7 sans outils / 60.0 avec outils | L’accès aux outils modifie sensiblement la configuration |
| Terminal-Bench 2.1 | 87.9 | Le framework d’agent et les paramètres d’échantillonnage comptent |
| NL2Repo | 61.5 | Benchmark de génération de dépôt |
| CyberGym | 83.3 | Benchmark d’agent de sécurité |
| DeepSWE | 62.7 | Rapporté par DeepSeek pour la version 0813 |
| Toolathlon-Verified | 74.1 | Ensemble de tâches vérifiées d’utilisation d’outils |
DeepSeek a exécuté les tâches publiques d’agent de code avec DeepSeek Harness en mode minimal, effort max, temperature = 1.0 et top_p = 0.95. Les comparaisons exigent le même harness, la même politique d’outils, le même budget de tentatives et la même configuration d’échantillonnage.
La publication liste DSBench-FullStack à 71.1 et DSBench-Hard à 67.2, mais étiquette les deux comme internes. Ils ne sont pas reproductibles à partir des documents publics cités. Consultez le guide d’évaluation DeepSeek Harness pour le contexte d’exécution des suites publiques.
Les sources officielles examinées ici ne contiennent aucun résultat SWE-bench Verified de 96.4% pour V4 Pro 0813. Un remplacement valide exigerait une révision figée du harness et du jeu de données, ainsi qu’un budget de tentatives divulgué.
Poids ouverts : le stockage dépend de tous les paramètres
Le dépôt Hugging Face sous licence MIT affichait environ 893 GB de fichiers lors de la vérification. Sa configuration utilise des formats mixtes, dont des experts FP4 et des métadonnées de quantification FP8. La fiche modèle fournit une recette vLLM pour un nœud GB300 à quatre GPU, une recette SGLang et des démonstrations de conversion locale.
La leçon pratique de mémoire est simple : tous les experts possèdent toujours des poids. Un calcul brut à 4 bits pour 1.6T paramètres donne environ 800 GB en unités décimales :
1.6 trillion parameters × 4 bits ÷ 8 = 800 billion bytes
C’est un plancher de dimensionnement. Échelles, tenseurs non 4 bits, tampons d’exécution, cache KV et surcharge du framework ajoutent de la mémoire. Le sous-ensemble actif 49B ne représente que 24.5 GB à quatre bits théoriques, mais les experts restants doivent toujours être stockés.
Une station de travail de 96 GB ne peut contenir le checkpoint Q4 complet. Le déport CPU ou disque change l’emplacement des poids ; il ne les supprime pas. La planification de capacité doit aussi couvrir contexte, taille de lot, concurrence et moteur de service.
Utilisez les recettes vLLM et SGLang officielles comme points de départ sensibles aux versions. Elles n’ont pas été exécutées pour cet article, et l’exemple DeepSeek à quatre GB300 ne valide pas une configuration à huit H100 ou GPU grand public.
Tarifs API DeepSeek au 14 septembre 2026
DeepSeek facture l’entrée V4 Pro différemment pour les hits et misses de cache, puis applique des tarifs de pointe et hors pointe en semaine. Les prix ci-dessous sont en dollars US par million de tokens sur l’API directe DeepSeek.
| Poste facturé | Hors pointe | Pointe |
|---|---|---|
| Entrée mise en cache | $0.022 | $0.044 |
| Entrée non mise en cache | $0.66 | $1.32 |
| Sortie | $1.98 | $3.96 |
Les périodes de pointe sont du lundi au vendredi, 01:00-04:00 UTC et 06:00-10:00 UTC. Tous les autres créneaux sont hors pointe. DeepSeek précise que les tarifs peuvent changer ; les calculateurs de production doivent donc enregistrer les tarifs avec une date d’effet et le statut du cache.
Une requête de 100,000 tokens d’entrée non mis en cache et 10,000 tokens de sortie coûte $0.0858 hors pointe ou $0.1716 en pointe. Cela exclut les nouvelles tentatives et tours de boucle d’outils. Utilisez le guide de comparaison des tarifs API LLM pour une modélisation plus large des coûts.
Pour l’accès par passerelle, vérifiez la route de modèle exacte et les conditions de facturation dans le catalogue de modèles Tokenhot. Ses prix de passerelle sont distincts des prix directs DeepSeek ci-dessus. Le guide d’accès à DeepSeek hors de Chine couvre les vérifications de compte, API et déploiement.
Un point de départ Responses API pris en charge
DeepSeek documente la prise en charge native de Responses API à https://api.deepseek.com. Cet exemple Python minimal utilise une variable d’environnement pour la clé et le nom officiel de modèle V4 Pro :
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.responses.create(
model="deepseek-v4-pro",
instructions="Review the code for correctness and cite the relevant functions.",
input="Explain the failure mode in this retry loop: ...",
)
print(response.output_text)
Installez un SDK OpenAI Python actuel exposant client.responses.create, définissez DEEPSEEK_API_KEY et remplacez l’entrée d’exemple par votre contenu. L’extrait suit la forme de requête documentée par DeepSeek, mais n’a pas été exécuté pour cet article car aucun test API avec identifiants n’a été effectué.
La réflexion est par défaut à high. La documentation du mode réflexion de DeepSeek indique que temperature, presence_penalty et frequency_penalty n’ont aucun effet dans ce mode. Les appels d’outils multi-tours doivent renvoyer reasoning_content comme documenté. Gérez les réponses HTTP 429 ; la limite de concurrence de compte indiquée pour V4 Pro est 500, et une capacité plus élevée nécessite une demande à DeepSeek.
API ou auto-hébergement : une décision pratique
Utilisez l’API pour une évaluation rapide ou une demande variable. Mesurez succès de tâche, utilisation de sortie, hits de cache et tentatives ; un faible prix par token ne garantit pas un faible coût par tâche réussie.
Auto-hébergez lorsque l’opération hors ligne, le contrôle de l’infrastructure ou la recherche sur les poids justifie le checkpoint. Confirmez la prise en charge de V4 et DSpark, puis modélisez le budget mémoire complet. La recette DeepSeek à quatre GB300 ne valide pas un cluster plus petit. Le guide des alternatives à OpenRouter couvre les critères de comparaison des passerelles.
Questions fréquentes
DeepSeek V4 Pro 0813 est-il vraiment un modèle 1.6T avec seulement 49B paramètres actifs ?
Oui. Le chiffre 49B réduit le calcul par token ; il ne réduit pas le checkpoint stocké 1.6T à 49B paramètres.
Le modèle complet peut-il fonctionner dans 96 GB avec une quantification Q4 ?
Non. Quatre bits sur 1.6T paramètres représentent environ 800 GB avant les métadonnées et la mémoire d’exécution. Une machine de 96 GB nécessite un déport majeur ou un modèle plus petit.
DeepSeek V4 Pro a-t-il obtenu 96.4% sur SWE-bench Verified ?
Aucune source officielle 0813 examinée ici ne rapporte ce résultat. Utilisez plutôt le tableau de benchmarks d’agents publiés et ses conditions de harness.
Que couvre la fenêtre de contexte d’un million de tokens ?
L’API indique une fenêtre 1M tokens et la configuration du checkpoint définit 1,048,576 positions. Planifiez ensemble le budget d’entrée et de sortie au lieu de traiter cette fenêtre comme une allocation de prompt illimitée. Coût et vitesse dépendent aussi du cache, de la concurrence et du matériel.
V4 Pro prend-il en charge les images ?
Non, selon la table de modèles actuelle de DeepSeek. La table marque la prise en charge de vision pour deepseek-flash et l’indique non prise en charge pour deepseek-v4-pro.
L’API V4 Pro sera-t-elle arrêtée après le 14 septembre 2026 ?
La mise à jour DeepSeek du 10 septembre indique que le service API continuera après le 14 septembre avec une facturation inchangée, et qu’un avis ultérieur viendra si cet état change. Vérifiez le journal des modifications avant de construire une dépendance à long terme autour du modèle.
DeepSeek V4 Pro 0813 est un modèle à poids ouverts sous licence MIT, mélange d’experts, avec 1 600 milliards de paramètres totaux, environ 49 milliards de paramètres activés et une fenêtre de contexte d’un million de tokens. Ce guide sépare ces faits architecturaux de la mémoire de déploiement, explique les conditions des benchmarks officiels, documente les tarifs API directs de DeepSeek vérifiés le 14 septembre 2026 et fournit un point de départ API pris en charge.


