DeepSeek V4 Pro 0813:定价、基准测试与开放权重

DeepSeek V4 Pro 0813 是 DeepSeek 最大 V4 模型于 2026 年 8 月 13 日发布的正式可用版本。它将总计 1.6 万亿参数与每个 token 约 490 亿激活参数结合起来,支持 100 万 token 上下文窗口,既可通过 DeepSeek API 调用,也可获取采用 MIT 许可证的模型权重。这些显眼的数字都是真实的,但很容易被误用。激活参数描述每个 token 的计算量,并不描述必须存储多少 checkpoint。
本文聚焦开发者可从 DeepSeek V4 技术报告、0813 模型卡和当前 API 文档验证的内容。产品和定价细节于 2026 年 9 月 14 日核查。
DeepSeek V4 Pro 0813 概览
| 项目 | 已验证细节 |
|---|---|
| 发布 | 2026 年 8 月 13 日正式可用;取代 V4 Pro Preview |
| API 模型名称 | deepseek-v4-pro |
| 架构规模 | 1.6T 总参数,约 49B 激活参数 |
| 上下文和输出 | 1M-token 上下文;通过文档化 API 最多 384K 输出 |
| 模态 | 文本;DeepSeek 定价页面称 V4 Pro 不支持视觉 |
| 接口 | Chat Completions、Responses API 和 Anthropic 兼容 API |
| 开放权重 | deepseek-ai/DeepSeek-V4-Pro-0813,MIT 许可证 |
| 思考控制 | low、high 和 max;默认以 high 启用思考 |
DeepSeek 9 月 10 日更新日志还称,公司将在 9 月 14 日后继续提供 V4 Pro API 服务,计费方式在另行通知前不变。deepseek-v4-pro API 名称仍映射到 0813。这与 Flash 产品线不同:V4 Flash 和 V4 Flash Vision Experimental 已退役,其旧名称现路由至 V4.1 Flash。推荐的当前 Flash 名称是 deepseek-flash。这是当前状态,并非永久可用性保证。
1.6T/49B MoE 设计意味着什么
DeepSeek V4 Pro 是混合专家模型。1.6T 指完整参数集,而路由会为一个 token 的前向传递激活约 49B 参数。稀疏激活与激活每个专家相比降低了每个 token 所需的计算。它不会让 checkpoint 在存储或部署上变成一个 49B 模型。
技术报告描述了 Compressed Sparse Attention (CSA) 与 Heavily Compressed Attention (HCA) 的混合,以及 Manifold-Constrained Hyper-Connections (mHC)。DeepSeek 称 V4 模型在超过 32 万亿 token 上完成预训练。在 100 万 token 上下文下,V4 Pro 在 DeepSeek 测试中使用 V3.2 单 token 推理 FLOPs 的 27% 和 KV cache 的 10%。该比较不适用于每个 transformer。
发布的 checkpoint 配置提供了更多实施细节:61 个隐藏层、384 个路由专家、每个 token 选取六个路由专家和一个共享专家。它将 max_position_embeddings 设置为 1,048,576。这些字段支持 100 万 token 的说法,但不承诺每个部署都能以可接受的延迟或并发提供最大上下文。
0813 模型卡称已附加 DSpark 推测解码模块,并记录了 vLLM 和 SGLang 的标志。请在你的引擎、硬件、上下文和批处理配置上测量吞吐量。
官方智能体基准及其条件
正式可用版本报告了一组面向智能体的结果。最有用的公开套件数字如下。
| 基准 | DeepSeek V4 Pro 0813 | 需要注意的事项 |
|---|---|---|
| HLE | 42.7(无工具)/ 60.0(有工具) | 工具访问会实质改变设置 |
| Terminal-Bench 2.1 | 87.9 | 智能体框架和采样设置很重要 |
| NL2Repo | 61.5 | 仓库生成基准 |
| CyberGym | 83.3 | 安全智能体基准 |
| DeepSWE | 62.7 | DeepSeek 为 0813 发布所报告 |
| Toolathlon-Verified | 74.1 | 经验证的工具使用任务集 |
DeepSeek 在公开代码智能体任务中使用 DeepSeek Harness 的 minimal 模式、max effort、temperature = 1.0 和 top_p = 0.95。比较需要使用相同 harness、工具策略、重试预算和采样设置。
发布资料列出 DSBench-FullStack 为 71.1、DSBench-Hard 为 67.2,但将两者标为内部结果。它们无法从引用的公开材料中复现。请参阅 DeepSeek Harness 评估指南,了解公开套件的运行时背景。
本文审阅的官方来源没有包含 V4 Pro 0813 的 96.4% SWE-bench Verified 结果。有效的替代结果需要固定的 harness 和数据集修订版本,以及披露的尝试预算。
开放权重:存储基于全部参数
核查时,采用 MIT 许可证的 Hugging Face 仓库显示文件约为 893 GB。其配置采用混合格式,包括 FP4 专家和 FP8 量化元数据。模型卡提供一个四 GPU GB300 节点的 vLLM 配方、一个 SGLang 配方和本地转换演示。
实际的内存规划原则很简单:所有专家仍有权重。对 1.6T 参数进行裸 4-bit 计算,在十进制单位下约为 800 GB:
1.6 trillion parameters × 4 bits ÷ 8 = 800 billion bytes
这是容量下限。scale、非 4-bit 张量、运行时缓冲区、KV cache 和框架开销都会增加内存。活跃的 49B 子集在理论 4-bit 存储下仅为 24.5 GB,但其余专家仍需要存储。
96 GB 工作站无法容纳完整 Q4 checkpoint。CPU 或磁盘卸载会改变权重所在位置;不会消除它们。容量规划还必须覆盖上下文、批大小、并发和服务引擎。
请将官方 vLLM 和 SGLang 配方作为依赖版本的起点。本文没有运行它们,且 DeepSeek 的四 GB300 示例并不能验证八张 H100 或消费级 GPU 配置。
截至 2026 年 9 月 14 日的 DeepSeek API 定价
DeepSeek 对 V4 Pro 的缓存命中和未命中输入采取不同计费,随后应用工作日高峰和非高峰费率。以下价格以每一百万 token 的美元计,适用于 DeepSeek 直连 API。
| 计费项目 | 非高峰 | 高峰 |
|---|---|---|
| 缓存输入 | $0.022 | $0.044 |
| 未缓存输入 | $0.66 | $1.32 |
| 输出 | $1.98 | $3.96 |
高峰时段为周一至周五 01:00-04:00 UTC 和 06:00-10:00 UTC。其他时间均为非高峰。DeepSeek 指出价格可能变动,因此生产计算器应保存带生效日期和缓存状态的费率。
包含 100,000 个未缓存输入 token 和 10,000 个输出 token 的请求,非高峰成本为 $0.0858,高峰为 $0.1716。这不包含重试和工具循环轮次。更广泛的成本建模请使用 LLM API 定价比较指南。
若使用网关访问,请在 Tokenhot 模型目录中核查准确的模型路径和计费条件。其网关价格与上述 DeepSeek 直连价格独立。在中国境外访问 DeepSeek 指南涵盖账户、API 和部署检查。
受支持的 Responses API 起点
DeepSeek 记录了在 https://api.deepseek.com 的原生 Responses API 支持。这个最小 Python 示例使用环境变量存放密钥,并使用官方 V4 Pro 模型名称:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.responses.create(
model="deepseek-v4-pro",
instructions="Review the code for correctness and cite the relevant functions.",
input="Explain the failure mode in this retry loop: ...",
)
print(response.output_text)
安装提供 client.responses.create 的当前 OpenAI Python SDK,设置 DEEPSEEK_API_KEY,并用你的内容替换示例输入。该片段遵循 DeepSeek 记录的请求格式,但本文未运行它,因为没有执行带凭据的 API 测试。
思考默认使用 high。DeepSeek 的思考模式文档称,在该模式中 temperature、presence_penalty 和 frequency_penalty 无效。多轮工具调用必须按文档返回 reasoning_content。请处理 HTTP 429 响应;V4 Pro 列出的账户并发限制为 500,更高容量需要向 DeepSeek 提出请求。
API 还是自托管:实际决策
对于快速评估或可变需求,使用 API。测量任务成功率、输出使用情况、缓存命中和重试;低 token 价格并不保证每项成功任务的成本低。
当离线运行、基础设施控制或权重研究的需求足以承担完整 checkpoint 的部署成本时,可以选择自托管。确认 V4 和 DSpark 支持,然后建立完整内存预算。DeepSeek 的四张 GB300 的部署方案不能验证较小集群。OpenRouter 替代方案指南涵盖网关比较标准。
常见问题
DeepSeek V4 Pro 0813 真的有 1.6T 参数但只有 49B 活跃参数吗?
是。49B 数字降低每个 token 的计算;不会将存储的 1.6T checkpoint 减少为 49B 参数。
完整模型能在使用 Q4 量化的 96 GB 中运行吗?
不能。1.6T 参数以四 bit 计算,在元数据和运行时内存之前约为 800 GB。96 GB 机器需要大量卸载或更小的模型。
DeepSeek V4 Pro 是否在 SWE-bench Verified 上获得了 96.4%?
本文审阅的官方 0813 来源没有报告该结果。请使用已发布的智能体基准表及其 harness 条件。
100 万 token 上下文窗口涵盖什么?
API 列出 1M-token 上下文窗口,checkpoint 配置设置了 1,048,576 个位置。请将输入和输出预算一起规划,而不要把标称上下文窗口当成不受限制的提示词额度。成本和速度也取决于缓存、并发和硬件。
V4 Pro 支持图像吗?
不支持,根据 DeepSeek 当前模型表。该表为 deepseek-flash 标记视觉支持,为 deepseek-v4-pro 标记不支持。
V4 Pro API 会在 2026 年 9 月 14 日后停止服务吗?
DeepSeek 9 月 10 日更新称,API 服务将在 9 月 14 日后继续,计费不变;如果状态变更,将另行通知。在围绕该模型建立长期依赖前,请检查更新日志。
DeepSeek V4 Pro 0813 是采用 MIT 许可证的开放权重混合专家模型,总参数量 1.6 万亿、每个 token 激活约 490 亿参数,并拥有 100 万 token 上下文窗口。本文将这些架构事实与部署内存区分开来,解释官方基准条件,记录截至 2026 年 9 月 14 日核查的 DeepSeek 直连 API 定价,并提供受支持的 API 起点。


