DeepSeek V4 Pro 0813:定價、基準測試與開放權重

DeepSeek V4 Pro 0813 是 DeepSeek 最大 V4 模型於 2026 年 8 月 13 日釋出的正式可用版本。它將總計 1.6 兆參數與每個 token 約 490 億啟用參數結合起來,支援 100 萬 token 上下文視窗,既可透過 DeepSeek API 呼叫,也可取得採用 MIT 授權的模型權重。這些醒目的數字都是真實的,但很容易被誤用。啟用參數描述每個 token 的計算量,並不描述必須儲存多少 checkpoint。
本文聚焦開發者可從 DeepSeek V4 技術報告、0813 模型卡和當前 API 文件驗證的內容。產品和定價細節於 2026 年 9 月 14 日核對。
DeepSeek V4 Pro 0813 概覽
| 專案 | 已驗證細節 |
|---|---|
| 釋出 | 2026 年 8 月 13 日正式可用;取代 V4 Pro Preview |
| API 模型名稱 | deepseek-v4-pro |
| 架構規模 | 1.6T 總參數,約 49B 啟用參數 |
| 上下文和輸出 | 1M-token 上下文;透過文件化 API 最多 384K 輸出 |
| 模態 | 文字;DeepSeek 定價頁面稱 V4 Pro 不支援視覺 |
| 介面 | Chat Completions、Responses API 和 Anthropic 相容 API |
| 開放權重 | deepseek-ai/DeepSeek-V4-Pro-0813,MIT 授權 |
| 思考控制 | low、high 和 max;預設以 high 啟用思考 |
DeepSeek 9 月 10 日更新日誌還稱,公司將在 9 月 14 日後繼續提供 V4 Pro API 服務,計費方式在另行通知前不變。deepseek-v4-pro API 名稱仍對映到 0813。這與 Flash 產品線不同:V4 Flash 和 V4 Flash Vision Experimental 已退役,其舊名稱現路由至 V4.1 Flash。推薦的當前 Flash 名稱是 deepseek-flash。這是當前狀態,並非永久可用性保證。
1.6T/49B MoE 設計意味著什麼
DeepSeek V4 Pro 是混合專家模型。1.6T 指完整參數集,而路由會為一個 token 的前向傳遞啟用約 49B 參數。稀疏啟用與啟用每個專家相比降低了每個 token 所需的計算。它不會讓 checkpoint 在儲存或部署上變成一個 49B 模型。
技術報告描述了 Compressed Sparse Attention (CSA) 與 Heavily Compressed Attention (HCA) 的混合,以及 Manifold-Constrained Hyper-Connections (mHC)。DeepSeek 稱 V4 模型在超過 32 兆 token 上完成預訓練。在 100 萬 token 上下文下,V4 Pro 在 DeepSeek 測試中使用 V3.2 單 token 推理 FLOPs 的 27% 和 KV cache 的 10%。該比較不適用於每個 transformer。
釋出的 checkpoint 配置提供了更多實施細節:61 個隱藏層、384 個路由專家、每個 token 選取六個路由專家和一個共享專家。它將 max_position_embeddings 設定為 1,048,576。這些欄位支援 100 萬 token 的說法,但不承諾每個部署都能以可接受的延遲或併發提供最大上下文。
0813 模型卡稱已附加 DSpark 推測解碼模組,並記錄了 vLLM 和 SGLang 的標誌。請在你的引擎、硬體、上下文和批處理配置上測量吞吐量。
官方智慧體基準及其條件
正式可用版本報告了一組面向智慧體的結果。最有用的公開套件數字如下。
| 基準 | DeepSeek V4 Pro 0813 | 需要注意的事項 |
|---|---|---|
| HLE | 42.7(無工具)/ 60.0(有工具) | 工具訪問會實質改變設定 |
| Terminal-Bench 2.1 | 87.9 | 智慧體框架和取樣設定很重要 |
| NL2Repo | 61.5 | 倉庫生成基準 |
| CyberGym | 83.3 | 安全智慧體基準 |
| DeepSWE | 62.7 | DeepSeek 為 0813 釋出所報告 |
| Toolathlon-Verified | 74.1 | 經驗證的工具使用任務集 |
DeepSeek 在公開程式碼智慧體任務中使用 DeepSeek Harness 的 minimal 模式、max effort、temperature = 1.0 和 top_p = 0.95。比較需要使用相同 harness、工具策略、重試預算和取樣設定。
釋出資料列出 DSBench-FullStack 為 71.1、DSBench-Hard 為 67.2,但將兩者標為內部結果。它們無法從引用的公開材料中復現。請參閱 DeepSeek Harness 評估指南,瞭解公開套件的執行時背景。
本文審閱的官方來源沒有包含 V4 Pro 0813 的 96.4% SWE-bench Verified 結果。有效的替代結果需要固定的 harness 和資料集修訂版本,以及披露的嘗試預算。
開放權重:儲存基於全部參數
核對時,採用 MIT 授權的 Hugging Face 倉庫顯示檔案約為 893 GB。其配置採用混合格式,包括 FP4 專家和 FP8 量化後設資料。模型卡提供一個四 GPU GB300 節點的 vLLM 配方、一個 SGLang 配方和本地轉換演示。
實際的記憶體規劃原則很簡單:所有專家仍有權重。對 1.6T 參數進行裸 4-bit 計算,在十進位制單位下約為 800 GB:
1.6 trillion parameters × 4 bits ÷ 8 = 800 billion bytes
這是容量下限。scale、非 4-bit 張量、執行時緩衝區、KV cache 和框架開銷都會增加記憶體。活躍的 49B 子集在理論四位下僅為 24.5 GB,但其餘專家仍需要儲存。
96 GB 工作站無法容納完整 Q4 checkpoint。CPU 或磁碟解除安裝會改變權重所在位置;不會消除它們。容量規劃還必須覆蓋上下文、批大小、併發和服務引擎。
請將官方 vLLM 和 SGLang 配方作為依賴版本的起點。本文沒有執行它們,且 DeepSeek 的四 GB300 示例並不能驗證八張 H100 或消費級 GPU 配置。
截至 2026 年 9 月 14 日的 DeepSeek API 定價
DeepSeek 對 V4 Pro 的快取命中和未命中輸入採取不同計費,隨後應用工作日高峰和非高峰費率。以下價格以每一百萬 token 的美元計,適用於 DeepSeek 直連 API。
| 計費專案 | 非高峰 | 高峰 |
|---|---|---|
| 快取輸入 | $0.022 | $0.044 |
| 未快取輸入 | $0.66 | $1.32 |
| 輸出 | $1.98 | $3.96 |
高峰時段為週一至週五 01:00-04:00 UTC 和 06:00-10:00 UTC。其他時間均為非高峰。DeepSeek 指出價格可能變動,因此生產計算器應儲存帶生效日期和快取狀態的費率。
包含 100,000 個未快取輸入 token 和 10,000 個輸出 token 的請求,非高峰成本為 $0.0858,高峰為 $0.1716。這不包含重試和工具迴圈輪次。更廣泛的成本建模請使用 LLM API 定價比較指南。
若使用閘道器訪問,請在 Tokenhot 模型目錄中核對準確的模型路徑和計費條件。其閘道器價格與上述 DeepSeek 直連價格獨立。在中國境外訪問 DeepSeek 指南涵蓋帳戶、API 和部署檢查。
受支援的 Responses API 起點
DeepSeek 記錄了在 https://api.deepseek.com 的原生 Responses API 支援。這個最小 Python 示例使用環境變數存放金鑰,並使用官方 V4 Pro 模型名稱:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.responses.create(
model="deepseek-v4-pro",
instructions="Review the code for correctness and cite the relevant functions.",
input="Explain the failure mode in this retry loop: ...",
)
print(response.output_text)
安裝暴露 client.responses.create 的當前 OpenAI Python SDK,設定 DEEPSEEK_API_KEY,並用你的內容替換示例輸入。該片段遵循 DeepSeek 記錄的請求格式,但本文未執行它,因為沒有執行帶憑據的 API 測試。
思考預設使用 high。DeepSeek 的思考模式文件稱,在該模式中 temperature、presence_penalty 和 frequency_penalty 無效。多輪工具呼叫必須按文件返回 reasoning_content。請處理 HTTP 429 回應;V4 Pro 列出的帳戶併發限制為 500,更高容量需要向 DeepSeek 提出請求。
API 還是自託管:實際決策
對於快速評估或可變需求,使用 API。測量任務成功率、輸出使用情況、快取命中和重試;低 token 價格並不保證每項成功任務的成本低。
當離線執行、基礎設施控制或權重研究的需求足以承擔完整 checkpoint 的部署成本時,可以選擇自行託管。確認 V4 和 DSpark 支援,然後建立完整記憶體預算。DeepSeek 的四張 GB300 的部署方案不能驗證較小叢集。OpenRouter 替代方案指南涵蓋閘道器比較標準。
常見問題
DeepSeek V4 Pro 0813 真的有 1.6T 參數但只有 49B 活躍參數嗎?
是。49B 數字降低每個 token 的計算;不會將儲存的 1.6T checkpoint 減少為 49B 參數。
完整模型能在使用 Q4 量化的 96 GB 中執行嗎?
不能。1.6T 參數以四 bit 計算,在後設資料和執行時記憶體之前約為 800 GB。96 GB 機器需要大量解除安裝或更小的模型。
DeepSeek V4 Pro 是否在 SWE-bench Verified 上獲得了 96.4%?
本文審閱的官方 0813 來源沒有報告該結果。請使用已釋出的智慧體基準表及其 harness 條件。
100 萬 token 上下文視窗涵蓋什麼?
API 列出 1M-token 上下文視窗,checkpoint 配置設定了 1,048,576 個位置。請將輸入和輸出預算一起規劃,而不要把標稱上下文視窗當成不受限制的提示詞額度。成本和速度也取決於快取、併發和硬體。
V4 Pro 支援影像嗎?
不支援,根據 DeepSeek 當前模型表。該表為 deepseek-flash 標記視覺支援,為 deepseek-v4-pro 標記不支援。
V4 Pro API 會在 2026 年 9 月 14 日後停止服務嗎?
DeepSeek 9 月 10 日更新稱,API 服務將在 9 月 14 日後繼續,計費不變;如果狀態變更,將另行通知。在圍繞該模型建立長期依賴前,請檢查更新日誌。
DeepSeek V4 Pro 0813 是採用 MIT 授權的開放權重混合專家模型,總參數量 1.6 兆、每個 token 啟用約 490 億參數,並擁有 100 萬 token 上下文視窗。本文將這些架構事實與部署記憶體區分開來,解釋官方基準條件,記錄截至 2026 年 9 月 14 日核對的 DeepSeek 直連 API 定價,並提供受支援的 API 起點。


