AI 工程

DeepSeek V4 Pro 0813:定價、基準測試與開放權重

TTokenhot Team2026年8月19日約 11 分鐘閱讀
DeepSeek V4 Pro 0813:定價、基準測試與開放權重

DeepSeek V4 Pro 0813 是 DeepSeek 最大 V4 模型於 2026 年 8 月 13 日釋出的正式可用版本。它將總計 1.6 兆參數與每個 token 約 490 億啟用參數結合起來,支援 100 萬 token 上下文視窗,既可透過 DeepSeek API 呼叫,也可取得採用 MIT 授權的模型權重。這些醒目的數字都是真實的,但很容易被誤用。啟用參數描述每個 token 的計算量,並不描述必須儲存多少 checkpoint。

本文聚焦開發者可從 DeepSeek V4 技術報告0813 模型卡當前 API 文件驗證的內容。產品和定價細節於 2026 年 9 月 14 日核對。

DeepSeek V4 Pro 0813 概覽

專案 已驗證細節
釋出 2026 年 8 月 13 日正式可用;取代 V4 Pro Preview
API 模型名稱 deepseek-v4-pro
架構規模 1.6T 總參數,約 49B 啟用參數
上下文和輸出 1M-token 上下文;透過文件化 API 最多 384K 輸出
模態 文字;DeepSeek 定價頁面稱 V4 Pro 不支援視覺
介面 Chat Completions、Responses API 和 Anthropic 相容 API
開放權重 deepseek-ai/DeepSeek-V4-Pro-0813,MIT 授權
思考控制 lowhighmax;預設以 high 啟用思考

DeepSeek 9 月 10 日更新日誌還稱,公司將在 9 月 14 日後繼續提供 V4 Pro API 服務,計費方式在另行通知前不變。deepseek-v4-pro API 名稱仍對映到 0813。這與 Flash 產品線不同:V4 Flash 和 V4 Flash Vision Experimental 已退役,其舊名稱現路由至 V4.1 Flash。推薦的當前 Flash 名稱是 deepseek-flash。這是當前狀態,並非永久可用性保證。

1.6T/49B MoE 設計意味著什麼

DeepSeek V4 Pro 是混合專家模型。1.6T 指完整參數集,而路由會為一個 token 的前向傳遞啟用約 49B 參數。稀疏啟用與啟用每個專家相比降低了每個 token 所需的計算。它不會讓 checkpoint 在儲存或部署上變成一個 49B 模型。

技術報告描述了 Compressed Sparse Attention (CSA) 與 Heavily Compressed Attention (HCA) 的混合,以及 Manifold-Constrained Hyper-Connections (mHC)。DeepSeek 稱 V4 模型在超過 32 兆 token 上完成預訓練。在 100 萬 token 上下文下,V4 Pro 在 DeepSeek 測試中使用 V3.2 單 token 推理 FLOPs 的 27% 和 KV cache 的 10%。該比較不適用於每個 transformer。

釋出的 checkpoint 配置提供了更多實施細節:61 個隱藏層、384 個路由專家、每個 token 選取六個路由專家和一個共享專家。它將 max_position_embeddings 設定為 1,048,576。這些欄位支援 100 萬 token 的說法,但不承諾每個部署都能以可接受的延遲或併發提供最大上下文。

0813 模型卡稱已附加 DSpark 推測解碼模組,並記錄了 vLLM 和 SGLang 的標誌。請在你的引擎、硬體、上下文和批處理配置上測量吞吐量。

官方智慧體基準及其條件

正式可用版本報告了一組面向智慧體的結果。最有用的公開套件數字如下。

基準 DeepSeek V4 Pro 0813 需要注意的事項
HLE 42.7(無工具)/ 60.0(有工具) 工具訪問會實質改變設定
Terminal-Bench 2.1 87.9 智慧體框架和取樣設定很重要
NL2Repo 61.5 倉庫生成基準
CyberGym 83.3 安全智慧體基準
DeepSWE 62.7 DeepSeek 為 0813 釋出所報告
Toolathlon-Verified 74.1 經驗證的工具使用任務集

DeepSeek 在公開程式碼智慧體任務中使用 DeepSeek Harness 的 minimal 模式、max effort、temperature = 1.0top_p = 0.95。比較需要使用相同 harness、工具策略、重試預算和取樣設定。

釋出資料列出 DSBench-FullStack 為 71.1、DSBench-Hard 為 67.2,但將兩者標為內部結果。它們無法從引用的公開材料中復現。請參閱 DeepSeek Harness 評估指南,瞭解公開套件的執行時背景。

本文審閱的官方來源沒有包含 V4 Pro 0813 的 96.4% SWE-bench Verified 結果。有效的替代結果需要固定的 harness 和資料集修訂版本,以及披露的嘗試預算。

開放權重:儲存基於全部參數

核對時,採用 MIT 授權的 Hugging Face 倉庫顯示檔案約為 893 GB。其配置採用混合格式,包括 FP4 專家和 FP8 量化後設資料。模型卡提供一個四 GPU GB300 節點的 vLLM 配方、一個 SGLang 配方和本地轉換演示。

實際的記憶體規劃原則很簡單:所有專家仍有權重。對 1.6T 參數進行裸 4-bit 計算,在十進位制單位下約為 800 GB:

1.6 trillion parameters × 4 bits ÷ 8 = 800 billion bytes

這是容量下限。scale、非 4-bit 張量、執行時緩衝區、KV cache 和框架開銷都會增加記憶體。活躍的 49B 子集在理論四位下僅為 24.5 GB,但其餘專家仍需要儲存。

96 GB 工作站無法容納完整 Q4 checkpoint。CPU 或磁碟解除安裝會改變權重所在位置;不會消除它們。容量規劃還必須覆蓋上下文、批大小、併發和服務引擎。

請將官方 vLLM 和 SGLang 配方作為依賴版本的起點。本文沒有執行它們,且 DeepSeek 的四 GB300 示例並不能驗證八張 H100 或消費級 GPU 配置。

截至 2026 年 9 月 14 日的 DeepSeek API 定價

DeepSeek 對 V4 Pro 的快取命中和未命中輸入採取不同計費,隨後應用工作日高峰和非高峰費率。以下價格以每一百萬 token 的美元計,適用於 DeepSeek 直連 API

計費專案 非高峰 高峰
快取輸入 $0.022 $0.044
未快取輸入 $0.66 $1.32
輸出 $1.98 $3.96

高峰時段為週一至週五 01:00-04:00 UTC 和 06:00-10:00 UTC。其他時間均為非高峰。DeepSeek 指出價格可能變動,因此生產計算器應儲存帶生效日期和快取狀態的費率。

包含 100,000 個未快取輸入 token 和 10,000 個輸出 token 的請求,非高峰成本為 $0.0858,高峰為 $0.1716。這不包含重試和工具迴圈輪次。更廣泛的成本建模請使用 LLM API 定價比較指南

若使用閘道器訪問,請在 Tokenhot 模型目錄中核對準確的模型路徑和計費條件。其閘道器價格與上述 DeepSeek 直連價格獨立。在中國境外訪問 DeepSeek 指南涵蓋帳戶、API 和部署檢查。

受支援的 Responses API 起點

DeepSeek 記錄了在 https://api.deepseek.com 的原生 Responses API 支援。這個最小 Python 示例使用環境變數存放金鑰,並使用官方 V4 Pro 模型名稱:

import os

from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.responses.create(
    model="deepseek-v4-pro",
    instructions="Review the code for correctness and cite the relevant functions.",
    input="Explain the failure mode in this retry loop: ...",
)

print(response.output_text)

安裝暴露 client.responses.create 的當前 OpenAI Python SDK,設定 DEEPSEEK_API_KEY,並用你的內容替換示例輸入。該片段遵循 DeepSeek 記錄的請求格式,但本文未執行它,因為沒有執行帶憑據的 API 測試。

思考預設使用 high。DeepSeek 的思考模式文件稱,在該模式中 temperaturepresence_penaltyfrequency_penalty 無效。多輪工具呼叫必須按文件返回 reasoning_content。請處理 HTTP 429 回應;V4 Pro 列出的帳戶併發限制為 500,更高容量需要向 DeepSeek 提出請求。

API 還是自託管:實際決策

對於快速評估或可變需求,使用 API。測量任務成功率、輸出使用情況、快取命中和重試;低 token 價格並不保證每項成功任務的成本低。

當離線執行、基礎設施控制或權重研究的需求足以承擔完整 checkpoint 的部署成本時,可以選擇自行託管。確認 V4 和 DSpark 支援,然後建立完整記憶體預算。DeepSeek 的四張 GB300 的部署方案不能驗證較小叢集。OpenRouter 替代方案指南涵蓋閘道器比較標準。

常見問題

DeepSeek V4 Pro 0813 真的有 1.6T 參數但只有 49B 活躍參數嗎?

是。49B 數字降低每個 token 的計算;不會將儲存的 1.6T checkpoint 減少為 49B 參數。

完整模型能在使用 Q4 量化的 96 GB 中執行嗎?

不能。1.6T 參數以四 bit 計算,在後設資料和執行時記憶體之前約為 800 GB。96 GB 機器需要大量解除安裝或更小的模型。

DeepSeek V4 Pro 是否在 SWE-bench Verified 上獲得了 96.4%?

本文審閱的官方 0813 來源沒有報告該結果。請使用已釋出的智慧體基準表及其 harness 條件。

100 萬 token 上下文視窗涵蓋什麼?

API 列出 1M-token 上下文視窗,checkpoint 配置設定了 1,048,576 個位置。請將輸入和輸出預算一起規劃,而不要把標稱上下文視窗當成不受限制的提示詞額度。成本和速度也取決於快取、併發和硬體。

V4 Pro 支援影像嗎?

不支援,根據 DeepSeek 當前模型表。該表為 deepseek-flash 標記視覺支援,為 deepseek-v4-pro 標記不支援。

V4 Pro API 會在 2026 年 9 月 14 日後停止服務嗎?

DeepSeek 9 月 10 日更新稱,API 服務將在 9 月 14 日後繼續,計費不變;如果狀態變更,將另行通知。在圍繞該模型建立長期依賴前,請檢查更新日誌。

文章精要

DeepSeek V4 Pro 0813 是採用 MIT 授權的開放權重混合專家模型,總參數量 1.6 兆、每個 token 啟用約 490 億參數,並擁有 100 萬 token 上下文視窗。本文將這些架構事實與部署記憶體區分開來,解釋官方基準條件,記錄截至 2026 年 9 月 14 日核對的 DeepSeek 直連 API 定價,並提供受支援的 API 起點。

相關文章

相關模型

WhatsApp