DeepSeek V4 Pro 0813: Giá, benchmark và trọng số mở

DeepSeek V4 Pro 0813 là bản phát hành rộng rãi ngày 13/8/2026 của model V4 lớn nhất từ DeepSeek. Model kết hợp tổng cộng 1,6 nghìn tỷ tham số với khoảng 49 tỷ tham số được kích hoạt trên mỗi token, hỗ trợ cửa sổ ngữ cảnh một triệu token và có cả trên API DeepSeek lẫn dưới dạng trọng số theo giấy phép MIT. Những con số nổi bật này là thật, nhưng rất dễ bị dùng sai. Tham số được kích hoạt mô tả lượng tính toán trên mỗi token, không phải dung lượng checkpoint phải lưu.
Hướng dẫn này tập trung vào những gì nhà phát triển có thể xác minh từ báo cáo kỹ thuật DeepSeek V4, model card 0813 và tài liệu API hiện tại. Thông tin sản phẩm và giá được kiểm tra ngày 14/9/2026.
Tổng quan DeepSeek V4 Pro 0813
| Hạng mục | Chi tiết đã xác minh |
|---|---|
| Phát hành | GA ngày 13/8/2026; thay thế V4 Pro Preview |
| Tên model API | deepseek-v4-pro |
| Quy mô kiến trúc | Tổng tham số 1.6T, khoảng 49B tham số được kích hoạt |
| Ngữ cảnh và đầu ra | Ngữ cảnh 1M token; đầu ra tối đa 384K qua API theo tài liệu |
| Phương thức | Văn bản; trang giá DeepSeek cho biết V4 Pro không hỗ trợ thị giác |
| Giao diện | Chat Completions, Responses API và API tương thích Anthropic |
| Trọng số mở | deepseek-ai/DeepSeek-V4-Pro-0813, giấy phép MIT |
| Điều khiển thinking | low, high và max; thinking mặc định được bật ở high |
Nhật ký thay đổi ngày 10/9 của DeepSeek cũng cho biết công ty sẽ tiếp tục dịch vụ API V4 Pro sau ngày 14/9, với phương thức tính phí không đổi cho đến khi có thông báo khác. Tên API deepseek-v4-pro vẫn ánh xạ tới 0813. Điều này khác với dòng Flash: V4 Flash và V4 Flash Vision Experimental đã ngừng hoạt động, còn tên cũ hiện chuyển tới V4.1 Flash. Tên Flash hiện được khuyến nghị là deepseek-flash. Đây là trạng thái hiện tại, không phải bảo đảm cung cấp vĩnh viễn.
Ý nghĩa của thiết kế MoE 1.6T/49B
DeepSeek V4 Pro là một model mixture-of-experts. Con số 1.6T tính toàn bộ tập tham số, trong khi cơ chế định tuyến kích hoạt khoảng 49B tham số cho lượt truyền xuôi của một token. Kích hoạt thưa làm giảm lượng tính toán cần thiết cho mỗi token so với việc kích hoạt mọi expert. Nó không biến checkpoint thành model 49B khi lưu trữ hoặc triển khai.
Báo cáo kỹ thuật mô tả mô hình kết hợp Compressed Sparse Attention (CSA) và Heavily Compressed Attention (HCA), cùng Manifold-Constrained Hyper-Connections (mHC). DeepSeek cho biết các model V4 được tiền huấn luyện trên hơn 32 nghìn tỷ token. Với ngữ cảnh một triệu token, V4 Pro dùng 27% FLOPs suy luận một token và 10% KV cache của V3.2 trong thử nghiệm DeepSeek. So sánh này không áp dụng cho mọi Transformer.
Cấu hình checkpoint được phát hành cung cấp thêm chi tiết triển khai: 61 lớp ẩn, 384 expert định tuyến, sáu expert định tuyến được chọn trên mỗi token và một expert dùng chung. Cấu hình đặt max_position_embeddings thành 1,048,576. Các trường này củng cố tuyên bố một triệu token, nhưng không hứa rằng mọi cách triển khai đều có thể phục vụ ngữ cảnh tối đa với độ trễ hoặc mức đồng thời chấp nhận được.
Model card 0813 cho biết một mô-đun speculative decoding DSpark được đính kèm và ghi nhận các cờ cho vLLM và SGLang. Hãy đo thông lượng trên engine, phần cứng, ngữ cảnh và cấu hình batch của bạn.
Benchmark agent chính thức và điều kiện đo
Bản GA công bố một tập kết quả hướng tới agent. Dưới đây là các số liệu hữu ích nhất từ những bộ đánh giá công khai.
| Benchmark | DeepSeek V4 Pro 0813 | Điều cần lưu ý |
|---|---|---|
| HLE | 42.7 không dùng công cụ / 60.0 có công cụ | Quyền truy cập công cụ làm thay đổi đáng kể thiết lập |
| Terminal-Bench 2.1 | 87.9 | Framework agent và thiết lập lấy mẫu có ảnh hưởng |
| NL2Repo | 61.5 | Benchmark tạo repository |
| CyberGym | 83.3 | Benchmark agent bảo mật |
| DeepSWE | 62.7 | DeepSeek báo cáo cho bản phát hành 0813 |
| Toolathlon-Verified | 74.1 | Tập tác vụ dùng công cụ đã xác minh |
DeepSeek chạy các tác vụ code agent công khai bằng DeepSeek Harness ở chế độ minimal, effort max, temperature = 1.0 và top_p = 0.95. Mọi so sánh đều cần cùng harness, chính sách công cụ, ngân sách thử lại và thiết lập lấy mẫu.
Bản phát hành liệt kê DSBench-FullStack đạt 71.1 và DSBench-Hard đạt 67.2, nhưng gắn nhãn cả hai là nội bộ. Không thể tái tạo chúng từ những tài liệu công khai được trích dẫn. Xem hướng dẫn đánh giá DeepSeek Harness để hiểu bối cảnh chạy các bộ công khai.
Các nguồn chính thức được xem xét ở đây không có kết quả SWE-bench Verified 96,4% cho V4 Pro 0813. Một kết quả thay thế hợp lệ cần cố định bản sửa đổi harness và tập dữ liệu, đồng thời công khai ngân sách số lần thử.
Trọng số mở: lưu trữ dựa trên toàn bộ tham số
Repository Hugging Face theo giấy phép MIT hiển thị khoảng 893 GB tệp khi được kiểm tra. Cấu hình dùng nhiều định dạng, bao gồm expert FP4 và siêu dữ liệu lượng tử hóa FP8. Model card cung cấp công thức vLLM cho một node GB300 bốn GPU, công thức SGLang và bản demo chuyển đổi cục bộ.
Bài học thực tế về bộ nhớ rất đơn giản: mọi expert vẫn có trọng số. Phép tính 4-bit cơ bản cho 1.6T tham số vào khoảng 800 GB theo đơn vị thập phân:
1.6 trillion parameters × 4 bits ÷ 8 = 800 billion bytes
Đây là mức sàn để ước tính dung lượng. Scale, tensor không phải 4-bit, buffer runtime, KV cache và chi phí framework làm tăng bộ nhớ. Phần 49B đang hoạt động chỉ là 24,5 GB ở mức bốn bit lý thuyết, nhưng các expert còn lại vẫn cần chỗ lưu.
Máy trạm 96 GB không thể chứa checkpoint Q4 hoàn chỉnh. Offload sang CPU hoặc đĩa chỉ thay đổi nơi chứa trọng số; nó không loại bỏ chúng. Hoạch định dung lượng còn phải tính tới ngữ cảnh, kích thước batch, mức đồng thời và serving engine.
Hãy dùng công thức vLLM và SGLang chính thức làm điểm khởi đầu phụ thuộc phiên bản. Các công thức này chưa được chạy cho bài viết, và ví dụ bốn GB300 của DeepSeek không xác thực thiết lập tám H100 hay GPU phổ thông.
Giá DeepSeek API tại ngày 14/9/2026
DeepSeek tính phí đầu vào V4 Pro khác nhau cho cache hit và cache miss, sau đó áp dụng mức giá giờ cao điểm và thấp điểm trong ngày thường. Giá dưới đây tính bằng USD trên một triệu token của API trực tiếp DeepSeek.
| Hạng mục tính phí | Thấp điểm | Cao điểm |
|---|---|---|
| Đầu vào đã cache | $0.022 | $0.044 |
| Đầu vào chưa cache | $0.66 | $1.32 |
| Đầu ra | $1.98 | $3.96 |
Giờ cao điểm là từ thứ Hai đến thứ Sáu, 01:00–04:00 UTC và 06:00–10:00 UTC. Mọi thời gian khác là thấp điểm. DeepSeek lưu ý rằng giá có thể thay đổi, vì vậy công cụ tính phí production nên lưu mức giá cùng ngày hiệu lực và trạng thái cache.
Một yêu cầu có 100.000 token đầu vào chưa cache và 10.000 token đầu ra tốn $0.0858 vào giờ thấp điểm hoặc $0.1716 vào giờ cao điểm. Con số này không gồm lần thử lại và các lượt trong vòng lặp công cụ. Xem hướng dẫn so sánh giá LLM API để lập mô hình chi phí rộng hơn.
Với truy cập qua gateway, hãy kiểm tra chính xác tuyến model và điều kiện tính phí trong danh mục model Tokenhot. Giá gateway là báo giá riêng, khác với giá trực tiếp DeepSeek ở trên. Hướng dẫn truy cập DeepSeek ngoài Trung Quốc trình bày các bước kiểm tra tài khoản, API và triển khai.
Điểm khởi đầu Responses API được hỗ trợ
DeepSeek ghi nhận hỗ trợ Responses API gốc tại https://api.deepseek.com. Ví dụ Python tối giản này dùng biến môi trường cho khóa và tên model V4 Pro chính thức:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.responses.create(
model="deepseek-v4-pro",
instructions="Review the code for correctness and cite the relevant functions.",
input="Explain the failure mode in this retry loop: ...",
)
print(response.output_text)
Cài đặt phiên bản OpenAI Python SDK hiện hành có client.responses.create, đặt DEEPSEEK_API_KEY và thay đầu vào mẫu bằng nội dung của bạn. Đoạn mã tuân theo định dạng yêu cầu trong tài liệu DeepSeek nhưng chưa được chạy cho bài viết vì không thực hiện thử nghiệm API có thông tin xác thực.
Thinking mặc định là high. Tài liệu thinking mode của DeepSeek cho biết temperature, presence_penalty và frequency_penalty không có tác dụng trong chế độ này. Lệnh gọi công cụ nhiều lượt phải trả lại reasoning_content đúng như tài liệu. Hãy xử lý phản hồi HTTP 429; giới hạn đồng thời tài khoản được liệt kê cho V4 Pro là 500, còn dung lượng cao hơn cần gửi yêu cầu tới DeepSeek.
API hay tự host: quyết định thực tế
Dùng API để đánh giá nhanh hoặc khi nhu cầu biến động. Đo tỷ lệ tác vụ thành công, lượng đầu ra sử dụng, cache hit và lần thử lại; giá token thấp không bảo đảm chi phí trên mỗi tác vụ thành công thấp.
Tự host khi vận hành ngoại tuyến, quyền kiểm soát hạ tầng hoặc nghiên cứu trọng số đủ để biện minh cho checkpoint. Xác nhận hỗ trợ V4 và DSpark, sau đó lập mô hình toàn bộ ngân sách bộ nhớ. Công thức bốn GB300 của DeepSeek không xác thực một cụm nhỏ hơn. Hướng dẫn các lựa chọn thay thế OpenRouter trình bày tiêu chí so sánh gateway.
Câu hỏi thường gặp
DeepSeek V4 Pro 0813 có thực sự là model 1.6T với chỉ 49B tham số hoạt động không?
Có. Con số 49B giảm lượng tính toán trên mỗi token; nó không thu nhỏ checkpoint 1.6T phải lưu xuống còn 49B tham số.
Model đầy đủ có thể chạy trong 96 GB với lượng tử hóa Q4 không?
Không. Bốn bit trên toàn bộ 1.6T tham số đã là khoảng 800 GB trước siêu dữ liệu và bộ nhớ runtime. Máy 96 GB cần offload rất lớn hoặc một model nhỏ hơn.
DeepSeek V4 Pro có đạt 96,4% trên SWE-bench Verified không?
Không nguồn chính thức nào về 0813 được xem xét ở đây báo cáo kết quả đó. Hãy dùng bảng benchmark agent đã công bố và điều kiện harness đi kèm.
Cửa sổ ngữ cảnh một triệu token bao gồm những gì?
API liệt kê cửa sổ ngữ cảnh 1M token, còn cấu hình checkpoint đặt 1,048,576 vị trí. Hãy lập ngân sách đầu vào và đầu ra cùng nhau thay vì coi cửa sổ nổi bật này là dung lượng prompt không giới hạn. Chi phí và tốc độ còn phụ thuộc cache, mức đồng thời và phần cứng.
V4 Pro có hỗ trợ hình ảnh không?
Không, theo bảng model hiện tại của DeepSeek. Bảng đánh dấu deepseek-flash hỗ trợ thị giác và deepseek-v4-pro không hỗ trợ.
API V4 Pro có ngừng hoạt động sau ngày 14/9/2026 không?
Cập nhật ngày 10/9 của DeepSeek cho biết dịch vụ API sẽ tiếp tục sau ngày 14/9 với cách tính phí không đổi, và sẽ có thông báo tiếp theo nếu trạng thái thay đổi. Hãy kiểm tra nhật ký thay đổi trước khi xây dựng phụ thuộc dài hạn vào model.
DeepSeek V4 Pro 0813 là model mixture-of-experts trọng số mở theo giấy phép MIT, có tổng cộng 1,6 nghìn tỷ tham số, khoảng 49 tỷ tham số được kích hoạt và cửa sổ ngữ cảnh một triệu token. Hướng dẫn này tách các dữ kiện kiến trúc khỏi bộ nhớ triển khai, giải thích điều kiện benchmark chính thức, ghi nhận giá API trực tiếp của DeepSeek được kiểm tra ngày 14/9/2026 và cung cấp điểm khởi đầu API được hỗ trợ.


