DeepSeek V4 Pro 0813: цены, бенчмарки и открытые веса

DeepSeek V4 Pro 0813 — общедоступная сборка от 13 августа 2026 года крупнейшей модели V4 от DeepSeek. Она сочетает 1.6 триллиона общих параметров примерно с 49 миллиардами параметров, активируемых для каждого токена, поддерживает окно контекста в один миллион токенов и доступна как через API DeepSeek, так и в виде весов под лицензией MIT. Эти ключевые числа реальны, но их легко неправильно использовать. Активируемые параметры описывают вычисление на токен, а не объем checkpoint, который необходимо хранить.
Это руководство сосредоточено на том, что разработчики могут проверить в техническом отчете DeepSeek V4, карточке модели 0813 и текущей документации API. Данные о продукте и ценах проверены 14 сентября 2026 года.
DeepSeek V4 Pro 0813: кратко
| Пункт | Проверенная информация |
|---|---|
| Релиз | GA 13 августа 2026 года; заменяет V4 Pro Preview |
| Имя модели API | deepseek-v4-pro |
| Размер архитектуры | 1.6T общих параметров, приблизительно 49B активируемых |
| Контекст и вывод | контекст 1M токенов; до 384K вывода через документированный API |
| Модальности | текст; страница цен DeepSeek указывает, что V4 Pro не поддерживает vision |
| Интерфейсы | Chat Completions, Responses API и Anthropic-compatible API |
| Открытые веса | deepseek-ai/DeepSeek-V4-Pro-0813, лицензия MIT |
| Управление размышлением | low, high и max; размышление по умолчанию включено на high |
Журнал изменений DeepSeek от 10 сентября также сообщает, что API-сервис V4 Pro продолжится после 14 сентября с неизменным биллингом до дальнейшего уведомления. Имя API deepseek-v4-pro по-прежнему сопоставляется с 0813. Это отличается от линейки Flash: V4 Flash и V4 Flash Vision Experimental сняты с эксплуатации, а их устаревшие имена теперь направляются в V4.1 Flash. Рекомендуемое актуальное имя Flash — deepseek-flash. Это текущий статус, а не гарантия постоянной доступности.
Что означает MoE-конструкция 1.6T/49B
DeepSeek V4 Pro — модель mixture-of-experts. Число 1.6T учитывает полный набор параметров, тогда как маршрутизация активирует примерно 49B параметров для прямого прохода токена. Разреженная активация снижает вычисления на токен по сравнению с активацией каждого эксперта. Она не превращает checkpoint в модель 49B с точки зрения хранения или развертывания.
Технический отчет описывает гибрид Compressed Sparse Attention (CSA) и Heavily Compressed Attention (HCA) вместе с Manifold-Constrained Hyper-Connections (mHC). DeepSeek заявляет, что модели V4 предварительно обучались более чем на 32 триллионах токенов. При контексте в один миллион токенов V4 Pro использует 27% FLOPs однотокенного вывода и 10% KV cache V3.2 в тестах DeepSeek. Это сравнение не относится к каждому transformer.
Конфигурация опубликованного checkpoint дает больше деталей реализации: 61 скрытый слой, 384 маршрутизируемых эксперта, шесть маршрутизируемых экспертов, выбранных на токен, и один общий эксперт. В ней max_position_embeddings задано как 1,048,576. Эти поля подтверждают утверждение об одном миллионе токенов, но не обещают, что каждое развертывание сможет обслужить максимальный контекст при приемлемой задержке или конкурентности.
В карточке модели 0813 указано, что подключен модуль спекулятивного декодирования DSpark, и документированы флаги для vLLM и SGLang. Измеряйте пропускную способность на своем движке, оборудовании, контексте и конфигурации batch.
Официальные бенчмарки агентов и их условия
В релизе GA сообщается набор результатов, ориентированных на агентов. Ниже приведены наиболее полезные показатели публичных наборов.
| Бенчмарк | DeepSeek V4 Pro 0813 | Что следует учитывать |
|---|---|---|
| HLE | 42.7 без инструментов / 60.0 с инструментами | Доступ к инструментам существенно меняет настройку |
| Terminal-Bench 2.1 | 87.9 | Важны агентский framework и параметры сэмплирования |
| NL2Repo | 61.5 | Бенчмарк генерации репозитория |
| CyberGym | 83.3 | Бенчмарк агента безопасности |
| DeepSWE | 62.7 | Сообщен DeepSeek для релиза 0813 |
| Toolathlon-Verified | 74.1 | Проверенный набор задач использования инструментов |
DeepSeek запускала публичные задачи code-agent с DeepSeek Harness в минимальном режиме, усилием max, temperature = 1.0 и top_p = 0.95. Для сравнений требуются тот же harness, политика инструментов, бюджет повторов и настройка сэмплирования.
В релизе указаны DSBench-FullStack со значением 71.1 и DSBench-Hard со значением 67.2, но оба помечены как внутренние. Их нельзя воспроизвести по приведенным публичным материалам. См. руководство оценки DeepSeek Harness для контекста выполнения публичных наборов.
В рассмотренных здесь официальных источниках нет результата 96.4% SWE-bench Verified для V4 Pro 0813. Корректная замена потребовала бы закрепленной версии harness и датасета, а также раскрытого бюджета попыток.
Открытые веса: хранение определяется всеми параметрами
Репозиторий Hugging Face под лицензией MIT при проверке содержал примерно 893 GB файлов. Его конфигурация использует смешанные форматы, включая экспертов FP4 и метаданные квантизации FP8. В карточке модели приведены рецепт vLLM для одного четырех-GPU узла GB300, рецепт SGLang и локальные демонстрации преобразования.
Практический урок по памяти прост: веса есть у всех экспертов. Базовый расчет 4 бит для 1.6T параметров дает около 800 GB в десятичных единицах:
1.6 trillion parameters × 4 bits ÷ 8 = 800 billion bytes
Это нижняя граница размера. Масштабы, не-4-битные тензоры, runtime buffers, KV cache и накладные расходы framework добавляют память. Активное подмножество 49B составляет всего 24.5 GB при теоретических четырех битах, но остальные эксперты все равно нуждаются в хранении.
Рабочая станция с 96 GB не может вместить полный Q4 checkpoint. Вынос на CPU или диск меняет место хранения весов; он не устраняет их. Планирование емкости должно также учитывать контекст, размер batch, конкурентность и движок обслуживания.
Используйте официальные рецепты vLLM и SGLang как чувствительные к версиям отправные точки. Для этой статьи они не запускались, а пример DeepSeek с четырьмя GB300 не подтверждает конфигурацию с восемью H100 или потребительскими GPU.
Цены API DeepSeek на 14 сентября 2026 года
DeepSeek по-разному тарифицирует вход V4 Pro при попаданиях и промахах кеша, затем применяет пиковые и непиковые ставки в будни. Цены ниже приведены в долларах США за один миллион токенов в прямом API DeepSeek.
| Позиция биллинга | Непиковая | Пиковая |
|---|---|---|
| Кешированный вход | $0.022 | $0.044 |
| Некешированный вход | $0.66 | $1.32 |
| Выход | $1.98 | $3.96 |
Пиковые периоды — с понедельника по пятницу, 01:00-04:00 UTC и 06:00-10:00 UTC. Все остальные периоды непиковые. DeepSeek отмечает, что цены могут измениться, поэтому production-калькуляторы должны хранить ставки с датой вступления в силу и статусом кеша.
Запрос со 100,000 некешированными входными токенами и 10,000 выходными токенами стоит $0.0858 в непиковое время или $0.1716 в пиковое. Это не включает повторы и ходы циклов инструментов. Для более широкой модели стоимости используйте руководство сравнения цен LLM API.
Для доступа через шлюз проверьте точный маршрут модели и условия биллинга в каталоге моделей Tokenhot. Его цены шлюза отделены от прямых цен DeepSeek выше. Руководство доступа к DeepSeek за пределами Китая охватывает проверки учетной записи, API и развертывания.
Поддерживаемая отправная точка Responses API
DeepSeek документирует нативную поддержку Responses API на https://api.deepseek.com. В этом минимальном примере Python для ключа используется переменная окружения, а для модели — официальное имя V4 Pro:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.responses.create(
model="deepseek-v4-pro",
instructions="Review the code for correctness and cite the relevant functions.",
input="Explain the failure mode in this retry loop: ...",
)
print(response.output_text)
Установите актуальный OpenAI Python SDK, который предоставляет client.responses.create, задайте DEEPSEEK_API_KEY и замените пример ввода своим содержимым. Фрагмент следует документированной DeepSeek форме запроса, но не запускался для этой статьи, поскольку не проводился API-тест с учетными данными.
Размышление по умолчанию имеет уровень high. В документации режима размышления DeepSeek сказано, что temperature, presence_penalty и frequency_penalty не влияют на этот режим. Многоходовые вызовы инструментов должны возвращать reasoning_content согласно документации. Обрабатывайте ответы HTTP 429; указанное ограничение конкурентности учетной записи для V4 Pro — 500, а более высокая емкость требует запроса в DeepSeek.
API или самостоятельный хостинг: практическое решение
Используйте API для быстрой оценки или переменного спроса. Измеряйте успех задач, использование вывода, попадания кеша и повторы; низкая цена токена не гарантирует низкой стоимости успешной задачи.
Выбирайте самостоятельный хостинг, если автономная работа, контроль инфраструктуры или исследование весов оправдывают checkpoint. Подтвердите поддержку V4 и DSpark, затем смоделируйте полный бюджет памяти. Рецепт DeepSeek с четырьмя GB300 не подтверждает меньший кластер. Руководство по альтернативам OpenRouter охватывает критерии сравнения шлюзов.
Часто задаваемые вопросы
Действительно ли DeepSeek V4 Pro 0813 — модель 1.6T с только 49B активных параметров?
Да. Число 49B уменьшает вычисление на токен; оно не уменьшает хранимый checkpoint 1.6T до 49B параметров.
Может ли полная модель работать в 96 GB с квантизацией Q4?
Нет. Четыре бита для 1.6T параметров — это около 800 GB до метаданных и runtime memory. Машине с 96 GB нужен значительный offload или меньшая модель.
Набрал ли DeepSeek V4 Pro 96.4% на SWE-bench Verified?
Ни один рассмотренный здесь официальный источник 0813 не сообщает такой результат. Вместо этого используйте опубликованную таблицу бенчмарков агентов и условия ее harness.
Что охватывает окно контекста в один миллион токенов?
API указывает окно контекста 1M токенов, а конфигурация checkpoint задает 1,048,576 позиций. Планируйте вместе бюджеты ввода и вывода, а не рассматривайте заявленное окно как неограниченный лимит промпта. Стоимость и скорость также зависят от кеширования, конкурентности и оборудования.
Поддерживает ли V4 Pro изображения?
Нет, согласно текущей таблице моделей DeepSeek. Таблица отмечает поддержку vision для deepseek-flash и отсутствие поддержки для deepseek-v4-pro.
Прекращается ли работа API V4 Pro после 14 сентября 2026 года?
Обновление DeepSeek от 10 сентября говорит, что API-сервис продолжится после 14 сентября с неизменным биллингом; при изменении статуса последует дальнейшее уведомление. Проверяйте журнал изменений, прежде чем строить долгосрочную зависимость от модели.
DeepSeek V4 Pro 0813 — открытая модель mixture-of-experts под лицензией MIT с 1.6 триллиона общих параметров, примерно 49 миллиардами активируемых параметров и окном контекста в один миллион токенов. В этом руководстве архитектурные факты отделены от памяти развертывания, объяснены условия официальных бенчмарков, приведены прямые цены API DeepSeek, проверенные 14 сентября 2026 года, и дана поддерживаемая отправная точка API.


