Инженерия ИИ

DeepSeek V4 Pro 0813: цены, бенчмарки и открытые веса

TTokenhot Team19 августа 2026 г.8 мин чтения
DeepSeek V4 Pro 0813: цены, бенчмарки и открытые веса

DeepSeek V4 Pro 0813 — общедоступная сборка от 13 августа 2026 года крупнейшей модели V4 от DeepSeek. Она сочетает 1.6 триллиона общих параметров примерно с 49 миллиардами параметров, активируемых для каждого токена, поддерживает окно контекста в один миллион токенов и доступна как через API DeepSeek, так и в виде весов под лицензией MIT. Эти ключевые числа реальны, но их легко неправильно использовать. Активируемые параметры описывают вычисление на токен, а не объем checkpoint, который необходимо хранить.

Это руководство сосредоточено на том, что разработчики могут проверить в техническом отчете DeepSeek V4, карточке модели 0813 и текущей документации API. Данные о продукте и ценах проверены 14 сентября 2026 года.

DeepSeek V4 Pro 0813: кратко

Пункт Проверенная информация
Релиз GA 13 августа 2026 года; заменяет V4 Pro Preview
Имя модели API deepseek-v4-pro
Размер архитектуры 1.6T общих параметров, приблизительно 49B активируемых
Контекст и вывод контекст 1M токенов; до 384K вывода через документированный API
Модальности текст; страница цен DeepSeek указывает, что V4 Pro не поддерживает vision
Интерфейсы Chat Completions, Responses API и Anthropic-compatible API
Открытые веса deepseek-ai/DeepSeek-V4-Pro-0813, лицензия MIT
Управление размышлением low, high и max; размышление по умолчанию включено на high

Журнал изменений DeepSeek от 10 сентября также сообщает, что API-сервис V4 Pro продолжится после 14 сентября с неизменным биллингом до дальнейшего уведомления. Имя API deepseek-v4-pro по-прежнему сопоставляется с 0813. Это отличается от линейки Flash: V4 Flash и V4 Flash Vision Experimental сняты с эксплуатации, а их устаревшие имена теперь направляются в V4.1 Flash. Рекомендуемое актуальное имя Flash — deepseek-flash. Это текущий статус, а не гарантия постоянной доступности.

Что означает MoE-конструкция 1.6T/49B

DeepSeek V4 Pro — модель mixture-of-experts. Число 1.6T учитывает полный набор параметров, тогда как маршрутизация активирует примерно 49B параметров для прямого прохода токена. Разреженная активация снижает вычисления на токен по сравнению с активацией каждого эксперта. Она не превращает checkpoint в модель 49B с точки зрения хранения или развертывания.

Технический отчет описывает гибрид Compressed Sparse Attention (CSA) и Heavily Compressed Attention (HCA) вместе с Manifold-Constrained Hyper-Connections (mHC). DeepSeek заявляет, что модели V4 предварительно обучались более чем на 32 триллионах токенов. При контексте в один миллион токенов V4 Pro использует 27% FLOPs однотокенного вывода и 10% KV cache V3.2 в тестах DeepSeek. Это сравнение не относится к каждому transformer.

Конфигурация опубликованного checkpoint дает больше деталей реализации: 61 скрытый слой, 384 маршрутизируемых эксперта, шесть маршрутизируемых экспертов, выбранных на токен, и один общий эксперт. В ней max_position_embeddings задано как 1,048,576. Эти поля подтверждают утверждение об одном миллионе токенов, но не обещают, что каждое развертывание сможет обслужить максимальный контекст при приемлемой задержке или конкурентности.

В карточке модели 0813 указано, что подключен модуль спекулятивного декодирования DSpark, и документированы флаги для vLLM и SGLang. Измеряйте пропускную способность на своем движке, оборудовании, контексте и конфигурации batch.

Официальные бенчмарки агентов и их условия

В релизе GA сообщается набор результатов, ориентированных на агентов. Ниже приведены наиболее полезные показатели публичных наборов.

Бенчмарк DeepSeek V4 Pro 0813 Что следует учитывать
HLE 42.7 без инструментов / 60.0 с инструментами Доступ к инструментам существенно меняет настройку
Terminal-Bench 2.1 87.9 Важны агентский framework и параметры сэмплирования
NL2Repo 61.5 Бенчмарк генерации репозитория
CyberGym 83.3 Бенчмарк агента безопасности
DeepSWE 62.7 Сообщен DeepSeek для релиза 0813
Toolathlon-Verified 74.1 Проверенный набор задач использования инструментов

DeepSeek запускала публичные задачи code-agent с DeepSeek Harness в минимальном режиме, усилием max, temperature = 1.0 и top_p = 0.95. Для сравнений требуются тот же harness, политика инструментов, бюджет повторов и настройка сэмплирования.

В релизе указаны DSBench-FullStack со значением 71.1 и DSBench-Hard со значением 67.2, но оба помечены как внутренние. Их нельзя воспроизвести по приведенным публичным материалам. См. руководство оценки DeepSeek Harness для контекста выполнения публичных наборов.

В рассмотренных здесь официальных источниках нет результата 96.4% SWE-bench Verified для V4 Pro 0813. Корректная замена потребовала бы закрепленной версии harness и датасета, а также раскрытого бюджета попыток.

Открытые веса: хранение определяется всеми параметрами

Репозиторий Hugging Face под лицензией MIT при проверке содержал примерно 893 GB файлов. Его конфигурация использует смешанные форматы, включая экспертов FP4 и метаданные квантизации FP8. В карточке модели приведены рецепт vLLM для одного четырех-GPU узла GB300, рецепт SGLang и локальные демонстрации преобразования.

Практический урок по памяти прост: веса есть у всех экспертов. Базовый расчет 4 бит для 1.6T параметров дает около 800 GB в десятичных единицах:

1.6 trillion parameters × 4 bits ÷ 8 = 800 billion bytes

Это нижняя граница размера. Масштабы, не-4-битные тензоры, runtime buffers, KV cache и накладные расходы framework добавляют память. Активное подмножество 49B составляет всего 24.5 GB при теоретических четырех битах, но остальные эксперты все равно нуждаются в хранении.

Рабочая станция с 96 GB не может вместить полный Q4 checkpoint. Вынос на CPU или диск меняет место хранения весов; он не устраняет их. Планирование емкости должно также учитывать контекст, размер batch, конкурентность и движок обслуживания.

Используйте официальные рецепты vLLM и SGLang как чувствительные к версиям отправные точки. Для этой статьи они не запускались, а пример DeepSeek с четырьмя GB300 не подтверждает конфигурацию с восемью H100 или потребительскими GPU.

Цены API DeepSeek на 14 сентября 2026 года

DeepSeek по-разному тарифицирует вход V4 Pro при попаданиях и промахах кеша, затем применяет пиковые и непиковые ставки в будни. Цены ниже приведены в долларах США за один миллион токенов в прямом API DeepSeek.

Позиция биллинга Непиковая Пиковая
Кешированный вход $0.022 $0.044
Некешированный вход $0.66 $1.32
Выход $1.98 $3.96

Пиковые периоды — с понедельника по пятницу, 01:00-04:00 UTC и 06:00-10:00 UTC. Все остальные периоды непиковые. DeepSeek отмечает, что цены могут измениться, поэтому production-калькуляторы должны хранить ставки с датой вступления в силу и статусом кеша.

Запрос со 100,000 некешированными входными токенами и 10,000 выходными токенами стоит $0.0858 в непиковое время или $0.1716 в пиковое. Это не включает повторы и ходы циклов инструментов. Для более широкой модели стоимости используйте руководство сравнения цен LLM API.

Для доступа через шлюз проверьте точный маршрут модели и условия биллинга в каталоге моделей Tokenhot. Его цены шлюза отделены от прямых цен DeepSeek выше. Руководство доступа к DeepSeek за пределами Китая охватывает проверки учетной записи, API и развертывания.

Поддерживаемая отправная точка Responses API

DeepSeek документирует нативную поддержку Responses API на https://api.deepseek.com. В этом минимальном примере Python для ключа используется переменная окружения, а для модели — официальное имя V4 Pro:

import os

from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.responses.create(
    model="deepseek-v4-pro",
    instructions="Review the code for correctness and cite the relevant functions.",
    input="Explain the failure mode in this retry loop: ...",
)

print(response.output_text)

Установите актуальный OpenAI Python SDK, который предоставляет client.responses.create, задайте DEEPSEEK_API_KEY и замените пример ввода своим содержимым. Фрагмент следует документированной DeepSeek форме запроса, но не запускался для этой статьи, поскольку не проводился API-тест с учетными данными.

Размышление по умолчанию имеет уровень high. В документации режима размышления DeepSeek сказано, что temperature, presence_penalty и frequency_penalty не влияют на этот режим. Многоходовые вызовы инструментов должны возвращать reasoning_content согласно документации. Обрабатывайте ответы HTTP 429; указанное ограничение конкурентности учетной записи для V4 Pro — 500, а более высокая емкость требует запроса в DeepSeek.

API или самостоятельный хостинг: практическое решение

Используйте API для быстрой оценки или переменного спроса. Измеряйте успех задач, использование вывода, попадания кеша и повторы; низкая цена токена не гарантирует низкой стоимости успешной задачи.

Выбирайте самостоятельный хостинг, если автономная работа, контроль инфраструктуры или исследование весов оправдывают checkpoint. Подтвердите поддержку V4 и DSpark, затем смоделируйте полный бюджет памяти. Рецепт DeepSeek с четырьмя GB300 не подтверждает меньший кластер. Руководство по альтернативам OpenRouter охватывает критерии сравнения шлюзов.

Часто задаваемые вопросы

Действительно ли DeepSeek V4 Pro 0813 — модель 1.6T с только 49B активных параметров?

Да. Число 49B уменьшает вычисление на токен; оно не уменьшает хранимый checkpoint 1.6T до 49B параметров.

Может ли полная модель работать в 96 GB с квантизацией Q4?

Нет. Четыре бита для 1.6T параметров — это около 800 GB до метаданных и runtime memory. Машине с 96 GB нужен значительный offload или меньшая модель.

Набрал ли DeepSeek V4 Pro 96.4% на SWE-bench Verified?

Ни один рассмотренный здесь официальный источник 0813 не сообщает такой результат. Вместо этого используйте опубликованную таблицу бенчмарков агентов и условия ее harness.

Что охватывает окно контекста в один миллион токенов?

API указывает окно контекста 1M токенов, а конфигурация checkpoint задает 1,048,576 позиций. Планируйте вместе бюджеты ввода и вывода, а не рассматривайте заявленное окно как неограниченный лимит промпта. Стоимость и скорость также зависят от кеширования, конкурентности и оборудования.

Поддерживает ли V4 Pro изображения?

Нет, согласно текущей таблице моделей DeepSeek. Таблица отмечает поддержку vision для deepseek-flash и отсутствие поддержки для deepseek-v4-pro.

Прекращается ли работа API V4 Pro после 14 сентября 2026 года?

Обновление DeepSeek от 10 сентября говорит, что API-сервис продолжится после 14 сентября с неизменным биллингом; при изменении статуса последует дальнейшее уведомление. Проверяйте журнал изменений, прежде чем строить долгосрочную зависимость от модели.

Краткое содержание

DeepSeek V4 Pro 0813 — открытая модель mixture-of-experts под лицензией MIT с 1.6 триллиона общих параметров, примерно 49 миллиардами активируемых параметров и окном контекста в один миллион токенов. В этом руководстве архитектурные факты отделены от памяти развертывания, объяснены условия официальных бенчмарков, приведены прямые цены API DeepSeek, проверенные 14 сентября 2026 года, и дана поддерживаемая отправная точка API.

Похожие статьи

Похожие модели

WhatsApp