Тарифы

Сравнение цен на LLM API в 2026 году: формула и тарифы

TTokenhot Team14 августа 2026 г.Обновлено 14 сентября 2026 г.8 мин чтения
Сравнение цен на LLM API в 2026 году: формула и тарифы

Сравнение цен на LLM API полезно лишь тогда, когда все числа приведены к одной единице биллинга, а расчёт отражает реальную рабочую нагрузку. Ввод, кешированный ввод, запись в кеш, вывод, скрытые токены рассуждений, надбавки за длинный контекст, инструменты и повторные запросы могут оказаться отдельными строками счёта.

В этом руководстве приведён ограниченный и воспроизводимый снимок розничных цен на текстовые модели от их разработчиков, проверенный 14 сентября 2026 года. Затем мы покажем, как превратить телеметрию запросов в месячную оценку. Цены указаны в долларах США без налогов, корпоративных скидок, корректировок облачных маркетплейсов и региональных надбавок. Перед утверждением бюджета обязательно перепроверьте источник по ссылке.

Снимок цен на API текстовых моделей в 2026 году

Таблица представляет практическую выборку, а не каталог всех моделей. Если не указано иное, тарифы приведены за один миллион токенов в стандартном сервисе самого поставщика. Более низкая цена токена не означает одинаковое качество, задержку, надёжность или токенизацию разных моделей.

Поставщик и модель Стандартный ввод Кешированный ввод или попадание в кеш Вывод Условия, меняющие сумму счёта
OpenAI gpt-6-astra $10.00 $1.00 $50.00 Запись в кеш стоит $12.50. При вводе свыше 272K токенов весь запрос оплачивается по удвоенному тарифу ввода/кеша и тарифу вывода 1,5x. Batch и Flex стоят 50% от Standard, Fast — 2x.
OpenAI gpt-5.6-luna $0.20 $0.02 $1.20 Запись в кеш стоит 1,25x от некешированного ввода, то есть $0.25. При вводе свыше 272K токенов весь запрос стоит 2x по вводу и 1,5x по выводу.
Anthropic Claude Sonnet 5 $2.00 $0.20 $10.00 Запись в кеш на 5 минут стоит $2.50, на 1 час — $4.00. Batch: $1.00 за ввод и $5.00 за вывод.
Anthropic Claude Haiku 4.5 $1.00 $0.10 $5.00 Запись в кеш на 5 минут стоит $1.25, на 1 час — $2.00. Batch: $0.50 за ввод и $2.50 за вывод.
Google gemini-3.7-flash $0.75 $0.075 $3.75 Эти тарифы действуют до 31 декабря 2026 года. Хранение кешированного контекста дополнительно стоит $0.50 за миллион токенов в час. Ввод/вывод Batch — $0.375/$1.875.
DeepSeek deepseek-flash $0.15-$0.30 $0.003-$0.006 $0.60-$1.20 Нижние значения действуют вне пиковых часов, верхние — с 01:00 до 04:00 и с 06:00 до 10:00 UTC с понедельника по пятницу.
DeepSeek deepseek-v4-pro $0.66-$1.32 $0.022-$0.044 $1.98-$3.96 Действуют те же временные интервалы. По данным DeepSeek, сервис V4 Pro продолжит работу после 14 сентября 2026 года с этим методом биллинга.
Mistral Mistral Large 3 $0.50 $0.05 $1.50 В таблице Mistral эти значения обозначены как стандартные тарифы в USD; Batch, Priority и региональный инференс выбираются отдельно.

Строки DeepSeek заменяют устаревшие цены deepseek-chat и deepseek-reasoner, которые всё ещё встречаются в старых сравнениях. Контекст и особенности миграции конкретных моделей разобраны в руководстве по ценам DeepSeek V4 Pro и руководстве по использованию DeepSeek API за пределами Китая.

Цены разработчиков моделей — не цены Tokenhot

Таблица выше — это базовый уровень розничных цен поставщиков, а не предложение Tokenhot. Tokenhot публикует маршруты шлюза и актуальные тарифы в каталоге моделей, и они могут отличаться от прямых тарифов в зависимости от модели, канала или акции. Перед покупкой проверьте точный маршрут и указанную единицу биллинга. В примерах ниже используются только прямые тарифы из таблицы.

Это разделение важно и при сравнении шлюзов. Поставщик может включать маршрутизацию, оплату, резервный маршрут или доступ к модели в другую цену. В руководстве по альтернативам OpenRouter рассмотрены эксплуатационные вопросы, которые стоит сравнивать вместе с ценой единицы.

Формула стоимости LLM API

Начинайте с измеренного потребления, а не с количества слов. Каждое значение токенов должно включать сумму по успешным вызовам и всем оплачиваемым неудачным или повторным вызовам:

token_cost = (
    standard_input_tokens * standard_input_rate
  + cache_write_tokens     * cache_write_rate
  + cached_input_tokens    * cached_input_rate
  + billed_output_tokens   * output_rate
) / 1,000,000

total_cost = token_cost
           + cache_storage_cost
           + tool_call_cost
           + media_or_other_unit_cost

Заполняйте категории по объекту usage или счёту поставщика. Не оценивайте токены по числу символов одинаково для разных поставщиков: токенизаторы различаются. Не прибавляйте токены рассуждений дважды. Если API включает токены reasoning или thinking в оплачиваемый вывод, они уже входят в billed_output_tokens. Google прямо указывает, что цена вывода включает токены thinking; в записях usage OpenAI токены рассуждений показаны как детализация токенов вывода.

Пример расчёта: кеширование и затраты на повторы

Предположим, месячная нагрузка gpt-5.6-luna, где каждый запрос ниже порога тарификации длинного контекста, содержит:

  • 10 миллионов обычных входных токенов
  • 5 миллионов токенов записи в кеш
  • 80 миллионов кешированных входных токенов
  • 10 миллионов оплачиваемых выходных токенов, включая токены рассуждений

По тарифам на 14 сентября стоимость токенов составит:

(10 * $0.20) + (5 * $0.25) + (80 * $0.02) + (10 * $1.20)
= $2.00 + $1.25 + $1.60 + $12.00
= $16.85

Если те же 95 миллионов входных токенов целиком оплачивать как обычный ввод, счёт составит $19.00 + $12.00 = $31.00. При этих допущениях кеширование экономит $14.15 до учёта дополнительных платежей за инструменты.

Теперь добавим бюджетный сценарий, в котором повторы воспроизводят ту же смесь токенов и увеличивают их потребление на 5%. Оценка составит $16.85 x 1.05 = $17.6925, или $17.69 после округления в самом конце. В рабочей системе рассчитывайте стоимость повторов по фактически продублированному потреблению: тайм-аут до вывода, попадание в кеш и полное воспроизведение стоят по-разному.

Шесть деталей биллинга, меняющих результат

1. Вывод и рассуждения могут определять основную стоимость

Вывод часто стоит в несколько раз дороже обычного ввода. Агентные циклы также могут создавать токены рассуждений, которые не видны в финальном ответе. Ограничивайте вывод и рассуждения там, где API это поддерживает, и сохраняйте полную запись usage. Запрос с 300 видимыми токенами может иметь существенно большее число оплачиваемых выходных токенов.

2. У кеширования есть запись, чтение и иногда хранение

Попадание в кеш обходится дешевле лишь после записи и повторного использования содержимого. В примерах выше OpenAI и Anthropic берут повышенную плату за запись в кеш. Google указывает тариф кешированных токенов и хранение в токен-часах. Прогнозируйте стабильные префиксы промптов отдельно от меняющегося пользовательского содержимого, а затем измеряйте долю попаданий, не предполагая, что каждый подходящий промпт будет кеширован.

3. Скидка Batch меняет скорость на цену

В официальной документации OpenAI GPT-6 Astra, перечисленных моделей Anthropic и Google Gemini 3.7 Flash тарифы токенов Batch составляют 50%. Пакетные задания выполняются асинхронно и зависят от поддерживаемых поставщиком эндпоинтов и срока завершения. Оставьте интерактивный трафик на стандартных тарифах и переносите только допускающие задержку задачи: офлайн-классификацию, оценку или заполнение прошлых данных.

4. Длинный контекст может включить множитель для всего запроса

Не умножайте только токены сверх порога, если поставщик этого не указывает. При вводе свыше 272K токенов GPT-6 Astra явно применяет ко всему запросу удвоенные тарифы ввода/кеша и тариф вывода 1,5x. На странице GPT-5.6 Luna указаны 2x для ввода и 1,5x для вывода, но множитель кешированного ввода прямо не определён; уточните обработку кеша перед оценкой большого кешированного запроса. Anthropic сообщает, что Claude 4.6 и более новые модели включают полный контекст в один миллион токенов в стандартный тариф. Правила зависят от модели, поэтому записывайте размер промпта каждого запроса вместо единого глобального допущения.

5. Инструменты и повторы находятся вне заголовочной таблицы

Серверный поиск, выполнение кода, grounding, хранение и другие инструменты могут добавлять плату за вызов или использование. Повторы могут дублировать плату за токены и инструменты, даже если приложение показывает одно логическое действие пользователя. Используйте ограниченный экспоненциальный backoff, повторяйте только ошибки, обозначенные как временные, и присваивайте запросу идентификатор приложения для отслеживания дублирующейся работы.

6. Для изображений и видео используются другие единицы

По тарифам токенов текстовых моделей нельзя оценить любую мультимодальную нагрузку. API изображений могут брать плату за созданное изображение, вызов либо токены изображения и качество. API видео часто используют секунды, разрешение или уровни генерации. Составляйте отдельные формулы и складывайте промежуточные итоги.

Seedream предназначен для генерации изображений, а Seedance — семейство видео-моделей ByteDance. Разделяйте их цены и единицы биллинга. При смене поставщика видео используйте профильное сравнение и проверки жизненного цикла задач из руководства по миграции Sora API.

Как выбирать по стоимости реальной нагрузки

Экспортируйте хотя бы одну репрезентативную неделю использования по моделям и эндпоинтам. Разделите стандартный ввод, запись в кеш, попадания в кеш, оплачиваемый вывод, повторы, запросы с длинным контекстом, пакетный трафик и инструменты. Запустите фиксированный набор оценки на моделях-кандидатах, затем сравните успешность задач, распределение задержки, ограничения скорости и общее число оплачиваемых единиц. Самая дешёвая строка полезна лишь тогда, когда модель отвечает требованиям качества и эксплуатации.

Пересчитывайте затраты после любого изменения псевдонима модели, промпта, настройки рассуждений, лимита вывода, правила маршрутизации или токенизатора. Храните URL страницы цен и дату каждого снимка тарифа в таблице или сервисе учёта затрат, чтобы впоследствии объяснить расхождения в счетах.

Часто задаваемые вопросы

Какой LLM API самый дешёвый в 2026 году?

Универсально самого дешёвого API не существует. В этой датированной выборке DeepSeek Flash имеет самый низкий указанный тариф за попадание в кеш вне пиковых часов, а GPT-5.6 Luna — простой низкий стандартный тариф. Самый дешёвый пригодный вариант зависит от объёма вывода, повторного использования кеша, времени, инструментов, повторов, качества и допустимости пакетной обработки.

Токены рассуждений оплачиваются?

Часто да. Google указывает, что цена вывода включает токены thinking, а OpenAI сообщает токены рассуждений в детализации выходных токенов. Используйте оплачиваемую сумму вывода и документацию поставщика для конкретной модели; не делайте вывод о цене по длине видимого ответа.

Кеширование промптов всегда снижает затраты?

Нет. Нагрузка должна повторно использовать подходящий стабильный префикс достаточно часто, чтобы окупить запись в кеш и возможное хранение. Отслеживайте поля записи и чтения кеша, затем рассчитывайте точку безубыточности по тарифам модели.

Стоит ли сравнивать модели только по цене ввода?

Нет. Используйте полную формулу рабочей нагрузки. Генерация с большим выводом, агентные рассуждения, инструменты и повторы могут перевесить цену ввода, а Batch и попадания в кеш — снизить её.

Цены в этой статье — это цены Tokenhot?

Нет. В сравнительной таблице и примере использованы розничные цены самих поставщиков, проверенные 14 сентября 2026 года. Актуальный маршрут шлюза, цену и единицу биллинга Tokenhot проверяйте отдельно в каталоге моделей.

Краткое содержание

Датированное сравнение цен на LLM API с воспроизводимой формулой расчёта, подробным примером и условиями биллинга, которые не видны в заголовочных тарифах за токены.

Похожие статьи