← Все статьи
Новости13 мин чтения

ai api price и реальная стоимость запроса

Цена за токен не описывает стоимость функции. Разбираем формулу полной стоимости AI-запроса - кэш, изображения, повторы, комиссии шлюза - на подтверждённых тарифах Anthropic, OpenAI и одного шлюза.

Обложка статьи: ai api price и реальная стоимость запроса

Сто миллионов токенов на выходе Opus 4.8 обходятся примерно в $2500, а те же сто миллионов на входе Haiku 4.5 - около $100. Это по опубликованным тарифам Anthropic на 2026-07-18: Haiku 4.5 стоит $1/$5 за миллион входных/выходных токенов, Sonnet 4.6 - $3/$15, Opus 4.8 - $5/$25. Двадцатипятикратный разрыв тут даёт связка «модель плюс роль токена»; если зафиксировать роль и менять только модель, спред внутри линейки всё равно пятикратный. И это ещё до того, как в счёт войдёт что-то помимо голого текста.

Отсюда простой, но неудобный тезис: цена за токен не описывает стоимость функции. Если к токенам добавить кэширование, изображения, повторные вызовы и комиссию шлюза, хотя бы один вывод витринного сравнения переворачивается. Маршрут, который выглядел дешевле по ценнику, оказывается дороже на реальном пользовательском действии. Эта статья - не смета конкретного провайдера и не бенчмарк. Это воспроизводимый способ считать: единый сценарий, одинаковая нагрузка на все маршруты, разложение на измеряемые компоненты.

Кому это нужно прямо сейчас: продакт-менеджеру и финансовому владельцу, которые выбирают модель или шлюз под продуктовую нагрузку и не хотят закладывать в бюджет ложную дешевизну. Если ты выбираешь маршрут по рекламной строке, ошибка проявится не в документации, а в конце месяца в счёте. Маршрут при этом - не только модель, но и способ до неё дойти: прямой ключ вендора или шлюз со своей комиссией. Российский аналог OpenRouter, provod.ai, появится ниже именно в этой роли - как одна из строк формулы, которую надо заполнить наравне с прямым доступом.

Платите в рублях за AI-модели без наценки на токены через provod.ai

Что именно не входит в цену за токен?

Строка прайса показывает две величины: цену входа и цену выхода за миллион токенов. Это честные числа, но они описывают только одну из шести статей расхода на запрос. Остальные пять живут в отдельных разделах документации и в поведении твоего кода, а не в таблице тарифов.

Первая скрытая статья - кэширование. У OpenAI на флагманском gpt-5.5 стандартный вход стоит $5.00 за миллион, а кэшированный вход - отдельные $0.50 за миллион. Это, по данным OpenAI на 2026-07-18, две разные, невзаимозаменяемые цены на одной и той же модели. У Anthropic логика устроена иначе: кэш там не скидка, а множитель. Запись кэша на 5 минут стоит 1.25x базового входа, запись на 1 час - 2x, а чтение из кэша - всего 0.1x. То есть первый вызов дороже обычного, а выгода приходит только со второго, если структура промпта позволяет попасть в кэш.

Вторая статья - медиа. Картинка в запросе - это не «одно изображение», а вычисляемое число токенов. Anthropic переводит изображение по формуле ceil(ширина/28) × ceil(высота/28) визуальных токенов. Один и тот же кадр 1920x1080 стоит 1560 токенов на модели стандартного тира и 2691 токен на модели high-resolution-тира - около 1.7x за идентичный вход, и разницу создаёт только тир модели, а не сама картинка.

Третья - служебная нагрузка инструментов. Включение любого инструмента у Anthropic добавляет фиксированный overhead в системный промпт на каждый вызов - примерно 290–410 токенов для Opus 4.8 в зависимости от tool_choice, ещё до первого выходного токена. А веб-поиск как инструмент стоит $10 за 1000 поисков поверх обычной токенной тарификации.

Четвёртая - повторы. С ней придётся обойтись иначе, чем с остальными: подтверждённого тарифа под ней нет ни у одного вендора, поэтому ниже она войдёт в формулу как явно помеченное допущение, а не как факт.

Пятая - комиссия шлюза, если ты ходишь в модель не напрямую. Это отдельный слой поверх цены модели, и о нём тоже ниже. Сложи всё вместе - и станет видно, в чём ловушка: то, что выглядит как дешевое ии апи, обычно дёшево ровно в одной строке из шести. Остальные пять никто не считал.

Стопчатая диаграмма состава стоимости запроса: видимая строка токенов против пяти скрытых компонентов

Почему кэш и картинки ломают сравнение по прайсу?

Кэш меняет не цену, а форму расхода во времени. У Anthropic минимальная длина промпта, которую вообще можно кэшировать, - от 1024 до 4096 токенов в зависимости от модели. Короткий системный промпт закэшировать нельзя физически, и вся красивая арифметика 0.1x к нему не применяется. У OpenAI порог для попадания в кэш - минимум 1024 токена, для GPT-5.6 и новее запись кэша стоит 1.25x некэшированного входа, а префикс остаётся пригодным для повторного использования минимум около 30 минут; более ранние семейства кэшировали без отдельной платы за запись, но вытесняли префикс уже через 5–10 минут простоя, максимум до часа.

Практический вывод из этого один: единый флаг «включить кэш» нельзя переносить между моделями, не сверившись с конкретной строкой модели. Порог и TTL различаются внутри одного вендора. Если в сценарии повторный вызов приходит через 40 минут, на старой модели OpenAI кэш уже вытеснен, а на новой ещё жив - и это разные счета при одинаковом коде.

С картинками ситуация зеркальная. OpenAI считает изображения через патчи: original_patch_count = ceil(ширина/32) × ceil(высота/32), при необходимости ужимает под бюджет патчей модели и умножает на модельный множитель примерно 1.62–2.46. Режим low-detail берёт почти фиксированные ~65–129 токенов независимо от разрешения, а high-detail добавляет 4160–6240 токенов сверху в зависимости от соотношения сторон. То есть один только флаг detail при тех же пикселях умножает стоимость картинки в несколько раз.

Здесь легко получить обратный порядок. Модель с более дешёвым текстовым токеном может оказаться дороже на мультимодальном запросе, если её тир считает картинку по более жадной формуле. Именно поэтому сравнивать надо не строки прайса, а один и тот же кадр 1920x1080, прогнанный через формулы обоих вендоров. Формулы при этом привязаны к конкретным моделям и тирам - на следующем релизе их придётся пересчитать заново.

Дамбелл-график токенов за одно изображение 1920x1080 по тирам Anthropic и режимам detail OpenAI

Как посчитать полную стоимость одного запроса?

Собираем калькулятор. Идея простая: описать один сценарий и прогнать через него все маршруты, выделив каждый компонент отдельно. Формула полной стоимости одного запроса выглядит так:

TCO\_request = ( input\_tokens        \* input\_price

- output\_tokens       \* output\_price
- cache\_write\_tokens  \* input\_price \* write\_mult    # 1.25x / 2x у Anthropic
- cache\_read\_tokens   \* input\_price \* 0.1           # чтение из кэша
- image\_tokens        \* input\_price
- tool\_overhead\_tokens\* input\_price                 # 290–410 на вызов при инструментах
- web\_searches        \* search\_price )              # $10 за 1000 у Anthropic
- retry\_factor                                       # см. оговорку ниже
- (1 + commission)                                   # слой шлюза

Каждый множитель здесь берётся из подтверждённого тарифа, а не из ощущения. write_mult - это 1.25 для пятиминутного кэша Anthropic или 2 для часового; retry_factor - единственный множитель, под которым подтверждённого тарифа нет: официального вендорского правила о том, как тарифицируются упавшие запросы, таймауты и клиентские ретраи, в источниках не нашлось. Поэтому retry_factor - это инференс, операционное допущение: повторный вызов просто заново несёт тот же профиль стоимости, а не документированная политика. Если у тебя 5% вызовов уходят в ретрай, ставь 1.05 и помечай это как допущение.

Проверим на числах. Вопрос «сколько стоят 100 млн токенов для нейросети» звучит так, будто у него один ответ. Ответов минимум четыре, и различает их роль токена. Сто миллионов входных на Haiku 4.5 - $100. Те же сто миллионов, но на выходе Opus 4.8 - $2500. Сто миллионов входных на Opus - $500. А если этот вход приходит из кэша Anthropic на чтение (0.1x), те же сто миллионов стоят $50. Один объём, четыре счёта, разброс в пятьдесят раз - и ни одно из этих чисел не написано в строке прайса.

Теперь про пакетную обработку - это отдельный рычаг, не зависящий от выбора модели. Batch API у Anthropic режет цену входных и выходных токенов на 50% по всей линейке, у OpenAI батч тоже даёт ровно 50% против синхронного тарифа. Если сценарий терпит асинхронность, ты уменьшаешь весь токенный блок формулы вдвое, не меняя модель. Это и есть смысл разложения: видно, какой рычаг что двигает.

Барный график: 100 млн токенов дают суммы от $50 до $2500 в зависимости от роли токена и модели

А если ходить в модель через шлюз?

Тут появляется шестой слой - комиссия агрегатора, и она живёт отдельно от цены модели. Для примера возьмём одну опубликованную структуру: OpenRouter, по его тарифам на 2026-07-18, берёт 5.5% с пополнений кредитов картой и 5% на использование по своему ключу (bring-your-own-key), когда инференс по прайс-листу переваливает за $25,000 в месяц. Это иллюстрация одного конкретного шлюза, а не характеристика всех шлюзов сразу. Важен сам механизм: рекламная цена за токен у маршрута - это не та цена, которую ты фактически платишь после наложения комиссии.

Для российского продакта картина осложняется ещё и оплатой. Прямой доступ к Anthropic и OpenAI требует зарубежной карты и обхода блокировок, а это уже не про цену токена, а про то, дойдёт ли платёж вообще. Здесь агрегатор решает не арифметику, а доступ: единый API, совместимый с SDK OpenAI и Anthropic по смене ключа и base_url, и оплата в рублях. Например, provod.ai (российский OpenRouter) даёт оплату картой РФ, СБП или по счёту без зарубежной карты, а цены моделей отдаёт официальные, без собственной наценки. В формуле TCO это две разные вещи: строка commission на слое наценки сервиса обнуляется, а барьер платежа снимается вообще вне формулы. Подставлять это всё равно нужно с явно отделёнными условиями своего маршрута, не предполагая ни экономии, ни наценки заранее.

Подключение к такому маршруту в коде - это смена двух строк, а не переписывание интеграции:

from openai import OpenAI

client = OpenAI( api\_key="ВАШ\_КЛЮЧ", base\_url="https://api.provod.ai/v1", )

Смысл сравнения не в том, что один шлюз лучше другого по абсолютной цифре. Смысл в том, что дешевый api нейросетей, посчитанный без слоя оплаты и доступа, - это цена, которую из России просто не получится заплатить. Полная формула включает и этот барьер, даже если он не выражается в процентах.

Таблица решения: какой компонент когда включать

Не каждый сценарий требует всех шести строк. Вот компактная таблица, по какому признаку компонент входит в расчёт и что будет, если его выкинуть.

КомпонентВключать, когдаЧто ломается при пропускеОпорное число (2026-07-18)
Кэш чтение/записьПовторяемый префикс > порога моделиПервый вызов недооценён, повторные переоцененыwrite 1.25x/2x, read 0.1x, порог 1024–4096
ИзображенияВ запросе есть медиаМультимодальный сценарий дешевле реального1560 vs 2691 токена за 1920x1080
ИнструментыВключён любой toolКаждый вызов недосчитан на overhead290–410 токенов на вызов у Opus 4.8
Веб-поискМодель ищет в сетиПропущена нетокенная строка$10 за 1000 поисков
ПовторыЕсть таймауты/ретраиОптимистичный бюджет (допущение, не факт)retry_factor как инференс
Комиссия шлюзаХодишь не напрямуюФактическая цена выше рекламнойпример: 5–5.5% у одного шлюза
Батч (рычаг вниз)Сценарий терпит асинхронностьУпущена экономия 50%-50% вход и выход у обоих вендоров

Строки идут сверху вниз - от самого частого недоучёта к самому редкому. Если ты закрыл первые четыре, ты уже считаешь честнее, чем витрина. Англоязычные страницы ai api pricing обычно закрывают как раз верх этой таблицы; комиссия и повторы остаются целиком на стороне интегратора.

Слоуп-график перестановки ранга маршрутов: порядок по цене токена против порядка по полной стоимости

Чего этот калькулятор не решает

Он не заменяет фактические счета. Все приведённые цены за токен, множители кэша, формулы изображений, батч-скидки и комиссии одного шлюза - это опубликованные вендорами цифры на 2026-07-18, и они явно подлежат изменению. Документация Anthropic уже помечает запланированное изменение цены Sonnet 5 на 2026-09-01. Поэтому тарифы надо перепроверять по живым страницам перед любым бюджетным решением, а не брать как константу.

Он не предполагает ни наценки, ни экономии конкретного сервиса. Строка commission - это переменная, которую ты заполняешь условиями своего маршрута, а не обещание. Калькулятор - это структура, а не смета провайдера.

И он считает ровно один API-запрос. Строка ретраев внутри него - инференс, а не документированная политика вендора: failed requests и таймауты каждый может тарифицировать по-своему, подтверждённого правила в источниках нет. Формулы изображений специфичны для названных моделей и тиров и на будущие релизы автоматически не переносятся. А подписочные тарифы вендоров, внедрение, инфраструктура и поддержка - это уже отдельные строки бюджета, которых в стоимости одного вызова нет вовсе.

FAQ

Достаточно ли сравнить только входные и выходные токены?

Нет, если в сценарии есть кэш, медиа, инструменты или шлюз. Сравнение по двум строкам действительно только на чистом текстовом запросе без повторов. Как только появляется картинка или повторяемый префикс, порядок маршрутов может перевернуться.

Как быстро посчитать «сколько стоят 100 млн токенов»?

Умножь объём по роли на соответствующую цену: 100 млн входа Haiku 4.5 - $100, 100 млн выхода Opus 4.8 - $2500. Затем примени рычаги: батч режет токенный блок вдвое, кэш-чтение - до 0.1x на попавшей части. Одно число без указания роли токена бессмысленно.

Почему одна и та же картинка стоит по-разному?

Потому что стоимость картинки - это вычисляемые токены, а не фиксированная цена. У Anthropic тир модели даёт 1560 против 2691 токена за 1920x1080, у OpenAI флаг detail добавляет от ~65 до нескольких тысяч токенов при тех же пикселях.

Считается ли комиссия шлюза частью цены модели?

Нет, это отдельный слой поверх токенной цены. Пример одного шлюза - 5–5.5%; это не характеристика всех шлюзов и не заявление о структуре комиссии конкретного сервиса.

Как в эту формулу вписать оплату из России?

Оплата - это не строка цены токена, а условие доступа. Если прямой платёж невозможен, реальная стоимость маршрута включает и барьер оплаты; агрегатор с рублёвым балансом снимает его, но саму цену модели надо считать по её тарифу.

Правило, которое из этого следует, короткое: сравнивай не витрины, а диапазоны TCO на собственной полной нагрузке. Задай единый сценарий, заполни все шесть строк, пометь допущения - и только потом смотри, какой маршрут дешевле. Порядок, скорее всего, будет не тот, что на ценнике.

А если один из маршрутов в твоём расчёте идёт через шлюз, его условия стоит не угадывать, а открыть и посмотреть.

provod.ai как один из маршрутов в калькуляторе полной стоимости запроса

provod.ai — не переплачивайте мощной моделью за простую задачу

Разделяйте быстрые массовые запросы и сложные случаи: компактные модели берут рутину, флагманские — задачи, где критичны reasoning, контекст и качество результата.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Оптимизация опирается на реальную стоимость: цены всех вариантов соответствуют официальным тарифам провайдеров 1:1, без наценки provod.ai.

Подберите модель под свою нагрузку: форма регистрации · цены на модели · защита данных по 152-ФЗ · главная provod.ai

Источники

  • Anthropic, Claude Platform Docs - Pricing, доступ 2026-07-18: цены токенов, множители кэша, overhead инструментов, веб-поиск, батч-скидка.
  • Anthropic, Prompt Caching, доступ 2026-07-18: множители записи/чтения кэша, пороги кэширования.
  • Anthropic, Vision, доступ 2026-07-18: формула визуальных токенов и счёт для 1920x1080.
  • OpenAI, API Pricing, доступ 2026-07-18: цена gpt-5.5, кэшированный вход, батч-скидка.
  • OpenAI, Prompt Caching, доступ 2026-07-18: порог и TTL кэша.
  • OpenAI, Images/Vision, доступ 2026-07-18: патч-формула, множители, режим detail.
  • OpenRouter, Pricing, доступ 2026-07-18: пример структуры комиссии шлюза.