«Сколько это будет стоить в месяц?» — первый вопрос на каждой встрече про AI-агента и почти всегда единственный, на который отвечают «зависит». Ответ честный, но бесполезный: он не даёт ни порядка величины, ни понимания, что менять, если цифра не понравится. При этом вопрос вполне считаемый. Нужны три вещи: формула, референсная конфигурация и явно выписанные допущения. Дальше есть все три — плюс анатомия счёта, четыре типовые утечки бюджета, четыре рычага, две таблицы и калькулятор, в который можно подставить свои числа.

Сразу оговорка, которая важнее любой цифры ниже: это модель расчёта, а не наши счета. Конфигурация придумана как типовая для агента с большим набором инструментов, а не снята с чьего-то продакшена. Каждое число получено из формулы на объявленных допущениях; изменится допущение — изменится и число. Цены взяты с прайс-листа OpenAI на 2026-07-25 и со временем меняются, так что перед решением их стоит перепроверить.

Почему «$X за миллион токенов» — не ответ

Прайс-лист даёт цену за единицу, а не сумму счёта. Текущая линейка на 2026-07-25, USD за 1M токенов, в порядке ввод / кэшированный ввод / вывод: gpt-5.6-sol — 5.00 / 0.50 / 30.00 · gpt-5.6-terra — 2.50 / 0.25 / 15.00 · gpt-5.6-luna — 1.00 / 0.10 / 6.00 · gpt-5.5 — 5.00 / 0.50 / 30.00 · gpt-5.4 — 2.50 / 0.25 / 15.00 · gpt-5.4-mini — 0.75 / 0.075 / 4.50 · gpt-5.4-nano — 0.20 / 0.02 / 1.25.

Посчитать по этой табличке месячный счёт нельзя, потому что в ней нет трёх величин, которые решают всё: сколько токенов уходит в одном запросе, сколько запросов агент делает на одну задачу и какая доля запроса подаётся из кэша. Средняя колонка — кэшированный ввод — примерно на 90% дешевле обычного, и именно её чаще всего не замечают при оценке, хотя она отделяет дорогую конфигурацию от дешёвой при одной и той же модели.

Есть и вторая причина. Разброс между моделями на одной и той же работе огромен: в конфигурации ниже тот же объём токенов стоит $50.34 в месяц на gpt-5.4-nano и $1254.00 на gpt-5.6-sol — почти в 25 раз больше. Пока допущения не зафиксированы, спор о том, «дорогая ли модель», не ведёт никуда.

Вы платите за пересылку, а не за интеллект

У модели нет памяти между вызовами. Каждый шаг агента — отдельный запрос, в который заново укладывается всё: системный промпт, схемы всех подключённых инструментов, история диалога и найденный в базе контекст. Модель не помнит предыдущий шаг — ей его пересказывают целиком. Поэтому основную часть счёта формирует не то, что спросил пользователь, и не то, что ответила модель, а то, что пересылается на каждом круге цикла.

Порядок величин при таких допущениях: вопрос пользователя — это десятки токенов, а стабильный префикс из системного промпта и схем инструментов — 15 600 токенов. На один шаг приходится 19 100 токенов ввода против 300 токенов вывода: 98,5% всех токенов обмена — ввод, и 82% ввода — префикс, который не меняется от задачи к задаче. За месяц из этого набегает 229,2 млн токенов ввода против 3,6 млн вывода.

Анатомия счёта за одну задачу

Что накапливается в одном запросе — и почему всё это умножается на число шагов.

Формула короткая, её стоит держать в голове целиком: стоимость составляющей = (токены составляющей × число шагов ÷ 1 000 000) × цена за 1M токенов. Счёт за одну задачу — сумма по пяти составляющим; счёт за месяц — эта сумма, умноженная на число задач. Всё остальное в статье — разговор о том, какие числа подставлять.

На каждом круге цикла системный промпт и схемы инструментов уходят заново.

Пять составляющих ведут себя по-разному, и это ключ ко всему дальнейшему. Системный промпт и схемы инструментов образуют стабильный префикс: они одинаковы во всех запросах, а значит могут кэшироваться. История диалога растёт с каждым шагом. Найденный контекст меняется от запроса к запросу. Ответ модели оплачивается по самой дорогой ставке — на gpt-5.4-mini вывод в шесть раз дороже ввода, — но его мало, и итог он двигает слабее всего.

Деление на кэшируемое и некэшируемое здесь важнее привычного деления на «промпт и ответ». Кэшироваться может только то, что стоит в начале запроса и не меняется между вызовами. История, найденный контекст и вывод не кэшируются никогда — не по решению провайдера, а потому что каждый раз они другие.

Четыре места, где утекает бюджет

Четыре типовых утечки; первая обычно самая дорогая.

Все инструменты в каждом запросе. Схемы уходят к модели целиком, независимо от того, нужен для задачи один инструмент или сорок. В конфигурации ниже это 14 400 токенов схем в каждом запросе — и самая крупная строка счёта.

Слишком широкий поиск. Retrieval отдаёт двадцать фрагментов там, где хватило бы трёх, и лишние фрагменты платно проезжают через каждый следующий шаг задачи.

Повторы после сбоя. Инструмент упал, модель пробует снова — и это ещё один полный круг с полным префиксом. Утечка коварна тем, что в промпте её не видно: она видна только в распределении числа шагов на задачу.

История без обрезки. Каждый шаг дописывает в диалог свой результат, и следующий запрос несёт весь этот хвост. На длинных задачах история из самой скромной составляющей превращается в одну из самых заметных.

Четыре рычага

До и после по каждому рычагу; кэширование не убирает токены из запроса, а делает те же токены дешевле.

Прежде чем разбирать рычаги — оговорка, без которой две последние диаграммы читаются неправильно. Четыре утечки и четыре рычага — это два независимых списка, а не четыре пары. Подмножество инструментов действительно закрывает утечку «все инструменты в каждом запросе», а обрезка истории — утечку «история без обрезки». Но кэширование и выбор модели не отвечают ни на одну из названных утечек, а у слишком широкого поиска и повторов после сбоя своего рычага в этом списке нет: с ними работают на уровне архитектуры retrieval и обработки ошибок, а не на уровне прайс-листа. В обоих списках по четыре пункта случайно, и больше из этого ничего не следует.

Подмножество инструментов по намерению запроса. Отдавать модели те схемы, которые относятся к задаче, а не все. При таких допущениях сокращение с 80 инструментов до 12 уводит счёт с $188.10 до $77.94 в месяц — минус 59%, без единой правки в тексте промпта.

Кэширование стабильного префикса. Этот рычаг устроен принципиально иначе, чем остальные три: он не убирает токены из запроса, а делает те же самые токены дешевле. Кэшированный ввод примерно на 90% дешевле обычного — то есть примерно в десять раз, — но только на той части запроса, которая кэшируется, а это префикс: системный промпт и схемы инструментов. История, найденный контекст и вывод остаются по полной цене. Поэтому при таких допущениях итог падает не в десять раз, а в 2,5: с $188.10 до $74.38 в месяц. «Агент в десять раз дешевле» — просто неверная формулировка, а честная цифра и так впечатляет.

На практике этот рычаг сводится к дисциплине компоновки запроса: стабильное — в начало, изменчивое — в конец, порядок между шагами не менять. Один переставленный блок в начале промпта обнуляет попадание в кэш для всего, что идёт за ним.

Выбор модели по этапу. Роутинг, классификацию и извлечение полей отдаём дешёвой модели, решение — дорогой. Разброс в этой конфигурации — от $50.34 до $1254.00 в месяц на одной и той же работе — показывает, сколько здесь лежит; при этом рычаг требует оценки качества на каждом этапе, иначе экономия оплачивается ошибками.

Обрезка и сжатие истории. На этой конфигурации рычаг самый скромный: уменьшение истории с 2000 до 800 токенов даёт $188.10 → $177.30, минус 6%. Ценность у него другая — он не даёт счёту расти нелинейно на длинных задачах, а именно там история и становится проблемой.

При тех же допущениях, если модель зафиксирована, остальные три рычага складываются между собой: 12 инструментов вместо 80, кэш на 90% и история в 800 токенов дают $42.65 в месяц против $188.10 — в 4,4 раза меньше на той же работе.

Референсный расчёт

Ниже — конфигурация, на которой посчитаны все цифры статьи. Каждая строка — допущение, а не измерение: так мы предположили, что выглядит типовой агент с большим набором инструментов. Значения совпадают с полями калькулятора ниже. Чтобы повторить в нём цифры этого раздела, поставьте оба поля шагов на 8, а долю префикса из кэша — на 90: по умолчанию калькулятор открывается с вилкой 4–12 шагов и нулевым кэшем.

ДопущениеЗначение
Инструментов у агента80
Токенов на схему инструмента180
Токенов в системном промпте1200
Токенов истории в запросе2000
Токенов найденного контекста (RAG)1500
Токенов ответа на шаг300
Шагов на задачу8 (в калькуляторе вилка 4–12)
Задач в день50
Дней в месяце30
Модельgpt-5.4-mini

Теперь тот же расчёт до и после кэширования — единственного рычага, который вообще не меняет содержимое запроса. Шагов — 8. Задач — 1500 в месяц (50 в день × 30 дней). Модель — gpt-5.4-mini. Без надбавки за европейский регион.

СоставляющаяБез рычагов, USD/месС кэшем 90%, USD/мес
Схемы инструментов129.6024.62
Системный промпт10.802.05
История диалога18.0018.00
Найденный контекст (RAG)13.5013.50
Ответ модели16.2016.20
Итого188.1074.38

Про округление, чтобы столбцы не смущали: составляющие показаны с точностью до цента, поэтому правый столбец суммируется в $74.37, тогда как точное значение модели — $74.376, которое калькулятор ниже показывает как $74.38.

Из таблицы стоит запомнить две цифры — обе относятся к этой конфигурации и ни к какой другой. Первая: схемы инструментов — 69% счёта до того, как включён хоть один рычаг, $129.60 из $188.10. Не модель, не длина ответов и не история — описания инструментов, большинство из которых модель на конкретном шаге даже не вызывает. Вторая: кэширование префикса уводит итог с $188.10 до $74.38 — в 2,5 раза, при том же наборе инструментов, той же модели и том же качестве ответов. Меняется только порядок блоков в запросе.

Отдельный вопрос, который в Польше и в ЕС в целом задают почти сразу: сколько стоит держать обработку данных в европейском регионе. Ответ по прайс-листу на 2026-07-25: региональная обработка данных стоит +10% — но не для всех моделей, а для тех, что вышли 2026-03-05 или позже и при этом доступны для data residency. Это надбавка на весь счёт за токены, а не отдельный тариф и не отдельный контракт. Дат выпуска прайс-лист не публикует, поэтому попадает ли под правило конкретная модель, приходится выяснять отдельно. Для модели, которая под него попадает, при таких допущениях надбавка превращает $188.10 в $206.91 без кэша и $74.38 в $81.81 с кэшем. В проектах, где вопрос residency вообще возникает, десять процентов обычно проще заплатить, чем обсуждать, — но заложить их надо в оценку с самого начала, а не обнаружить в первом счёте. В калькуляторе для этого есть отдельная галочка.

Калькулятор: подставьте свои числа

Дальше та же модель в интерактивном виде. Поля соответствуют строкам таблицы допущений, а вилка по шагам даёт нижнюю и верхнюю границу: число шагов на задачу — самая нестабильная величина во всей модели. Начинать стоит с числа инструментов и числа шагов — они двигают итог сильнее всего.

Посчитайте свой случай

Введите свои числа — расчёт пересчитается. Это модель, а не наши счета.

В месяц $94.05 $282.15

За одну задачу: $0.06 — $0.19

Нижняя граница — минимум шагов с кэшем, верхняя — максимум шагов без кэша.

Из чего складывается счёт

  • Схемы инструментов
  • Системный промпт
  • История диалога
  • Найденный контекст (RAG)
  • Ответ модели
СоставляющаяUSD в месяцДоля счёта
Схемы инструментов$64.869%
Системный промпт$5.46%
История диалога$910%
Найденный контекст (RAG)$6.757%
Ответ модели$8.19%

Цены на 2026-07-25, проверьте актуальные.

Месяц считается как 30 дней.

Как проверить расчёт на своём кейсе

Модель полезна ровно настолько, насколько верны её входные данные, — а входные данные измеряются, причём на ваших системах, а не на наших. Четыре измерения закрывают вопрос.

Посчитайте префикс токенизатором. Возьмите ровно тот системный промпт и ровно те схемы инструментов, которые реально уходят в запрос, и посчитайте токены. Именно здесь чаще всего обнаруживается, что схем на порядок больше, чем казалось на глаз.

Прочитайте usage в ответах API. Провайдер возвращает фактические числа по каждому вызову, включая долю ввода, поданную из кэша. Это единственный способ узнать реальный процент попадания в кэш вместо того, чтобы его предполагать.

Соберите распределение шагов, а не среднее. Счёт делают длинные задачи. Медиана в 4 шага при хвосте в 20 даёт совсем другой месяц, чем «в среднем 6», и именно поэтому в калькуляторе вилка, а не одно число.

Прогоните неделю и сравните с моделью. Расхождение почти никогда не означает ошибку в формуле — обычно это допущение, которое никто не выписал: повторы после сбоев, инструменты, которые никто не думал считать, retrieval шире ожидаемого. Найти такое до внедрения дешевле, чем после.

Если вы оцениваете агента для своей компании и хотите, чтобы расчёт сделали на ваших инструментах, ваших задачах и вашей политике по данным, напишите нам на [email protected]. Мы считаем такую модель до начала работы — вместе с честной оценкой того, какие рычаги в вашем случае действительно доступны, а какие упираются в архитектуру.

Частые вопросы

Что больше всего влияет на стоимость AI-агента?
Пересылаемый префикс запроса, и в первую очередь схемы инструментов: они уходят к модели заново на каждом шаге цикла агента, независимо от того, нужны ли они для задачи. В референсной конфигурации из статьи схемы инструментов дают $129.60 из $188.10 в месяц — 69% счёта до того, как включён хоть один рычаг. Это расчёт на объявленных допущениях, а не измерение чьих-то реальных расходов.
Сколько реально экономит кэширование промпта?
Кэшированный ввод примерно на 90% дешевле обычного — то есть примерно в десять раз, но только на той части запроса, которая кэшируется: на стабильном префиксе из системного промпта и схем инструментов. История диалога, найденный контекст и ответ модели не кэшируются никогда. Поэтому на конфигурации из статьи итог падает не в десять раз, а в 2,5: с $188.10 до $74.38 в месяц при таких допущениях.
Агент дороже обычной SaaS-подписки?
Зависит от двух величин: сколько шагов агент делает на одну задачу и сколько задач приходит в день. При допущениях из статьи и 1500 задачах в месяц одна и та же конфигурация даёт от $37.19 (4 шага с кэшем) до $282.15 (12 шагов без кэша), а выбор модели двигает итог от $50.34 до $1254.00. Поэтому сравнивать с подпиской имеет смысл только после того, как эти числа зафиксированы, — формула и калькулятор для этого есть в статье.
Сколько добавляет хранение данных в ЕС?
+10% к счёту за токены — по прайс-листу на 2026-07-25, для моделей, вышедших 2026-03-05 или позже и при этом доступных для data residency. Это надбавка на всю сумму, а не отдельный тариф. Дат выпуска прайс-лист не публикует, поэтому попадает ли конкретная модель под правило, приходится выяснять отдельно; для модели, которая попадает, в конфигурации из статьи надбавка превращает $188.10 в $206.91 без кэша и $74.38 в $81.81 с кэшем. В калькуляторе статьи это отдельная галочка, чтобы надбавку можно было заложить в оценку сразу.