Человек заводит деньги на API и почти сразу упирается в вопрос: на сколько их хватит. В голове висит что-то вроде «есть десять тысяч, ввод стоит столько-то, вывод дороже, ещё какая-то скидка за кеш» - и как это всё свести в одно число, непонятно. Разберу по порядку, на числах.
Сразу главное: счёт за API считается по одной формуле - число токенов умножить на цену за токен. Токены на ввод и на вывод считают отдельно, потому что стоят они по-разному. Дальше покажу, как из этого получить срок, на который тебе хватит бюджета, и где в расчёт вклинивается кеш.
В Telegram-канале - что нового в вайб-кодинге: инструменты, находки, ошибки. Подпишись.
Цены за токены я привожу по официальным страницам Anthropic, DeepSeek и OpenAI на начало сентября 2026 - они меняются, перед расчётом свои числа сверяй на сайте поставщика. В примерах считаю в рублях по тарифу из типичного запроса (ввод 15 рублей, вывод 50 рублей за миллион токенов), чтобы формула была наглядной. Свои цифры подставляй в ту же формулу.
Из чего складывается счёт за API?
Когда обращаешься к модели по API, деньги берут за объём текста, который через модель прошёл. Считается этот объём в токенах. Токен - маленький кусочек текста, к нему я вернусь в следующем разделе, а пока держи его как единицу, которой всё меряется.
Внутри одного обращения есть две стороны. Первая - то, что ты отправил модели: сам вопрос, прикреплённые куски кода или документа, предыдущие сообщения диалога, служебная инструкция в начале. Это ввод. Вторая - то, что модель написала в ответ. Это вывод. У DeepSeek в описании тарифов это сказано прямо: счёт выставляется по общему числу входных и выходных токенов.
Цена у ввода и вывода разная, поэтому и считают их врозь. Формула на один запрос простая:
расход = (токены ввода × цена ввода) + (токены вывода × цена вывода)Цену обычно указывают за миллион токенов - так удобнее, потому что один токен стоит доли копейки. Дальше вся арифметика крутится вокруг этой формулы, а бюджета хватает ровно на столько запросов, сколько влезает в твои деньги по этой цене.
Токен - это не слово: как прикинуть, сколько их уйдёт?
Первое, обо что все спотыкаются: токен не равен слову. Модель режет текст на куски по своим правилам, и кусок может быть целым коротким словом, частью длинного, пробелом с буквой или знаком препинания. Поэтому «на сколько токенов потянет мой запрос» точно в уме не посчитать - можно только прикинуть.
Для прикидки держи ориентир. В английском тексте на один токен приходится примерно четыре символа, это отправная точка от самих Anthropic и OpenAI. Русский текст модель дробит мельче: кириллица разбивается на более короткие куски, и на тот же по смыслу текст токенов уходит больше. Насколько больше - зависит от модели, но закладывать стоит в полтора-два раза против английского.
Как это выливается в токены. Если ты отправляешь модели страницу текста и получаешь абзац в ответ, это уже тысячи токенов ввода и сотни вывода. А если приложил к запросу большой файл или тянешь длинную историю переписки, ввод раздувается до десятков тысяч токенов, и львиная доля счёта приходит именно оттуда. Точную цифру покажет ответ API - в служебных полях он возвращает, сколько токенов реально ушло на ввод и на вывод. Но чтобы прикинуть бюджет заранее, грубой оценки по символам достаточно.
Почему вывод дороже ввода и как это бьёт по счёту?
Вот таблица официальных цен за миллион токенов на начало сентября 2026 - видно, что вывод везде дороже ввода в несколько раз.
| Модель | Ввод, за 1М | Вывод, за 1М | Во сколько раз вывод дороже |
|---|---|---|---|
| Claude Opus 5 | 5 долларов | 25 долларов | в 5 раз |
| Claude Sonnet 5 | 2 доллара | 10 долларов | в 5 раз |
| Claude Haiku 4.5 | 1 доллар | 5 долларов | в 5 раз |
| GPT-5.6-terra | 2 доллара | 12 долларов | в 6 раз |
| DeepSeek V4 Pro | 0,66 доллара | 1,98 доллара | в 3 раза |
Разброс между поставщиками огромный: миллион токенов ввода у Claude Opus 5 стоит как полтора миллиона у DeepSeek Pro. Но внутри каждого тарифа держится одно правило - вывод дороже ввода в три-шесть раз. Причина простая: прочитать твой запрос модели легче, чем сочинить ответ, и за более тяжёлую работу берут больше.
Отсюда вывод, который прямо влияет на счёт. Дорого обходится не столько объёмный вопрос, сколько объёмный ответ. Если ты просишь модель «распиши как можно подробнее», ты сам раздуваешь самую дорогую часть счёта. Тот же смысл, упакованный в короткий ответ, стоит в разы дешевле. Это одна из причин, почему вайб-кодинг у одного человека выходит дешёвым, а у другого сжигает бюджет за день - при одинаковой модели.
Как посчитать, на сколько хватит бюджета?
Сведём всё в пошаговый расчёт. Возьму числа из типичного запроса, с которым сюда приходят: бюджет 10 000 рублей, ввод 15 рублей за миллион токенов, вывод 50 рублей за миллион.
- Прикинь средний запрос. Допустим, на одно обращение уходит 20 000 токенов ввода (вопрос плюс кусок кода и немного истории) и 2 000 токенов вывода (ответ модели).
- Посчитай ввод. 20 000 разделить на миллион и умножить на 15 рублей = 0,30 рубля за ввод.
- Посчитай вывод. 2 000 разделить на миллион и умножить на 50 рублей = 0,10 рубля за вывод.
- Сложи. Один запрос обходится в 0,40 рубля.
- Раздели бюджет. 10 000 рублей разделить на 0,40 рубля = 25 000 запросов.
Двадцать пять тысяч обращений - это очень много для одного человека, на месяц работы хватит с запасом. Но фокус в том, что реальный запрос почти никогда не «средний»: стоит приложить большой файл или разогнать длинный диалог, и ввод вырастает с 20 тысяч токенов до 200 тысяч. Тогда тот же расчёт даёт уже 2 500 запросов вместо 25 000. Так что считать надо по своему обычному режиму работы, идеальный запрос тут врёт. И лучше округлять в сторону завышения.
Devin, Claude Code и любой другой ИИ-агент работают через тот же API и тратят токены по той же формуле - только объёмы у агента больше, потому что он сам гоняет много обращений под капотом. Про то, почему из-за этого счёт за вайб-кодинг выходит больше ожидаемого, я разбирал отдельно в материале про скрытую цену вайб-кодинга.
Что такое скидка за кеш и когда она работает?
Теперь про кеш - ту самую «скидку до 80 процентов», из-за которой расчёт кажется сложным. Механика у него простая. Часть ввода от запроса к запросу не меняется: служебная инструкция в начале, большой кусок контекста, приложенный документ, с которым ты работаешь несколько обращений подряд. Кеш позволяет модели не перечитывать этот кусок каждый раз с нуля, а брать из памяти по сильно сниженной цене.
Насколько сниженной - зависит от поставщика. У Claude повторное чтение из кеша стоит в десять раз дешевле обычного ввода: у Opus 5 обычный ввод 5 долларов за миллион, а кеш-чтение - 0,50 доллара. У DeepSeek скидка ещё резче: ввод из кеша у flash-модели стоит 0,007 доллара против 0,22 за обычный, это в тридцать с лишним раз дешевле. Так что «скидка до 80 процентов» - это ещё скромная оценка, реальная бывает больше.
Два условия, которые важно держать в голове, иначе расчёт с кешем поедет.
- Скидка касается только повторного ввода. Вывод модель генерирует заново каждый раз, и на него кеш-скидки нет вообще. Если основная часть твоего счёта - это длинные ответы, кеш почти ничего не сэкономит.
- Первая запись в кеш стоит чуть дороже обычного ввода. У Claude запись в кеш идёт по цене 1,25 обычного ввода на короткое хранение. Экономия начинается со второго обращения, которое читает уже записанный кусок. На единичном запросе кеш не поможет вовсе и даже выйдет чуть дороже.
Как пересчитать бюджет с учётом кеша?
Вернёмся к нашему расчёту и добавим в него кеш. Идея - разбить ввод на две части: ту, что повторяется и попадает под скидку, и ту, что новая в каждом запросе.
Возьмём тот же запрос на 20 000 токенов ввода. Пусть 15 000 из них - это неизменный контекст: системная инструкция плюс большой документ, который ты держишь в работе несколько обращений подряд. Оставшиеся 5 000 - твой новый вопрос, он каждый раз свежий. Скидку за кеш возьму как в запросе - 80 процентов, то есть кешированный ввод стоит пятую часть обычной цены.
- Кешированный ввод. 15 000 токенов по цене 15 рублей за миллион - это 22,5 копейки без скидки. Со скидкой 80 процентов остаётся 4,5 копейки.
- Новый ввод. 5 000 токенов по 15 рублей за миллион = 7,5 копейки, полная цена.
- Вывод. 2 000 токенов по 50 рублей за миллион = 10 копеек, как и было, кеш его не трогает.
- Итог запроса. 4,5 плюс 7,5 плюс 10 = 22 копейки против прежних 40.
- Раздели бюджет. 10 000 рублей разделить на 0,22 рубля = около 45 000 запросов вместо 25 000.
Кеш почти удвоил срок жизни бюджета - но только потому, что в этом примере большая часть ввода повторялась. Если бы твой контекст каждый раз был новым, кеш бы не сработал, и осталось бы 25 000 запросов. Отсюда и правило: кеш выгоден там, где ты гоняешь один большой контекст через много запросов, и бесполезен на разрозненных коротких вопросах.
На что токены утекают незаметно?
Счёт часто оказывается больше расчётного, и почти всегда из-за трёх вещей, которые не видно на глаз.
Первое и главное - история диалога. Модель не помнит прошлые сообщения сама по себе, ей каждый раз заново отправляют весь диалог целиком как часть ввода. Это значит, что десятое сообщение в длинной переписке тащит за собой все девять предыдущих плюс ответы на них. В начале диалога запрос стоит копейки, а к концу тот же по смыслу вопрос обходится в разы дороже, потому что ввод разбух. Отсюда простой приём: сменилась тема - начинай новый диалог, один бесконечный тянуть незачем.
Второе - режим размышления. У свежих моделей есть режим, где модель сначала прокручивает рассуждение про себя и только потом отвечает. Это рассуждение тоже считается токенами вывода, а вывод у нас самый дорогой. Ответ на вид короткий, а токенов под ним много, и счёт удивляет.
Третье - тяжёлые вложения. Приложил к запросу большой документ или пачку файлов - и они уходят в ввод целиком при каждом обращении, пока висят в контексте. Если работаешь с одним и тем же документом долго, его как раз стоит держать под кешем, чтобы не платить за него по полной снова и снова. Управление тем, что лежит в контексте, - это отдельный навык, контекст-инжиниринг, и на счёт он влияет напрямую.
Как следить за расходом и не считать вручную?
Ручная прикидка нужна один раз - чтобы понять, на сколько тебе хватит денег в принципе. Дальше считать вручную не надо, за тебя это делает сам API.
Каждый ответ модели приходит со служебными полями, где записано точное число токенов запроса: сколько ушло на ввод, сколько на вывод, сколько из ввода прочиталось из кеша, а сколько записалось в него впервые. Это уже точный факт по конкретному обращению - по этим полям и видно, куда реально утекает бюджет. Если пользуешься инструментом вроде Claude Code, он обычно показывает расход сам после каждой задачи.
Отдельно есть страница расхода в кабинете поставщика: там траты по дням и текущий остаток. Заглядывай туда время от времени, особенно в первые недели, пока не почувствуешь свой обычный ритм трат. И пара привычек, которые берегут деньги: поставь лимит расхода на месяц, если поставщик это позволяет, и не включай автопополнение баланса, пока не понял, сколько уходит в норме. Иначе один разогнавшийся агент за ночь спишет больше, чем ты ждал. Про то, как вообще заводить и пополнять баланс, я разбирал на примере оплаты DeepSeek API из России.
Источники
- Anthropic - цены на модели - цены ввода, вывода и кеша по всем моделям Claude
- Anthropic - кеширование запросов - как работает кеш, цена записи и чтения, минимальная длина
- DeepSeek - модели и цены - формула расхода, цены cache hit и cache miss, дневные и ночные тарифы
- OpenAI - цены API - цены ввода, кеш-ввода и вывода по моделям GPT
- Доллар к рублю - ЦБ РФ - для пересчёта долларовых цен в рубли
Полная схема вайб-кодинга за три вечера: ИИ-клон + Второй мозг + Контекст-инжиниринг. Записи эфиров в личном кабинете, доступ 30 дней.
Новые материалы - дайджестом, без спама
Гайды выходят регулярно. Подпишись, чтобы не пропускать: пришлю подборку в Telegram или на email. Раз в неделю или каждый день - выбираешь сам.

