Claude Code пишет слишком много кода: как урезать расход токенов в 2026

Опубликовано 21.07.2026Обновлено 02.08.202610 мин чтенияБазовый
Рука сжимает разросшийся код в компактный блок, превращая крупный знак доллара в мелкий.
Что узнаешь
  • Почему агент раздувает код и из-за этого жжёт токены
  • Готовое правило «7 вопросов» для CLAUDE.md - копируешь и вставляешь
  • Как поставить Ponytail в Claude Code за пару минут
  • Честные цифры экономии - и почему не на 75%
Применить за 10 мин
Базовый
103просмотров

Каждый раз в Telegram-канале разбираю связки ИИ и бизнеса: инструменты, находки, ошибки. Подпишись, чтобы видеть свежее по вайб-кодингу раньше остальных.

Почему Claude Code пишет слишком много кода?

Попроси Claude Code добавить на страницу поле выбора даты. С высокой вероятностью получишь отдельный компонент: кучу кода и пару вспомогательных файлов сверху - ради одного поля с датой. Работает? Да. Нужно ли столько кода? Почти никогда - в браузере уже есть <input type="date">, одна строка.

Так происходит, потому что модель тянется к развёрнутому ответу. Она видела миллионы репозиториев, где принято писать обстоятельно. Ты просишь маленькую вещь - агент достраивает вокруг неё каркас, который ты не заказывал. Это и есть переусложнение: решение больше самой задачи.

Отдельная засада - что агент делает это молча. Он не спрашивает «тебе точно нужен свой компонент». Он просто пишет. А ты платишь за каждый сгенерированный токен.

При чём тут токены и твои деньги?

Логика простая: больше кода - больше токенов - больше денег. Но есть второй удар, который замечают не сразу. Сгенерированный код не исчезает: он лежит в проекте, и агент перечитывает его при следующих задачах. Лишние 200 строк ты оплачиваешь один раз при написании и потом ещё много раз - каждый раз, когда они попадают в контекст.

«Лимиты» и «сколько я потратил» - как раз самый частый вопрос у тех, кто кодит с ИИ целый день. Про то, куда уходят токены со стороны чтения проекта, я подробно разбирал в гайде «Куда уходят токены в Claude Code». Здесь - про другую сторону: сколько агент пишет.

Что такое Ponytail и почему у него десятки тысяч звёзд?

Ponytail лежит на GitHub под лицензией MIT и ставится как плагин в Claude Code, Codex, Cursor и другие агенты. Идея у него одна, и она в девизе репозитория.

Лучший код - тот, который ты не написал.

- DietrichGebert, автор Ponytail, https://github.com/DietrichGebert/ponytail

На момент публикации у репозитория больше 85 тысяч звёзд (GitHub) - десятки тысяч из них пришли за первую неделю. Такой рост под конкретный навык бывает редко, и он говорит об одном: боль «агент пишет и жжёт лишнее» массовая, а простого решения до этого под рукой не было.

Как работает «ленивый сеньор»: лестница из 7 вопросов

Вся суть навыка - в порядке вопросов, которые агент задаёт себе до генерации. Ponytail называет это лестницей решений. Идёшь сверху вниз и останавливаешься на первой ступени, которая закрывает задачу:

СтупеньВопрос агентаЧто делает, если «да»
1Это вообще нужно писать?Пропустить (принцип YAGNI - не делай наперёд)
2Уже есть в этом проекте?Взять готовое, без переписывания
3Это умеет стандартная библиотека?Взять её
4Есть готовая возможность платформы?Взять её
5Есть в установленной зависимости?Взять её
6Влезает в одну строку?Одна строка
7Ничего не подошлоНаписать минимум, который работает

Пример из репозитория: задача «выбор даты» на первой же полезной ступени превращается в <input type="date"> вместо отдельного компонента. Таймер обратного отсчёта - 13 строк вместо 190-строчной панели. По описанию автора, на одной из задач 293 строки кода превратились в 47.

Мне это близко по подходу к контекст-инжинирингу: ты управляешь правилами, по которым агент принимает решения, ещё до запроса. Формулировка промпта на этом фоне вторична.

Хочешь пойти дальше одного плагина и собрать систему, при которой Claude перестаёт жечь лимиты? Ponytail закрывает один кусок - сколько агент пишет. На практикуме за 3 эфира собираешь всю связку: ИИ-клон + Второй мозг + Контекст-инжиниринг. Именно контекст-инжиниринг держит агента так, чтобы он не тянул в контекст лишнее и не раздувал вывод - тогда Claude становится предсказуемым по деньгам.

Практикум по вайб-кодингу
+Твой второй мозг
3 вечера - инструменты, метод, первый проект
Старт 22–24 сентября  ·  2 000 ₽
Записаться →

Как поставить Ponytail в Claude Code за пару минут?

В Claude Code установка занимает два шага. Открываешь Claude Code в своём проекте и вводишь по очереди:

bash
/plugin marketplace add DietrichGebert/ponytail
/plugin install ponytail@ponytail

Первая команда добавляет репозиторий Ponytail как источник плагинов. Вторая - ставит сам навык. После этого агент начинает прогонять задачи через лестницу из семи вопросов сам, без дополнительных напоминаний.

Ponytail работает не только в Claude Code. Установка под другие агенты - через те же каталоги плагинов:

  1. Codex: codex plugin marketplace add DietrichGebert/ponytail, затем codex plugin add ponytail@ponytail.
  2. GitHub Copilot CLI: copilot plugin marketplace add DietrichGebert/ponytail.
  3. Gemini или Antigravity CLI: gemini extensions install https://github.com/DietrichGebert/ponytail.
  4. Cursor, Windsurf, Cline: каталога плагинов нет - копируешь готовые файлы-правила из репозитория к себе в проект.

Не хочешь ставить плагин? Готовое правило для CLAUDE.md

Сам навык - это, по сути, набор правил текстом. Их можно положить прямо в файл CLAUDE.md (для Codex и Cursor - в AGENTS.md), и агент будет держать их в голове на каждой задаче. Вот готовый блок на русском, копируй как есть:

markdown
## Правило: пиши минимум кода

Перед тем как написать код, пройди сверху вниз и остановись на первом «да»:

1. Это вообще нужно писать? Если нет - не пиши (не делай наперёд).
2. Это уже есть в проекте? Переиспользуй, не переписывай.
3. Это умеет стандартная библиотека языка? Возьми её.
4. Это уже умеет платформа (браузер, ОС, фреймворк)? Возьми её.
5. Это есть в уже установленной зависимости? Возьми её.
6. Это влезает в одну строку? Напиши одну строку.
7. Ничего не подошло - напиши минимум, который работает.

Не добавляй обёртки, слои абстракции и «на всякий случай», которых
задача не просила. Если решение выходит большим - сначала объясни
мне, почему меньше нельзя, и только потом пиши.

Сам я держу такой блок в CLAUDE.md на своих проектах - на длинных сессиях разница по счёту видна. Разница с плагином небольшая: плагин обновляется автором и включён во всех проектах сразу, а правило в CLAUDE.md живёт в одном проекте и обновляешь его ты сам. Про то, как вообще устроен выбор навыков и плагинов, я разбирал в гайде «Не ставь все Claude Code skills подряд».

На сколько реально падает расход? Честные цифры

Автор выложил бенчмарк на наборе реальных задач. Средние цифры такие (GitHub, бенчмарк):

МетрикаИзменение
Строки кода-54%
Токены-22%
Стоимость-20%
Скорость-27% быстрее
Безопасностьсохранена на 100%

Теперь честно про «дешевле на 75%». Такие цифры реальны, но они про отдельные ловушки, где агент раньше строил целую панель вместо <input>. На них экономия доходит до 90 с лишним процентов. На обычной задаче, где раздувать особо нечего, выигрыш ближе к тем самым 20%. Средний по проекту результат - около пятой части расхода. Это уже много, если ты гоняешь агента каждый день, но пятикратной экономии на каждой задаче ждать не стоит.

Чем это отличается от .claudeignore и отключения MCP?

Если поискать «как сэкономить токены в Claude Code», почти все советы будут про вход - что попадает агенту в контекст. И они правильные. Но они не трогают выход.

Что оптимизируемПриёмыРычаг
Вход (что агент читает).claudeignore, отключить лишние MCP-серверы, урезать CLAUDE.md, модель подешевле для простых задачМеньше токенов на чтение
Выход (сколько агент пишет)Ponytail, правило «7 вопросов»Меньше токенов на генерацию + меньше кода в проекте потом

Эти два рычага складываются. Урезал вход - платишь меньше за чтение. Урезал выход - платишь меньше за генерацию и за то, что этот код будет перечитан десятки раз. Про сторону входа у меня есть отдельный разбор «Куда уходят токены в Claude Code», а как измерять расход в реальном времени - в гайде про трекеры токенов.

Когда «писать меньше» вредит?

У любого правила есть обратная сторона. «Пиши минимум» иногда превращается в «пиши недостаточно». Ситуации, где я бы притормозил агента с минимализмом:

  1. Обработка ошибок. Одна строка, которая работает только когда всё идеально, падает на первом же кривом вводе. Тут лишний код не лишний.
  2. Безопасность и платежи. Здесь «на всякий случай» перестаёт быть лишним кодом и становится необходимостью. Экономить строки на проверке прав и обработке денег нельзя.
  3. Доступность и крайние случаи. Пустые списки, длинные тексты, отсутствие интернета - реальные состояния, которые «минимальное решение» любит проглотить.

Лечится это одной фразой в правиле: минимум в основной логике, но проверку ошибок, безопасность и крайние случаи оставляем полностью. Ponytail и сам держит планку безопасности - в его бенчмарке она сохраняется на 100%, - но за своим проектом всё равно смотри сам. Как в принципе проверять код, который написал ИИ, если сам читать код не умеешь, я разбирал в отдельном гайде.

Как проверить, что ты правда стал тратить меньше?

Бенчмарк автора - это его задачи. Твои могут вести себя иначе. Поэтому проверка простая:

  1. Замерь «до». Возьми типичную для себя задачу и запиши расход токенов за сессию. Claude Code показывает счёт прямо в интерфейсе.
  2. Поставь Ponytail или добавь правило в CLAUDE.md.
  3. Прогони похожую задачу и запиши расход снова.
  4. Сравни неделю работы целиком - на одной задаче поймаешь случайный выброс, на дистанции виден средний эффект.

Для точной разбивки по сессиям удобны трекеры токенов - собрал их в отдельном гайде. А если тебя пугает сам счёт за агента, который может улететь за ночь, посмотри разбор про лимиты бюджета.

С чего начать сегодня

Если делать только одно - скопируй правило из блока выше в CLAUDE.md. Это минута, и агент сразу начнёт думать перед тем, как писать. Хочешь автоматизации и обновлений от автора - поставь плагин, две команды в терминале. А через неделю замерь расход и посмотри на свои цифры: чужой бенчмарк тут вторичен.

Источники

Полная схема по вайб-кодингу за вечер: ИИ-клон + Второй мозг + Контекст-инжиниринг. 3 эфира, записи остаются у тебя.

Практикум по вайб-кодингу
+Твой второй мозг
3 вечера - инструменты, метод, первый проект
Старт 22–24 сентября  ·  2 000 ₽
Записаться →

Новые материалы - дайджестом, без спама

Гайды выходят регулярно. Подпишись, чтобы не пропускать: пришлю подборку в Telegram или на email. Раз в неделю или каждый день - выбираешь сам.

Была инструкция полезна?
Артемий Миллер
Автор
Артемий Миллер
Предприниматель и вайб-кодер

Артемий Миллер - предприниматель и вайб-кодер. Бывший программист, собирает продукты исключительно вместе с ИИ-агентами, без найма разработчиков.

Связанные инструкции

GLM-5.2 догнала Claude Opus 4.8: открытая модель дешевле в 5 раз

Открытая GLM-5.2 догнала Claude Opus на рутине и стоит в разы дешевле. Где она реально заменяет Claude, где нет, и как подключить её в Claude Code.

16 мин

Qwen перестал работать в России: почему так и что делать в 2026

Qwen работал, а теперь выдаёт ошибку или молчит. Разбираю по порядку, почему так: бесплатный вход закрыли для всех, браузерный чат путают с терминалом, ключ истёк. И что сделать, чтобы вернуть агента без зарубежной карты.

10 мин

Проверенный сервис оплаты Claude: как отличить надёжный от развода в 2026

Под «сервисом оплаты Claude» люди ищут две разные вещи и путают их. Разбираю, чем оплата своей подписки отличается от покупки готового аккаунта, по каким семи признакам видно развод и что должно быть у сервиса, которому можно доверить деньги.

11 мин

Кто создал Claude Code: Борис Черный и как он сам с ним работает

Разбираю, кто такой Борис Черный - человек, который сделал Claude Code. Откуда он, как инструмент родился из личного эксперимента и как сам создатель кодит с ним сегодня. Спойлер: ровно так, как я показываю на практикуме.

12 мин