Какую модель ИИ брать под задачу, чтобы не переплачивать за токены

Опубликовано 23.09.20269 мин чтенияБазовый
Стратег настраивает поток токенов ИИ на голографическом экране, оптимизируя расходы.
Что узнаешь
  • Правило «думать сильной моделью, исполнять дешёвой» и где оно не работает
  • Таблица: какая модель под план, код, тексты, цифры, поиск и рутину
  • Официальные цены GPT-6 и Claude на 23.09.2026 и условный расчёт одного прогона
  • Как в Hermes Agent перевести служебные фоновые задачи на дешёвую модель
Базовый
4просмотров

Если коротко: думать должна сильная модель, исполнять может модель попроще. План и сложные решения отдаёшь флагману (GPT-6 Astra, Claude Fable 5.1 или Claude Opus 5.5), работу по готовому плану - модели среднего уровня, а рутину и фоновые служебные вызовы агента - самой дешёвой из тех, что справляются с задачей. При этом результат нужно проверять: чем дешевле модель, тем внимательнее проверка, иначе экономия уходит в переделки.

Ниже моя таблица «задача → модель», которую я выложил в открытый репозиторий 23 сентября 2026 года. Основные модели в ней - мой личный выбор по опыту работы. Сравнительного теста я не проводил и гарантировать, что у тебя будет так же, не могу. Большинство вариантов подешевле я подобрал по открытым рейтингам и рекомендациям самих разработчиков; Opus 5.5 для кода - тоже из моего опыта. Цены в статье сверены с официальными страницами OpenAI и Anthropic на 23.09.2026.

В Telegram-канале - что нового в вайб-кодинге: модели, инструменты, находки. Подпишись.

Почему одна модель на всё обходится дорого

Если ты платишь за токены по API, каждая задача на флагмане стоит по цене флагмана, даже когда хватило бы модели попроще. При подписке учитывай ограничения своего тарифа и выбранной модели: сверяй их на странице тарифа. Про то, как устроены лимиты подписки Claude и на что они уходят, есть отдельный разбор как не сжечь лимиты Claude Code за день. Здесь речь о выборе модели под конкретную работу.

Официальные цены API за 1 млн токенов на 23.09.2026:

МодельВходВыходДля чего её делали
GPT-6 Astra$10$50самая сложная работа
Claude Fable 5.1$10$50трудные рассуждения, долгая агентная работа
Claude Opus 5.5$4$20большинство задач, по совету Anthropic
GPT-6 Sol$2$10сложный код и агентные сценарии
Claude Sonnet 5$2$10баланс скорости и интеллекта
Claude Haiku 4.5$1$5самая быстрая у Claude
GPT-6 Luna$0,1$0,5массовые однотипные задачи

Возьмём условный прогон агента: 100 тысяч входящих токенов и 10 тысяч исходящих. Это пример расчёта по базовым ценам без кеша, не замер реальной задачи. Такой прогон стоит около $1,5 на GPT-6 Astra или Fable 5.1, $0,6 на Opus 5.5, $0,3 на Sonnet 5 или GPT-6 Sol, $0,15 на Haiku 4.5 и $0,015 на GPT-6 Luna. В этом расчёте между флагманом и самой дешёвой моделью разница в сто раз. Как посчитать такой прогон на своих объёмах, подробно показано в статье как посчитать расход токенов на API.

Две оговорки по ценам. У моделей GPT-6 запрос длиннее 272 тысяч входящих токенов целиком тарифицируется дороже: вход вдвое, выход в полтора раза. А пакетные запросы (Batch) и у OpenAI, и у Anthropic стоят вдвое дешевле стандартных.

Правило: думать сильной моделью, исполнять дешёвой

От плана зависит дальнейшая работа, поэтому на нём я не экономлю и беру самую сильную модель. Писать по готовому плану, собирать данные, переименовывать чаты и сжимать переписку может модель попроще.

При выборе модели я учитываю ещё три правила:

  1. Чем дешевле модель, тем внимательнее проверка. На проверку тоже уходит твоё время.
  2. Сравнивай цену готового результата, а не одного запроса. Пример: Opus 5.5 дешевле Fable 5.1 в 2,5 раза и по входу, и по выходу. Если из-за переделок Opus тратит на задачу втрое больше и входящих, и исходящих токенов, по деньгам он выходит дороже. А к токенам добавляется твоё время на проверку. Как считать именно цену результата, разобрано в статье какой ИИ-агент дешевле: цена одной решённой задачи.
  3. Не подошла модель - пробуй другую. Единого победителя нет, у каждой свои сильные стороны и свои ограничения.

Выбор модели - одна из частей работы с ИИ-агентом.

Практикум по вайб-кодингу
+Твой второй мозг
3 вечера - инструменты, метод, первый проект
Старт 17–19 ноября  ·  2 000 ₽
Записаться →

Таблица: задача → модель

В колонке «основная» - модели, которые я беру сам. В соседней - альтернативы, большинство из них подобрано по открытым рейтингам и советам разработчиков. Opus 5.5 для кода я выбираю и по личному опыту. С более дешёвой моделью проверяй результат внимательнее. Для рутины сравниваются разные схемы оплаты, поэтому этот вариант не обязательно обойдётся дешевле.

ЗадачаОсновнаяАльтернатива
Стратегия и планыGPT-6 AstraGPT-6 Sol
КодClaude Fable 5.1Claude Opus 5.5
Тексты и очистка от ИИ-стиляGPT-6 AstraClaude Sonnet 5
Цифры и финансыClaude Fable 5.1Claude Opus 5.5
Поиск и исследованияClaude Sonnet 5GPT-6 Luna
Парсеры и рутинаKimi K3 (подписка Kimi Code)DeepSeek Flash (API)

Стратегия и планы. Ошибка в плане может перейти в следующие шаги. Здесь я беру самую сильную модель. GPT-6 Sol - вариант дешевле: OpenAI позиционирует её для сложного кода и агентных сценариев.

Код. Для кода я беру Fable 5.1. Но Anthropic советует для большинства задач начинать с Opus 5.5, а Fable 5.1 брать для трудных рассуждений и долгой агентной работы или когда Opus на высоком уровне рассуждений не справляется. По API Opus 5.5 стоит в 2,5 раза дешевле; по моему опыту, работа с ним тоже обходится дешевле. Если план уже готов, писать по нему можно и моделью дешевле. Подробное сравнение двух флагманов для кода - в статье GPT-6 Astra или Claude Fable 5.1: что выбрать.

Тексты. Если текст предназначен клиенту, я беру сильную модель. Sonnet 5 - вариант дешевле: Anthropic называет её лучшим сочетанием скорости и интеллекта. С ней внимательнее вычитывай результат.

Цифры и финансы. Здесь я тоже беру сильную модель. Это мой выбор по опыту работы, не результат сравнительного теста. Но и сильная модель не отменяет проверку: цифры сверяй по первоисточнику. Финансовые и личные данные не отправляй в бесплатные тарифы, условия которых разрешают использовать твои данные.

Поиск и исследования. Sonnet 5 я беру для простых задач и поиска, это мой опыт. GPT-6 Luna - вариант дешевле: OpenAI позиционирует её для массовых однотипных задач.

Рутина. Рутинные задачи повторяются часто, поэтому расходы на отдельные прогоны складываются. Kimi K3 я беру по подписке Kimi Code. DeepSeek Flash - вариант с оплатой по API. Это разные схемы оплаты, и что выйдет дешевле, зависит от твоего объёма.

Где я не экономлю

Эти правила основаны на моей практике. Сравнительным тестом я их не проверял.

  • План и архитектура. Ошибка в плане может перейти в следующие шаги.
  • Цифры и финансы. Здесь я беру сильную модель и всё равно сверяю цифры по первоисточнику.
  • Проверка результата. Чем дешевле модель, которая выполняла задачу, тем внимательнее проверка.

Сжатие переписки определяет, что агент запомнит из длинного разговора, и слишком слабая модель может потерять важное. Переводить сжатие на дешёвую модель можно, но качество проверяй на своих задачах.

Как перевести фоновые задачи Hermes Agent на дешёвую модель

Кроме основной работы, агент выполняет вспомогательные задачи: придумывает названия чатов, сжимает длинную переписку, разбирает картинки, решает, можно ли автоматически одобрить команду. В Hermes Agent они обозначены как auxiliary. По умолчанию у каждой стоит режим auto: её выполняет твоя основная модель. Если основная - флагман и ты платишь по API, вспомогательные задачи тоже идут по цене флагмана.

Для одобрения команд в режиме smart документация Hermes рекомендует дешёвую быструю модель, а использование дорогих называет пустой тратой. Для сжатия контекста и суммаризации веб-страниц, то есть их краткого пересказа, она тоже советует быструю модель вместо дорогой модели с рассуждениями.

Шаги:

  1. Подключи провайдера дешёвой модели заранее, с ключом. По документации Hermes, если назначить задаче провайдера без ключа, задача уйдёт на вариант по умолчанию через OpenRouter, а в журнал agent.log запишется предупреждение. А в режиме auto, если основная модель задачу выполнить не может и запасная цепочка не задана, Hermes пропустит задачу с предупреждением и не переключится на других подключённых провайдеров.
  2. Открой веб-панель Hermes и пройди путь Models → Model Settings → Auxiliary tasks → Configure. В строке нужной задачи (например, Compression, Title Gen, Vision) нажми Change, выбери провайдера и модель и нажми Switch. В документации Hermes вместо этого пути указана кнопка Show auxiliary: названия зависят от версии.
  3. Либо пропиши то же в ~/.hermes/config.yaml. Пример из документации Hermes: разбор картинок (vision) на быстрой модели через OpenRouter.
yaml
auxiliary:
  vision:
    provider: openrouter
    model: google/gemini-2.5-flash

Для названий чатов документация предлагает закрепить быструю модель или поставить auxiliary.title_generation.prefer_fast_model: true, и Hermes сам выберет быструю модель у твоего провайдера.

  1. Открой новую сессию. Изменения модели применяются только к новым сессиям, уже открытые чаты работают на старых настройках. Если правил config.yaml вручную и новая сессия не подхватила настройку, перезапусти Hermes.

Как проверить. В строке задачи вместо auto (use main model) должно быть написано провайдер · модель. Если там по-прежнему auto, задача всё ещё идёт на основную модель. Чтобы вернуть все задачи на основную модель, нажми Reset all to auto.

В таблице для фоновых задач я перечисляю GPT-6 Luna, Gemini 3.8 Flash, DeepSeek Flash и Claude Haiku 4.5. Выбирай из тех провайдеров, которые у тебя уже подключены. Если ты подключаешь модели OpenAI по подписке через провайдера ChatGPT / Codex и GPT-6 Sol и GPT-6 Luna ещё нет в списке моделей твоего Hermes, в таблице советую взять GPT-5.6 Sol или GPT-5.6 Luna. По странице Anthropic, Haiku 4.5 выведут из работы не раньше 15 октября 2026 года. Точной даты нет, поэтому перед этим сроком проверь её статус.

Чего в таблице нет

  • Процентов экономии. Я их не измерял. Сколько ты сэкономишь, зависит от твоих задач и выбранных моделей.
  • Точного расхода лимитов подписки. Как именно запросы из Hermes расходуют лимиты подписки ChatGPT, в документации Hermes не описано.
  • Вечных цен. Модели и тарифы меняются. Перед покупкой сверяйся с официальными страницами.

Полная таблица с разбором по каждой задаче, вариантами подключения и сводкой «где взять модель» лежит в открытом репозитории, в файле README.

Что сделать сегодня

  1. Выпиши три-четыре типа задач, которые ты чаще всего отдаёшь агенту.
  2. Для каждого реши: здесь нужно думать или исполнять по готовому плану.
  3. На «думать» оставь флагман, на «исполнять» поставь модель уровнем ниже, на рутину - самую дешёвую из тех, что справляются с задачей.
  4. В Hermes начни с названий чатов: их проще всего перевести на дешёвую модель. Сжатие контекста переводи следом и проверь на своих длинных разговорах, не стал ли агент терять важное.

Источники

О практикуме по работе с ИИ-агентами - ниже.

Практикум по вайб-кодингу
+Твой второй мозг
3 вечера - инструменты, метод, первый проект
Старт 17–19 ноября  ·  2 000 ₽
Записаться →

Новые материалы - дайджестом, без спама

Гайды выходят регулярно. Подпишись, чтобы не пропускать: пришлю подборку в Telegram или на email. Раз в неделю или каждый день - выбираешь сам.

Была инструкция полезна?
Артемий Миллер
Автор
Артемий Миллер
Предприниматель и вайб-кодер

Артемий Миллер - предприниматель и вайб-кодер. Бывший программист, собирает продукты исключительно вместе с ИИ-агентами, без найма разработчиков.

Связанные инструкции

Память Grok Build между сессиями: как включить и что агент записывает

У Grok Build есть память между сессиями: агент ведёт заметки о проекте в Markdown-файлах и подставляет подходящие записи в новые сессии. Функция экспериментальная и по умолчанию выключена. По официальной документации объясняем, как включить память, что записывается и как посмотреть и удалить заметки.

8 мин

Голосовой режим в Codex: как включить /voice и что он умеет

Стабильный Codex CLI 0.155.0 от 17 сентября 2026 принёс экспериментальные голосовые разговоры с агентом в терминале. По умолчанию функция выключена. По первоисточникам: как включить /voice, что он умеет, где полезен и какие у режима ограничения.

7 мин

Kimi Code: что это, официальный сайт и как установить на Windows и macOS

17 сентября 2026 Moonshot AI выпустил desktop-версию Kimi Code и новую основную версию CLI 2.0. Что это за инструмент, где официальный сайт, как установить его на Windows и macOS и сколько стоит работа с ним.

8 мин

Claude Code 2.1.268: запреты deny молча не работали - что починили и что проверить у себя

10 и 11 сентября 2026 года в Claude Code исправили ошибки в разрешениях: симлинки, строки с env -C и eval, правила с «!» и запись через tee. Заодно /mcp перестал показывать секреты из конфигов. Что изменилось, как обновиться и проверить свои запреты простым тестом.

8 мин

Связанные термины