Если коротко: думать должна сильная модель, исполнять может модель попроще. План и сложные решения отдаёшь флагману (GPT-6 Astra, Claude Fable 5.1 или Claude Opus 5.5), работу по готовому плану - модели среднего уровня, а рутину и фоновые служебные вызовы агента - самой дешёвой из тех, что справляются с задачей. При этом результат нужно проверять: чем дешевле модель, тем внимательнее проверка, иначе экономия уходит в переделки.
Ниже моя таблица «задача → модель», которую я выложил в открытый репозиторий 23 сентября 2026 года. Основные модели в ней - мой личный выбор по опыту работы. Сравнительного теста я не проводил и гарантировать, что у тебя будет так же, не могу. Большинство вариантов подешевле я подобрал по открытым рейтингам и рекомендациям самих разработчиков; Opus 5.5 для кода - тоже из моего опыта. Цены в статье сверены с официальными страницами OpenAI и Anthropic на 23.09.2026.
В Telegram-канале - что нового в вайб-кодинге: модели, инструменты, находки. Подпишись.
Почему одна модель на всё обходится дорого
Если ты платишь за токены по API, каждая задача на флагмане стоит по цене флагмана, даже когда хватило бы модели попроще. При подписке учитывай ограничения своего тарифа и выбранной модели: сверяй их на странице тарифа. Про то, как устроены лимиты подписки Claude и на что они уходят, есть отдельный разбор как не сжечь лимиты Claude Code за день. Здесь речь о выборе модели под конкретную работу.
Официальные цены API за 1 млн токенов на 23.09.2026:
| Модель | Вход | Выход | Для чего её делали |
|---|---|---|---|
| GPT-6 Astra | $10 | $50 | самая сложная работа |
| Claude Fable 5.1 | $10 | $50 | трудные рассуждения, долгая агентная работа |
| Claude Opus 5.5 | $4 | $20 | большинство задач, по совету Anthropic |
| GPT-6 Sol | $2 | $10 | сложный код и агентные сценарии |
| Claude Sonnet 5 | $2 | $10 | баланс скорости и интеллекта |
| Claude Haiku 4.5 | $1 | $5 | самая быстрая у Claude |
| GPT-6 Luna | $0,1 | $0,5 | массовые однотипные задачи |
Возьмём условный прогон агента: 100 тысяч входящих токенов и 10 тысяч исходящих. Это пример расчёта по базовым ценам без кеша, не замер реальной задачи. Такой прогон стоит около $1,5 на GPT-6 Astra или Fable 5.1, $0,6 на Opus 5.5, $0,3 на Sonnet 5 или GPT-6 Sol, $0,15 на Haiku 4.5 и $0,015 на GPT-6 Luna. В этом расчёте между флагманом и самой дешёвой моделью разница в сто раз. Как посчитать такой прогон на своих объёмах, подробно показано в статье как посчитать расход токенов на API.
Две оговорки по ценам. У моделей GPT-6 запрос длиннее 272 тысяч входящих токенов целиком тарифицируется дороже: вход вдвое, выход в полтора раза. А пакетные запросы (Batch) и у OpenAI, и у Anthropic стоят вдвое дешевле стандартных.
Правило: думать сильной моделью, исполнять дешёвой
От плана зависит дальнейшая работа, поэтому на нём я не экономлю и беру самую сильную модель. Писать по готовому плану, собирать данные, переименовывать чаты и сжимать переписку может модель попроще.
При выборе модели я учитываю ещё три правила:
- Чем дешевле модель, тем внимательнее проверка. На проверку тоже уходит твоё время.
- Сравнивай цену готового результата, а не одного запроса. Пример: Opus 5.5 дешевле Fable 5.1 в 2,5 раза и по входу, и по выходу. Если из-за переделок Opus тратит на задачу втрое больше и входящих, и исходящих токенов, по деньгам он выходит дороже. А к токенам добавляется твоё время на проверку. Как считать именно цену результата, разобрано в статье какой ИИ-агент дешевле: цена одной решённой задачи.
- Не подошла модель - пробуй другую. Единого победителя нет, у каждой свои сильные стороны и свои ограничения.
Выбор модели - одна из частей работы с ИИ-агентом.
Таблица: задача → модель
В колонке «основная» - модели, которые я беру сам. В соседней - альтернативы, большинство из них подобрано по открытым рейтингам и советам разработчиков. Opus 5.5 для кода я выбираю и по личному опыту. С более дешёвой моделью проверяй результат внимательнее. Для рутины сравниваются разные схемы оплаты, поэтому этот вариант не обязательно обойдётся дешевле.
| Задача | Основная | Альтернатива |
|---|---|---|
| Стратегия и планы | GPT-6 Astra | GPT-6 Sol |
| Код | Claude Fable 5.1 | Claude Opus 5.5 |
| Тексты и очистка от ИИ-стиля | GPT-6 Astra | Claude Sonnet 5 |
| Цифры и финансы | Claude Fable 5.1 | Claude Opus 5.5 |
| Поиск и исследования | Claude Sonnet 5 | GPT-6 Luna |
| Парсеры и рутина | Kimi K3 (подписка Kimi Code) | DeepSeek Flash (API) |
Стратегия и планы. Ошибка в плане может перейти в следующие шаги. Здесь я беру самую сильную модель. GPT-6 Sol - вариант дешевле: OpenAI позиционирует её для сложного кода и агентных сценариев.
Код. Для кода я беру Fable 5.1. Но Anthropic советует для большинства задач начинать с Opus 5.5, а Fable 5.1 брать для трудных рассуждений и долгой агентной работы или когда Opus на высоком уровне рассуждений не справляется. По API Opus 5.5 стоит в 2,5 раза дешевле; по моему опыту, работа с ним тоже обходится дешевле. Если план уже готов, писать по нему можно и моделью дешевле. Подробное сравнение двух флагманов для кода - в статье GPT-6 Astra или Claude Fable 5.1: что выбрать.
Тексты. Если текст предназначен клиенту, я беру сильную модель. Sonnet 5 - вариант дешевле: Anthropic называет её лучшим сочетанием скорости и интеллекта. С ней внимательнее вычитывай результат.
Цифры и финансы. Здесь я тоже беру сильную модель. Это мой выбор по опыту работы, не результат сравнительного теста. Но и сильная модель не отменяет проверку: цифры сверяй по первоисточнику. Финансовые и личные данные не отправляй в бесплатные тарифы, условия которых разрешают использовать твои данные.
Поиск и исследования. Sonnet 5 я беру для простых задач и поиска, это мой опыт. GPT-6 Luna - вариант дешевле: OpenAI позиционирует её для массовых однотипных задач.
Рутина. Рутинные задачи повторяются часто, поэтому расходы на отдельные прогоны складываются. Kimi K3 я беру по подписке Kimi Code. DeepSeek Flash - вариант с оплатой по API. Это разные схемы оплаты, и что выйдет дешевле, зависит от твоего объёма.
Где я не экономлю
Эти правила основаны на моей практике. Сравнительным тестом я их не проверял.
- План и архитектура. Ошибка в плане может перейти в следующие шаги.
- Цифры и финансы. Здесь я беру сильную модель и всё равно сверяю цифры по первоисточнику.
- Проверка результата. Чем дешевле модель, которая выполняла задачу, тем внимательнее проверка.
Сжатие переписки определяет, что агент запомнит из длинного разговора, и слишком слабая модель может потерять важное. Переводить сжатие на дешёвую модель можно, но качество проверяй на своих задачах.
Как перевести фоновые задачи Hermes Agent на дешёвую модель
Кроме основной работы, агент выполняет вспомогательные задачи: придумывает названия чатов, сжимает длинную переписку, разбирает картинки, решает, можно ли автоматически одобрить команду. В Hermes Agent они обозначены как auxiliary. По умолчанию у каждой стоит режим auto: её выполняет твоя основная модель. Если основная - флагман и ты платишь по API, вспомогательные задачи тоже идут по цене флагмана.
Для одобрения команд в режиме smart документация Hermes рекомендует дешёвую быструю модель, а использование дорогих называет пустой тратой. Для сжатия контекста и суммаризации веб-страниц, то есть их краткого пересказа, она тоже советует быструю модель вместо дорогой модели с рассуждениями.
Шаги:
- Подключи провайдера дешёвой модели заранее, с ключом. По документации Hermes, если назначить задаче провайдера без ключа, задача уйдёт на вариант по умолчанию через OpenRouter, а в журнал
agent.logзапишется предупреждение. А в режимеauto, если основная модель задачу выполнить не может и запасная цепочка не задана, Hermes пропустит задачу с предупреждением и не переключится на других подключённых провайдеров. - Открой веб-панель Hermes и пройди путь Models → Model Settings → Auxiliary tasks → Configure. В строке нужной задачи (например, Compression, Title Gen, Vision) нажми Change, выбери провайдера и модель и нажми Switch. В документации Hermes вместо этого пути указана кнопка Show auxiliary: названия зависят от версии.
- Либо пропиши то же в
~/.hermes/config.yaml. Пример из документации Hermes: разбор картинок (vision) на быстрой модели через OpenRouter.
auxiliary:
vision:
provider: openrouter
model: google/gemini-2.5-flashДля названий чатов документация предлагает закрепить быструю модель или поставить auxiliary.title_generation.prefer_fast_model: true, и Hermes сам выберет быструю модель у твоего провайдера.
- Открой новую сессию. Изменения модели применяются только к новым сессиям, уже открытые чаты работают на старых настройках. Если правил
config.yamlвручную и новая сессия не подхватила настройку, перезапусти Hermes.
Как проверить. В строке задачи вместо auto (use main model) должно быть написано провайдер · модель. Если там по-прежнему auto, задача всё ещё идёт на основную модель. Чтобы вернуть все задачи на основную модель, нажми Reset all to auto.
В таблице для фоновых задач я перечисляю GPT-6 Luna, Gemini 3.8 Flash, DeepSeek Flash и Claude Haiku 4.5. Выбирай из тех провайдеров, которые у тебя уже подключены. Если ты подключаешь модели OpenAI по подписке через провайдера ChatGPT / Codex и GPT-6 Sol и GPT-6 Luna ещё нет в списке моделей твоего Hermes, в таблице советую взять GPT-5.6 Sol или GPT-5.6 Luna. По странице Anthropic, Haiku 4.5 выведут из работы не раньше 15 октября 2026 года. Точной даты нет, поэтому перед этим сроком проверь её статус.
Чего в таблице нет
- Процентов экономии. Я их не измерял. Сколько ты сэкономишь, зависит от твоих задач и выбранных моделей.
- Точного расхода лимитов подписки. Как именно запросы из Hermes расходуют лимиты подписки ChatGPT, в документации Hermes не описано.
- Вечных цен. Модели и тарифы меняются. Перед покупкой сверяйся с официальными страницами.
Полная таблица с разбором по каждой задаче, вариантами подключения и сводкой «где взять модель» лежит в открытом репозитории, в файле README.
Что сделать сегодня
- Выпиши три-четыре типа задач, которые ты чаще всего отдаёшь агенту.
- Для каждого реши: здесь нужно думать или исполнять по готовому плану.
- На «думать» оставь флагман, на «исполнять» поставь модель уровнем ниже, на рутину - самую дешёвую из тех, что справляются с задачей.
- В Hermes начни с названий чатов: их проще всего перевести на дешёвую модель. Сжатие контекста переводи следом и проверь на своих длинных разговорах, не стал ли агент терять важное.
Источники
О практикуме по работе с ИИ-агентами - ниже.
Новые материалы - дайджестом, без спама
Гайды выходят регулярно. Подпишись, чтобы не пропускать: пришлю подборку в Telegram или на email. Раз в неделю или каждый день - выбираешь сам.

