Рейтинг ИИ-агентов для программирования в 2026: кто реально решает задачи

Опубликовано 08.09.202619 мин чтенияБазовый
Футуристические гонщики с одинаковым мотором показывают разный результат на трассе рейтинга ИИ.
Что узнаешь
  • Почему рейтинг ИИ-агентов - это про связку «агент плюс модель», а бренд тут вторичен
  • Что на самом деле измеряет SWE-bench, главный замер для кода, и как читать его проценты
  • Почему один и тот же ИИ в разных агентах решает разное число задач
  • Сколько стоит одна решённая задача и почему это честнее, чем цена подписки за месяц
  • Готовый чек-лист из шести пунктов, чтобы прочитать любой рейтинг за пять минут
Базовый
1просмотров

Каждую неделю кто-нибудь выкладывает картинку: столбики, проценты, сверху жирным «лучший ИИ для кода 2026». И под ней сразу спор на сто комментариев. Один кричит, что его инструмент решает 80 процентов задач, другой тычет скриншотом, где у того же инструмента 74. Оба правы. Просто они смотрят на разные замеры и меряют разное.

Я сам через это прошёл, когда выбирал, чем собирать свои проекты. Погонишься за верхней строчкой рейтинга - и через неделю понимаешь, что цифра была про лабораторный тест, а на твоей реальной задаче всё иначе. Поэтому дальше речь пойдёт не про то, кто первый, а про устройство любого рейтинга ИИ-агентов для программирования: что там меряют, почему одна и та же нейросеть выдаёт разный результат, сколько это стоит по-честному и как за пять минут прочитать любую таблицу и выбрать инструмент под свою задачу.

В Telegram-канале - что нового в вайб-кодинге: инструменты, находки, ошибки. Подпишись.

Почему рейтинг ИИ-агентов - это не про бренд?

Первое, что стоит выкинуть из головы, - привычку болеть за бренд. «Anthropic против OpenAI», «Claude против Gemini» - это удобно для заголовка, но к выбору инструмента отношения почти не имеет. Потому что то, что ты запускаешь у себя на компьютере, - это агент. А агент собран минимум из двух слоёв, и оба влияют на результат.

Представь повара и кухню. Модель - это повар: он умеет готовить, у него есть талант и опыт. Агент - это кухня со всей обвязкой: плита, ножи, порядок действий, помощник, который подаёт продукты. Дай гениальному повару убитую кухню - и ужин выйдет так себе. Дай среднего повара на идеально настроенной кухне - и он приготовит ровно и быстро. В рейтингах ИИ-агентов ты выбираешь кухню целиком, вместе с поваром.

Отсюда простое правило, с которым дальше будет легче. Когда видишь «инструмент X решает 80 процентов задач», первым делом спрашивай: какая модель внутри, какой агент ей рулил и на каком тесте это мерили. Нет ответа хотя бы на один вопрос - перед тобой картинка для спора. Рейтингом это называть рано.

Из чего собран любой ИИ-агент: модель, оболочка и настройка

Разберу три слоя по порядку, без них дальше никак.

Первый слой - модель. Это сама нейросеть: Claude Opus и Sonnet у Anthropic, GPT-5 у OpenAI, Gemini у Google. Она и есть «мозг», который придумывает решение и пишет код. Но сама по себе модель ничего не запускает и файлов не видит. Она умеет только выдавать текст в ответ на текст.

Второй слой - оболочка, или агент. Это программа-обвязка вокруг модели. Она даёт нейросети руки: открывает файлы проекта, запускает команды в терминале, показывает, что сломалось, и просит починить. Claude Code, Codex CLI от OpenAI, Cursor, Cline, Aider - это как раз оболочки. У инженеров для второго слоя есть жаргонное слово «харнес», дословно «упряжь». Смысл ровно такой: упряжь, через которую модель тянет реальную работу.

Третий слой - настройка. Это ручки, которые крутят внутри оболочки: сколько модели позволено «размышлять» перед ответом, сколько попыток дать на одну задачу, какие инструменты открыть. Одна и та же связка на разных настройках выдаёт разные числа.

Вот тут и прячется вся путаница рейтингов. Люди спорят про первый слой («какая модель умнее»), а результат в таблице зависит от всех трёх сразу. Про то, как эти слои собираются в рабочую систему у меня в проектах, я подробно рассказываю в материале что такое ИИ-агент простыми словами.

Одно дело прочитать рейтинг, другое - собрать свою рабочую связку из модели, агента и настроек. За это отвечает контекст-инжиниринг - управление тем, что видит ИИ, ещё до запроса. На практикуме за три вечера я собираю всю схему целиком: ИИ-клон, Второй мозг и контекст-инжиниринг. Именно связка превращает Claude из «помощника с галлюцинациями» в предсказуемый инструмент.

Практикум по вайб-кодингу
+Твой второй мозг
3 вечера - инструменты, метод, первый проект
Старт 22–24 сентября  ·  2 000 ₽
Записаться →

Что вообще измеряет SWE-bench, главный рейтинг для кода?

Чтобы читать любой рейтинг для кода, надо понимать главный замер, на который все ссылаются. Это SWE-bench. Его придумали исследователи из Принстонского университета, и вышел он на серьёзной научной конференции. Это не самодельная картинка из блога.

SWE-bench проверяет способность ИИ-систем решать задачи из GitHub. Мы собрали 2294 задачи, выкачав запросы на изменение и сообщения об ошибках из 12 популярных репозиториев на Python.

- SWE-bench, официальный сайт бенчмарка, https://www.swebench.com/original.html

Смысл теста простой и честный. Берут настоящий проект с настоящей поломкой, которую когда-то чинили живые программисты. Агенту дают этот проект и описание проблемы своими словами. Он должен разобраться в чужом коде, найти нужное место и прислать правку. Потом систему прогоняют через настоящие тесты проекта. Прошли тесты - задача засчитана. Не прошли - нет. Никаких «на мой взгляд, решено»: только зелёные галочки автотестов.

Из полного набора в 2294 задачи чаще всего показывают результаты на его выверенной части - её называют SWE-bench Verified. Это 500 задач, которые живые люди перепроверили вручную, чтобы среди них не было кривых или нерешаемых в принципе. Эту версию собрали вместе с OpenAI в августе 2024 года, и именно её проценты ты видишь почти во всех рейтингах. Когда встречаешь «X процентов на SWE-bench Verified», речь про долю из этих пятисот задач.

Почему один и тот же ИИ даёт разный результат в разных агентах

Вот факт, который сразу гасит половину споров в комментариях. Одна и та же модель в разных оболочках выдаёт разные проценты, и разрыв между ними заметный.

Это видно прямо в открытых данных. У бенчмарка Terminal-Bench, который меряет работу агентов в терминале, таблица устроена честно: там две отдельные колонки - какая модель и какой агент. Плюс рядом стоимость и расход. Составители сделали так специально, чтобы показать: результат - это всегда пара «модель плюс агент». Одной нейросети для балла мало. Держат этот замер университетские команды - Стэнфорд вместе с институтами Harbor и Laude.

Причина разброса понятная, если вернуться к трём слоям. Один агент даёт модели десять попыток на задачу, другой - три. Один показывает ей полный текст ошибки, другой - обрезанный. Один разрешает запускать тесты и чинить по кругу, пока не заработает, другой останавливает после первой правки. Нейросеть одна и та же, а условия работы разные - вот и проценты разные.

Практический вывод для тебя простой. Увидел «Claude решает 77 процентов» - это результат Claude в конкретной оболочке с конкретными настройками. Поставишь ту же модель в другой агент - получишь другое число. Поэтому «модель умная» и «связка решает задачи» - разговор о двух разных вещах.

Сколько стоит одна решённая задача?

Теперь про деньги, потому что тут ломается больше всего копий. Люди сравнивают ценники подписок: этот агент 20 долларов в месяц, тот 200. И делают вывод «первый дешевле». Вывод неверный, потому что подписка - это не про результат.

Цена подписки тут мало что говорит. Считать надо цену одной задачи, которую агент реально довёл до рабочего состояния. Платишь ты за токены - так называют кусочки текста, которыми ты и модель обмениваетесь. Чем больше модель читает и пишет, тем больше токенов, тем выше счёт. Цены за токены компании публикуют открыто. Вот, для примера, что Anthropic говорит про свою модель Sonnet:

Цена остаётся такой же, как у Claude Sonnet 4: 3 доллара за миллион входных токенов и 15 долларов за миллион выходных.

- Anthropic, страница релиза Claude Sonnet 4.5, https://www.anthropic.com/news/claude-sonnet-4-5

Дальше начинается арифметика, из-за которой дешёвый ценник обманывает. Возьми две модели. Первая дороже за токен, но решает задачу с первой попытки. Вторая дешевле, но заходит на задачу по десять раз, каждый раз перечитывая весь проект. По итогу дешёвая по ценнику модель нагоняет больше токенов и приносит счёт выше, чем дорогая. Про то, из чего вообще складывается цена работы с ИИ, я подробно разбираю в материале сколько стоит ИИ-агент для бизнеса и отдельно - как считать цены на инструменты вайб-кодинга.

Хорошие рейтинги это понимают и показывают рядом с процентом ещё и стоимость: сколько денег ушло на все задачи. Смотри именно на это. Агент, который решает 75 процентов по доллару за задачу, для тебя обычно выгоднее того, кто выбивает 78 процентов по три доллара.

Почему скорость - тоже часть рейтинга?

Третье, что обычно теряется за процентами, - время. А оно решает не меньше цены, если работаешь с агентом каждый день.

Смотри, в чём подвох. Точность и скорость тянут в разные стороны. Чтобы решить больше задач, агенту дают больше «думать» и больше попыток: он перебирает варианты, гоняет тесты, переделывает. Проценты растут, а вместе с ними растёт и время ответа. На одной разовой правке разница между минутой и десятью минутами незаметна. Но если ты сидишь с агентом весь вечер и ставишь задачу за задачей, эти минуты складываются в часы твоего ожидания перед экраном.

Поэтому у скорости в рейтинге двойное дно. Верхняя строчка по точности часто оказывается самой медленной и самой дорогой одновременно - её выжали на максимальных настройках ради красивой цифры. А тебе для повседневной работы, может, нужнее связка чуть пониже в таблице, зато втрое быстрее и дешевле. Что из этого важнее, зависит от твоих задач, и рейтинг сам за тебя этот выбор не сделает.

Почему разница в пару процентов часто просто шум

Ещё одна ловушка рейтинга - верить, что первое место реально лучше третьего. Часто между ними два-три процента, и этот отрыв держится на паре задач из пятисот. Прогонишь тот же тест заново - и лидеры поменяются местами, потому что модель отвечает не абсолютно одинаково каждый раз.

Честные замеры это показывают открыто. Рядом с каждым результатом рисуют «усы» - вилку разброса, внутри которой настоящее значение и живёт. У Terminal-Bench, например, эти усы означают доверительный интервал в 95 процентов: грубо говоря, истинный результат где-то в этой вилке, а точной точки нет. И если усы двух агентов налезают друг на друга, разницы между ними нет, как бы ни выстроились столбики.

Из этого - правило, которое экономит нервы. Не гоняйся за первой строчкой, если отрыв меньше трёх процентов. Внутри такого зазора «лидер» и «преследователь» - это одно и то же, просто в этот раз кубик лёг так. Смотри на группу верхних связок целиком и выбирай внутри неё по цене, скорости и доступности. Место в таблице тут не главное.

Кто в лидерах разных замеров на момент написания

Теперь про сами цифры - с важной оговоркой. Любые конкретные проценты живут недолго. Вышла новая версия модели или обновили агента - и через неделю таблица другая. Поэтому числа не заучивай, держи в голове порядок величин и умей проверить сам.

По официальным заявлениям самих компаний картина на выверенных 500 задачах SWE-bench такая. OpenAI про свою модель GPT-5 написала так:

GPT-5 показывает лучший в классе результат на ключевых замерах для кода: 74,9 процента на SWE-bench Verified и 88 процентов на Aider polyglot.

- OpenAI, страница релиза GPT-5 для разработчиков, https://openai.com/index/introducing-gpt-5-for-developers/

Anthropic про свои модели заявляет близкие числа. Про Claude Opus 4.1 - 74,5 процента на том же SWE-bench Verified. Про более свежую Claude Sonnet 4.5 - 77,2 процента, усреднённые по десяти прогонам, и до 82 процентов, если дать модели несколько попыток и выбрать лучшую.

Мы приводим 77,2 процента - это среднее по десяти прогонам, без дополнительных вычислений на этапе теста, на полном наборе из 500 задач SWE-bench Verified.

- Anthropic, страница релиза Claude Sonnet 4.5, https://www.anthropic.com/news/claude-sonnet-4-5

Видишь, что происходит? Топовые связки от разных компаний стоят в узком коридоре: примерно 74-77 процентов. Разрыв между ними - те самые пара процентов, которые часто внутри погрешности. Так что «кто первый» тут зависит от недели замера и от настроек. Куда важнее, что вся верхняя группа умеет примерно одно и то же, а выбирать внутри неё надо по цене, скорости и тому, доступен ли инструмент тебе вообще.

И ещё одна деталь, которую компании упоминают мелким шрифтом, а она важная. Тот же результат GPT-5 посчитан не на всех 500 задачах:

Наши результаты не включают 23 из 500 задач, решения которых не проходили стабильно на нашей инфраструктуре.

- OpenAI, страница релиза GPT-5 для разработчиков, https://openai.com/index/introducing-gpt-5-for-developers/

То есть 74,9 процента - это доля от 477 задач, а не от полных 500. Мелочь? Нет. Ровно из-за таких сносок два честных рейтинга дают разные числа для одной модели. Что искать в этих сносках - в следующем разделе.

Как прочитать любой рейтинг за пять минут: чек-лист

Сведу всё в короткий порядок действий. Открываешь любой рейтинг ИИ-агентов и идёшь по шести вопросам сверху вниз.

  1. Какой это замер? SWE-bench Verified, Terminal-Bench, что-то ещё. Если замер вообще не назван - закрывай, это картинка ради спора.
  2. Что за связка? Одного «Claude» мало, нужно «Claude такой-то версии в такой-то оболочке». Нет обеих частей - процент повисает в воздухе.
  3. На скольких задачах считали? На всех пятистах или на части, как в примере с 477 у GPT-5. Урезанный набор завышает число.
  4. Сколько попыток давали? Один заход честнее, чем «десять попыток и берём лучшую». Второе красивее выглядит, но в твоей реальной работе так никто не сидит.
  5. Сколько это стоит? Есть ли рядом с процентом колонка с ценой. Нет цены - половина картины спрятана.
  6. Показан ли разброс? Есть ли «усы» погрешности. Если отрыв лидера меньше трёх процентов и усы перекрываются - это ничья.

Пройдёшь по этим шести пунктам - и любой громкий заголовок либо подтвердится, либо развалится за пять минут. Отдельно полезно помнить, что даже пройденный тест не гарантирует результата на твоём проекте: почему так, я разбираю в материале почему ИИ-агент говорит «готово», когда работа не сделана.

Откуда в рейтингах берётся враньё: старые задачи в тренировке моделей?

Есть ещё одна причина не молиться на проценты - и о ней честно говорят сами составители. Задачи SWE-bench взяты из открытых проектов, которые лежат в интернете годами. А нейросети учат ровно на интернете. Значит, модель во время учёбы вполне могла наткнуться на эти же проекты вместе с готовыми исправлениями.

Что это означает на практике: часть «решённых» задач модель не решила сама - она вспомнила готовый ответ. Она уже видела его во время учёбы и просто воспроизвела. Такой процент показывает память. Про умение разбираться в новом коде он не говорит ничего. OpenAI прямо признаёт этот риск для SWE-bench. И составители более нового Terminal-Bench вынесли защиту от этого в главный принцип:

Данные бенчмарка никогда не должны попадать в обучающие корпуса.

- Terminal-Bench, официальный сайт бенчмарка, https://www.tbench.ai/

Вывод для читателя такой. Чем свежее задачи и чем больше среди них закрытых, которые модель заведомо не видела, тем честнее замер. Поэтому новые бенчмарки со скрытыми тестами заслуживают больше доверия, чем старые открытые наборы, по которым все уже потренировались. Когда выбираешь между двумя рейтингами, отдай предпочтение тому, где задачи свежие и часть спрятана от моделей.

Какой ИИ-агент выбрать под свою задачу

Соберу всё в практический выбор. Универсального победителя нет, поэтому смотри на свою задачу.

Если проект сложный, с большой кодовой базой и долгой работой, бери мощную модель в зрелой оболочке. Из связок, которые держат верх рейтингов, это Claude Code от Anthropic на моделях Opus и Sonnet, и Codex от OpenAI на моделях линейки GPT-5. Это готовые агенты, где всё уже настроено, и они стабильно тянут тяжёлые задачи. Дорого по токенам, зато меньше возни.

Если задачи простые - поправить текст, собрать небольшую страницу, накидать скрипт, - переплачивать за топовую модель незачем. Модели попроще и подешевле закроют это без разницы в результате, а счёт будет в разы меньше.

Если важно, чтобы было бесплатно и работало локально, смотри в сторону открытых агентов: Cline, Aider, OpenHands. У них нет своей модели, ты подключаешь любую по своему ключу. Гибко, но настраивать придётся самому. Отдельный редактор с агентом внутри - это Cursor, он умеет работать сразу с моделями разных компаний, ты выбираешь под задачу. Какую задачу вообще стоит отдавать агенту, а какую нет, я разбираю в материале какие задачи бизнеса реально отдать ИИ-агенту.

Что с доступом к этим агентам из России

Отдельно про больной вопрос для нас. Верхушка рейтингов - это модели Anthropic, OpenAI и Google. А Россия не входит в списки стран, которые эти компании официально поддерживают. По факту это значит, что зарегистрироваться и оплатить подписку на Claude, ChatGPT или Codex обычными средствами из России не выйдет: нужны обходные способы, чаще всего зарубежная карта или готовый аккаунт.

Открытые агенты положения не спасают. Cline, Aider, OpenHands ты поставишь локально бесплатно, но работать они будут только с подключённой моделью, а ключ к сильной модели - это снова оплата у той же Anthropic или OpenAI. Так что вопрос доступа упирается в оплату модели под агентом. Сам агент тут вторичен.

Важная оговорка: доступность и способы оплаты меняются часто, поэтому проверяй актуальный статус на момент, когда это читаешь. Старые обзоры тут быстро врут. Я держу свежие находки по доступу и оплате в Telegram-канале - подписка на него в начале и в конце этого материала.

Частые вопросы

Частые вопросы

Источники

Полная схема вайб-кодинга за три вечера: ИИ-клон, Второй мозг и контекст-инжиниринг. Записи эфиров в личном кабинете, доступ 30 дней.

Практикум по вайб-кодингу
+Твой второй мозг
3 вечера - инструменты, метод, первый проект
Старт 22–24 сентября  ·  2 000 ₽
Записаться →

Новые материалы - дайджестом, без спама

Гайды выходят регулярно. Подпишись, чтобы не пропускать: пришлю подборку в Telegram или на email. Раз в неделю или каждый день - выбираешь сам.

Была инструкция полезна?
Артемий Миллер
Автор
Артемий Миллер
Предприниматель и вайб-кодер

Артемий Миллер - предприниматель и вайб-кодер. Бывший программист, собирает продукты исключительно вместе с ИИ-агентами, без найма разработчиков.

Связанные термины