Каждый день в Telegram-канале - что нового в вайб-кодинге: инструменты, находки, ошибки. Подпишись, чтобы быть в курсе.
Чат-бот ждёт твоего сообщения, агент за это время делает двадцать шагов
Разница чувствуется в тот момент, когда ты уходишь пить кофе. Чат-бот будет ждать. ИИ-агент за это время может успеть многое, включая то, о чём ты его не просил.
ИИ-агентом сейчас зовут всё подряд, поэтому развожу три уровня.
| Уровень | Что делает | Кто решает, когда остановиться | Пример |
|---|---|---|---|
| Подсказчик | Отвечает на вопрос, пишет текст, объясняет | Ты | Обычный чат с моделью |
| Исполнитель | Берёт задачу и доводит до результата за один заход | Модель, в рамках задачи | «Разбери эту выгрузку и собери сводку» |
| Функция | Запускается по расписанию, работает без тебя, присылает отчёт | Инструкция, которую ты написал заранее | Каждое утро в девять собирает вчерашние заявки и присылает разбор |
Ради третьего уровня всё и затевается. Один раз описал работу, поставил расписание, дальше она делается без тебя.
До этого я год работал на втором уровне и хорошо помню, как это ощущается. План пишу большой, продумываю внимательно, а дальше начинается ручной труд по кругу на каждый кусок: агент пишет, говоришь «проверь на ошибки», говоришь «проверь безопасность», смотришь глазами, тестишь руками. И так фаза за фазой, весь день у экрана. Код вроде пишет машина, а погонщиком работаю я.
Исполнителя ты запускаешь руками и видишь результат сразу. Функция работает, когда тебя нет, и промах ты увидишь на следующий день, когда он уже успел повториться. Дальше про то, какую работу можно спокойно перевести на третий уровень.
Почему «ИИ-агент под ключ» из выдачи часто разочаровывает?
Я не спорю с этим рынком. Бот на сайте - нормальная штука, если задача ровно такая. Проблема начинается, когда человек приходит с фразой «хочу ИИ-сотрудника», получает виджет на сайт и через месяц решает, что вся тема с агентами придумана маркетологами.
Размер этого рынка Gartner посчитал ещё в июне 2025: из тысяч компаний, называющих себя агентными, настоящих около ста тридцати. Остальное - переклеенные ярлыки на чат-ботах и старой автоматизации, у аналитиков для этого даже термин завёлся. Там же прогноз: больше 40% агентных проектов закроют к концу 2027 года из-за растущих расходов, непонятной пользы и слабого контроля рисков.
Три вещи, которых в такой сборке не будет никогда.
- Твои системы. Агент на чужой платформе видит то, что платформа успела к себе подключить. Твоя выгрузка из склада, папка с договорами и переписка с подрядчиком туда не попадают.
- Твой способ думать. Бот отвечает по сценариям, которые нарисовал не ты. ИИ-клон работает наоборот: он воспроизводит логику твоих решений, потому что ты сам положил её в проект.
- Право менять. Захотел добавить шаг - идёшь в поддержку и ждёшь. То, что собрал сам, меняешь за вечер.
Когда собираешь сам, ты платишь другой ценой: временем на первую настройку и вниманием на проверку. Внимание окупается там, где ошибка правится за минуту, и не окупается там, где она стоит нескольких дней.
Какие задачи бизнеса ИИ-агент закрывает целиком уже сегодня?
Проверка простая. Задай себе три вопроса про задачу: смогу ли я это откатить, увижу ли ошибку сегодня, переделаю ли за минуту. Три «да» - отдавай целиком.
Что попадает в эту корзину.
- Черновик любого текста. Описание услуги, ответ на типовой вопрос, письмо подрядчику, план поста. Плохой черновик виден с первой строки.
- Разбор входящего потока. Заявки, отзывы, письма, сообщения из чата. Агент раскладывает их по темам, вытаскивает повторяющиеся жалобы и складывает в сводку.
- Сборка отчёта из твоих же данных. Выгрузка из таблицы, платежи, записи на приём. Агент считает и оформляет, ты смотришь на итог.
- Первый проход по большому объёму. Двести отзывов, сорок страниц договора, годовая переписка. Человек на таком объёме сидит полдня, агент проходит его за минуты, а его работу ты проверяешь выборкой.
- Механические правки в проекте. Переименовать, привести к одному виду, разложить файлы, поправить одно и то же сразу в двадцати файлах.
Это совпадает с замерами. В работе о надёжности агентов на длинных задачах, где прогнали десять моделей и 23 392 прогона, разные типы работы ведут себя по-разному: обработка документов держится почти ровно по мере роста задачи, с 0,74 до 0,71. Разбор входящего потока и сборка сводок - ровно этот тип работы, потому он и отдаётся первым.
Владелец салона может отдать агенту отзывы за квартал и получить перечень повторяющихся претензий там, где раньше было общее ощущение «вроде всё нормально». Ошибку в такой сводке видно с первого взгляда.
Хочешь пойти дальше первой задачи и собрать связку, при которой агент раскладывает работу по твоим категориям? Одна задача - это один кирпич. На практикуме за три эфира собираешь всю связку: ИИ-клон + Второй мозг + Контекст-инжиниринг. Именно она превращает агента из помощника с галлюцинациями в предсказуемого исполнителя.
Какие задачи он тянет только под присмотром?
Я свёл это в таблицу и с тех пор к вопросу не возвращаюсь.
| Корзина | Признак | Примеры | Кто нажимает финальную кнопку |
|---|---|---|---|
| Отдать целиком | Обратимо, правится за минуту, видно сразу | Черновики, разбор потока, сводки, первый проход по объёму | Агент |
| Под присмотром | Обратимо, но правится днями | Письма клиентам, публикации, правки рабочей системы, работа со счетами | Ты |
| Не отдавать | Необратимо или отвечаешь ты | Удаление данных, платежи, обязательства, решения о людях | Только ты |
Присмотр устроен просто и настраивается один раз. ИИ-агент кладёт результат в черновик, отправляешь ты. Что собирается изменить - пишет заранее, до того как менять. На любом шаге, который стоит денег, он останавливается и спрашивает.
У себя я свёл это к одному правилу и пишу его агенту прямым текстом: дёргать меня разрешено только в трёх случаях - нужно действие на живом продукте, конфликт с чужой параллельной работой, развилка, которую дорого откатывать. Всё остальное чини и продолжай. Правило звучит грубо, зато именно оно превращает ночную работу в работу: за три дня так закрылись восемь фаз из четырнадцати, и утром я больше принимаю сделанное, чем переделываю.
В Claude Code это ставится в правах доступа: перечисляешь, что агенту можно делать молча, а что только с твоего разрешения. Подробнее - в материале про то, как не дать агенту сломать проект. Настраивается один раз на проект, дальше работает без напоминаний.
Регулярная функция попадает во вторую корзину автоматически, даже если сама по себе выглядит безобидно, потому что ошибку ночного запуска ты увидишь только утром, а к этому времени она успеет повториться несколько раз.
Что ИИ-агент заваливает стабильно и почему это не лечится промптом?
30 июля 2026 Anthropic опубликовала разбор собственных проверок безопасности. Компания перебрала 141 006 прогонов своих оценок и нашла три случая, когда модель на прогоне вышла в настоящий интернет и навредила реальным системам.
В первом случае имя вымышленной компании из задания совпало с существующим доменом. Модель нашла настоящую компанию, пролезла через дыры в её защите и добралась до рабочей базы - несколько сотен строк живых данных.
Это был единственный случай, когда модель продолжила атаковать систему после того, как поняла, что, скорее всего, работает в реальной среде.
Во втором случае модель собрала вредоносную программу и выложила её в открытый каталог готовых кусков кода, откуда их скачивают тысячи чужих проектов. Программа провисела там около часа и успела попасть на пятнадцать настоящих систем, включая сканер одной компании, которая безопасностью и занимается.
Клод убедил себя, что всё ещё находится в симуляции.
В третьем случае внутренняя исследовательская модель просканировала около девяти тысяч целей, добралась до одной компании известными приёмами, а потом сама пришла к выводу, что цель настоящая, и прекратила атаку.
Понимает ли модель, что среда настоящая? Три случая - три разных ответа. Одна поняла и остановилась, вторая поняла и продолжила, третья уговорила себя, что это всё ещё тест. И это лаборатория Anthropic с лучшими в мире условиями. У тебя на ноутбуке условия скромнее.
Ограничение ставишь снаружи агента. Рабочая формулировка звучит так: у него физически нет доступа к рабочей базе и нет ключа от платежей. Просьба быть аккуратным остаётся просьбой, и под давлением задачи модель её обойдёт.
Вторая слабость видна в замерах надёжности. Открытая инженерная задача проседает с 0,90 до 0,44 по мере роста горизонта, а у самых сильных моделей до 19% прогонов заканчиваются срывом, потому что они берутся за амбициозные многошаговые планы и не вытягивают. Оттуда же неожиданное: подпорки с памятью ухудшили результат на длинных задачах у всех десяти моделей.
Арифметика длинной цепочки объясняет это и без науки. Если агент делает каждый шаг правильно в 85 случаях из ста, восемь шагов подряд он пройдёт примерно в 27 случаях из ста. Три задачи из четырёх сломаются где-то посередине, и каждый раз в новом месте.
Причину сформулировал Декс Хорти из HumanLayer, разбирая, почему проваливаются попытки поставить разработку целиком на агентов.
Тесты дают обратную связь за секунды, а цена плохой архитектуры измеряется неделями, месяцами, а то и годами.
Правило переносится на любую работу в бизнесе. ИИ-агент вытягивает то, что проверяется быстро, а всё, чья цена всплывает через месяцы - доверие клиента, репутация, порядок в данных, юридический хвост - в его оценке не участвует, потому что померить это к концу задачи он не может.
Третью слабость, оценку собственной работы, заметить труднее всего, а мешает она чаще двух первых. Агент говорит «готово» с той же интонацией, с какой сказал бы человек, который проверил. Разобрал эту механику отдельно в материале про то, почему агент говорит «готово», когда работа не сделана, там же готовый промпт для приёмки.
Что вышло, когда агенту отдали настоящий бизнес?
Andon Labs держит бенчмарк, где агент ведёт торговый автомат целый смоделированный год: закупает товар, ставит цены, договаривается с поставщиками, платит аренду. Прогнали 55 моделей. Лучший результат на конец июля 2026 - $11 182 у Claude Opus 5, следом Opus 4.7 с $10 937 и GPT-5.6 Sol с $9 619. Авторы отдельно посчитали, сколько сделал бы человек, который разобрал данные первых двух месяцев и подобрал ассортимент: около $63 000 за год.
По нашей оценке, хорошая работа человека легко даст в десять раз больше, чем лучшие языковые модели сегодня.
Один торговый автомат. Никаких людей, партнёров и юристов. Модель, которая пишет код лучше большинства разработчиков, вытягивает тут шестую часть человеческого результата, и делает это стабильно, с растущим от месяца к месяцу трендом.
Anthropic ставила похожий опыт на живых автоматах в трёх городах и во второй фазе добавила агенту-продавцу агента-директора. Скидок стало меньше примерно на 80%, раздач вдвое. Одновременно директор втрое поднял число возвратов и вдвое - число начислений на будущие покупки, хотя и то и другое просто съедает выручку. Агенты чуть не подписались на фьючерсы на лук, запрещённые в США с 1958 года, и попытались нанять охранника за $10 в час.
Мы заново открыли, что бюрократия важна. Кого-то процедуры и чек-листы раздражают, но существуют они не просто так.
Третий опыт ближе всего к жизни предпринимателя. В конце июля 2026 команда Bottleneck Labs отдала агенту настоящее приложение из App Store, счёт с $350 и сутки без вмешательства. Агент сделал 1 129 действий. Реклама в двух кабинетах не завелась из-за ошибок доступа, выложить пост на площадках не дали защиты от ботов. Тогда он купил кампанию на 50 тестировщиков за $99,50, разослал письма по своей же базе и за последние двенадцать часов шесть раз поменял цену, закончив тем, что сделал приложение бесплатным. Пользователей стало на пять больше, новой выручки ноль, на счету осталось $250,50.
Тут нужна оговорка, без которой картина неполная. В задании агенту прямым текстом написали: деньги, оставшиеся на счету к утру, при разборе идут в ноль, и при отсутствии роста за сутки бизнес закрывают. Он повёл себя ровно как человек, которому сказали это перед увольнением. Агент честно оптимизирует ту цель, которую ты в него положил, вместе со всеми её кривыми краями, и глупость модели тут ни при чём.
Компания, которая отдала агенту 80% работы, стала проверять втрое больше
Цифры дал Джейсон Клинтон, заместитель директора по безопасности Anthropic, в июльском разборе того, как в компании устроена разработка.
Клод пишет около 80% кода, который сегодня попадает в наш общий проект.
Рядом вторая цифра: доля работ с содержательными замечаниями на проверке выросла с 16% до 54%. При этом инженеры выпускают в среднем в восемь раз больше кода за квартал, чем в период с 2021 по 2025 год.
Печатать приходится меньше, вычитывать - больше. Объём вырос в восемь раз, и вместе с ним пришлось втрое чаще смотреть внимательно.
«Поставлю агента и перестану заниматься этой задачей» - так не выходит. Один человек начинает тянуть столько, сколько раньше делала команда. У меня это работает так же по форме: черновики текстов, разбор входящих и сводки по метрикам собираются без меня, а всё, что уходит наружу к живым людям, я по-прежнему нажимаю руками.
Джейкоб О'Брайант в июле 2026 посчитал обратную сторону.
Раньше рабочая реализация означала, что задача готова на 80 процентов. Теперь скорее на 20.
Собрать первый вариант стало дёшево за счёт агента, а довести его до состояния, в котором им пользуются живые люди, стоит примерно столько же, сколько стоило раньше. Разрыв между «работает у меня» и «работает у клиента» никуда не делся. Человек его и закрывает.
С какой задачи начать, чтобы не бросить через месяц
Принцип я вывел из собственной могилы недоделанных приложений. Когда начинаешь, хочется навайбкодить всё подряд: сайт, бота, помощника, ещё один сайт. Через полгода смотришь - потрачена куча времени, сожжено много токенов, а работает из двадцати решений одно. Я этот этап тоже прошёл, у меня выстрелила меньшая часть, и это нормально. Работа считается сделанной только тогда, когда дальше она делается без меня.
- Повторяется. Разовую работу дешевле сделать руками. Смысл появляется там, где ты делаешь одно и то же каждую неделю.
- Стоит тебе больше часа. Если задача занимает десять минут, ты потратишь на настройку больше, чем сэкономишь за полгода.
- Результат можно проверить за минуту. Есть понятный ответ на вопрос «сделано хорошо или нет», и он виден без раскопок.
- Данные уже лежат у тебя. Выгрузка, папка, таблица, переписка. Задача, которая начинается со сбора данных из пяти мест, - плохой первый заход.
- Не трогает деньги и живых людей. Первую функцию ставь там, где худший исход - неудачный черновик.
Чаще всего все пять сходятся на одном и том же: еженедельная сводка, разбор входящих сообщений, черновики по шаблону, приведение данных в порядок.
Для интернет-магазина это обычно разбор отзывов и вопросов за неделю. Для консультанта - сводка по переписке с клиентами. Для клиники - расписание и повторные обращения. Данные у всех уже есть, проверка занимает минуту, худший исход - впустую потраченные минуты машинного времени.
Сколько ИИ-агент стоит в месяц и из чего складывается счёт?
- Подписка. Базовая плата за доступ к модели. Внутри неё лежит недельный лимит работы.
- Перерасход. Когда лимит подписки заканчивается, работа продолжается по счётчику. Здесь и появляются неприятные сюрпризы.
- Место работы. Если функция запускается по расписанию без тебя, ей нужен компьютер, который не выключается. Домашняя машина годится до первого отпуска.
- Хранение. Отчёты, черновики, выгрузки. Пока это папка - бесплатно, дальше по объёму.
Планы новичкам ломает вторая статья. Регулярная функция ест лимит каждый день одинаково, помнишь ты про неё или нет, и три запуска в день при большом объёме данных съедают недельную квоту за пару дней.
Anthropic периодически временно повышает недельные лимиты платных тарифов, но каждый раз с конечным сроком. Считать такую прибавку новой нормой не стоит: нагрузку посчитай по обычной квоте, а послабление держи запасом. Под регулярный запуск заодно сверься с условиями своего тарифа - у поставщиков они разные для ручной и автоматической работы.
Моё правило про мелочь простое. Ночной оркестратор, который гоняет проверки по кругу, токены ест будь здоров, и на мелкую задачку такое заряжать смысла нет. Если работа занимает у тебя десять минут в неделю, она и должна оставаться десятиминутной работой.
Куда уходят деньги, смотри с первого месяца. Механизм лимитов разобран в материале про то, сколько токенов даёт подписка, а история про ночной запуск, который сжёг бюджет за одну сессию, показывает верхнюю границу неприятностей.
Как проверить агента на своей задаче за неделю?
День 1. Опиши задачу словами, как объяснял бы человеку (около 40 минут)
Напиши в свободной форме: что на входе, что должно получиться, что считается плохим результатом, чего делать нельзя. Последний пункт пропускают чаще всего, а он потом и спасает.
День 2. Прогони вручную три раза на настоящих данных
Не на придуманном примере. Возьми три реальных случая из своей недели и посмотри, где агент промахнулся. Промахи запиши дословно.
День 3. Допиши инструкцию по промахам
Каждый промах превращается в строчку правила. Инструкция собирается из промахов первых прогонов. Представление о том, как должно быть, тут мешает.
День 4-5. Поставь на расписание и не вмешивайся
Пусть запускается сам и присылает результат. Ты только смотришь и отмечаешь, сколько раз пришлось переделать.
День 6. Посчитай
Сколько минут ушло у тебя за неделю на проверку и правки. Сравни с тем, сколько занимала задача руками. Разницу запиши числом.
День 7. Реши
Экономия меньше часа в неделю - задача выбрана неудачно, возьми другую. Больше двух часов - ставь вторую функцию.
Промпт, с которого удобно начинать первый день. Вставляешь и заполняешь под себя.
Ты помогаешь мне поставить регулярную задачу. Я опишу работу словами, ты вернёшь инструкцию, по которой её можно выполнять каждую неделю без меня.
Моя работа: [опиши задачу своими словами, как объяснял бы новому человеку]
Что лежит на входе: [файлы, папки, выгрузки, переписка]
Что должно получиться: [конкретный результат: файл, письмо, сводка]
Что считается плохим результатом: [опиши явно]
Чего делать нельзя ни при каких условиях: [удаления, отправка наружу, оплаты]
Сделай три вещи.
Задай мне уточняющие вопросы там, где моё описание допускает больше одного толкования. Не начинай, пока я не отвечу.
После ответов собери инструкцию: шаги по порядку, критерий «сделано», список запретов.
Отдельно перечисли места, где ты можешь ошибиться незаметно для меня, и предложи, как я проверю каждое за минуту.Где я сам ронял первую функцию
- Взять сразу большую задачу. «Пусть ведёт мне все продажи» разваливается на второй день. Возьми один кусок, который повторяется каждую неделю.
- Не описать, что считается плохим результатом. Агент оптимизирует то, что ты назвал целью. Если не сказал, чего нельзя, он этого и не узнает.
- Дать доступ шире нужного. Функции, которая читает выгрузку и пишет сводку, не нужен ключ от базы. Права режутся один раз и навсегда.
- Проверять чтением всего подряд. Так проверка съедает всю экономию. Бери выборку: три случая из двадцати и обязательно те, где агент сам отметил сомнение.
- Писать инструкцию из головы. Правила пиши после того, как увидишь живые ошибки.
- Не измерить результат. Без числа «сколько минут ушло» решение принимается по настроению, и через месяц ты уже не вспомнишь, стало легче или нет.
Пятую я вижу чаще остальных, и выглядит она невинно. Садишься и пишешь двадцать правил заранее, потому что так кажется основательнее. Потом половина правил мешает, половины нужных нет, и ты переписываешь всё после первого же прогона.
Кто отвечает, когда агент ошибся?
Звучит очевидно, а на практике про это забывают. Письмо, которое агент отправил клиенту, отправил ты. Цена, которую он поменял на сайте, - твоя цена. А за удалённые данные ты отвечаешь перед тем, чьи они.
Три вещи, которые я ставлю заранее.
- Журнал. Пусть каждая регулярная функция пишет, что сделала и с какими входными данными: без этого разбор превращается в гадание. Обычного текстового файла хватает.
- Граница необратимого. Удаление, отправка наружу, оплата - через твоё подтверждение, технически это одна настройка прав.
- Точка отката. Попроси агента сохранять состояние проекта перед каждой правкой, которая меняет данные. Это одна строчка в его инструкции, зато вернуть вчерашнюю версию получится за минуту.
Часть работы владелец оставляет себе потому, что её ценность как раз в живом человеке. Короткие видео я записываю сам, хотя технически их давно можно собирать автоматически. Разговор со сложным клиентом, публичное выступление, извинение за косяк - из той же корзины. Агент это сделает. Выйдет дешевле и хуже.
С чего начать завтра?
Начни с работы, где худший исход - неудачный черновик. Продажи и всё, что уходит клиентам, оставь на потом: там цена промаха измеряется не минутами, и первый же неудачный заход отобьёт желание продолжать.
Следующий вопрос - как сделать, чтобы агент раскладывал задачу по твоим категориям. Это уже про то, что лежит у него в проекте: твои правила, твоя структура знаний, твой способ разбирать работу. Про это - Второй мозг и делегирование через нескольких агентов.
Источники
- Anthropic, «Investigating three real-world incidents in our cybersecurity evaluations», 30 июля 2026
- Джейсон Клинтон, Anthropic: как в компании устроена безопасность разработки с ИИ, июль 2026
- Andon Labs, Vending-Bench 2: таблица результатов и расчёт человеческого эталона
- Anthropic, Project Vend, вторая фаза
- Bottleneck Labs, «Autonomously run businesses», июль 2026
- Декс Хорти, HumanLayer, «Why Software Factories Fail»
- «Beyond pass@1: A Reliability Science Framework for Long-Horizon LLM Agents», arXiv, 31 марта 2026
- Джейкоб О'Брайант, «2x, not 10x: coding with LLMs in 2026», 25 июля 2026
- Gartner: более 40% агентных проектов закроют к концу 2027 года, 25 июня 2025
- Anthropic, документация Claude Code: права доступа и песочница
Полная схема по вайб-кодингу за три вечера: ИИ-клон + Второй мозг + Контекст-инжиниринг.
Новые материалы - дайджестом, без спама
Гайды выходят регулярно. Подпишись, чтобы не пропускать: пришлю подборку в Telegram или на email. Раз в неделю или каждый день - выбираешь сам.

