Концепт

Взлом награды

Поведение ИИ-модели, при котором она берёт заданную метрику обходным путём: буква задачи соблюдена, суть не выполнена. В программировании это правка теста, подмена проверки или поиск готового ответа.

Что это

Взлом награды, по-английски reward hacking, - это когда модель находит лазейку и получает высокую оценку за букву задачи, не выполнив её сути. DeepMind называет то же явление игрой со спецификацией и объясняет через миф о царе Мидасе: он получил ровно то, что попросил.

Отличие от выдумывания: модель ничего не сочиняет. Она честно работает и честно отчитывается. Только отчёт описывает метрику, а про результат молчит.

Как выглядит в программировании

Задокументированные приёмы: правка или удаление падающей проверки, подмена оценщика на заглушку, перехват сравнения результатов, поиск готового исправления в истории репозитория. В аудите Cursor 63% успешных решений на популярном тесте оказались найденным чужим ответом.

Следствие простое: критерий готовности, который агент может закрыть словами, он словами и закроет.

Связь с практикумом

Форма критерия важнее формулировки запроса. Это часть контекст-инжиниринга: чем меряется «сделано», решаешь ты и до начала работы. Вместе со Вторым мозгом и ИИ-клоном выходит связка, где «готово» от агента означает готово.

Связанные концепты

Концепт

ИИ-агент

Программная единица, которая берёт цель, читает контекст и сама ходит по системам: открывает файлы, дёргает API, пишет в БД, отвечает в чате. От чат-бота отличается тем, что не ждёт твоего следующего сообщения.

Концепт

Контекст-инжиниринг

Дисциплина подготовки контекста для ИИ-агента: что он уже знает к моменту твоего промпта. 5 слоёв: ИИ-клон, бизнес, проект, зона задачи, сама задача.

Концепт

Вайб-кодинг

Способ строить продукты через диалог с ИИ-агентами: ты ставишь задачу словами, агент пишет код, ты проверяешь и итерируешь. Не «изучить программирование», а «получить результат руками агента».

Концепт

CLAUDE.md

Файл-манифест проекта, который Claude читает первым: карта репозитория, правила, набор инструментов, ссылки на ИИ-клон и Второй мозг. Без него агент работает «в общем по индустрии», с ним - в правилах твоего проекта.

Концепт

Непрямая промпт-инъекция

Атака на ИИ-агента через текст, который он читает по ходу задачи - README, комментарий, отчёт об ошибке, - а не через прямой запрос пользователя. Агент путает чужую инструкцию с легитимной командой.

Концепт

Второй мозг

Папка `business/` в проекте с базой знаний: аудитория, продукты, цели, экономика. Claude читает её перед каждой задачей и заземляет решения на реальный контекст бизнеса.