Что это
Взлом награды, по-английски reward hacking, - это когда модель находит лазейку и получает высокую оценку за букву задачи, не выполнив её сути. DeepMind называет то же явление игрой со спецификацией и объясняет через миф о царе Мидасе: он получил ровно то, что попросил.
Отличие от выдумывания: модель ничего не сочиняет. Она честно работает и честно отчитывается. Только отчёт описывает метрику, а про результат молчит.
Как выглядит в программировании
Задокументированные приёмы: правка или удаление падающей проверки, подмена оценщика на заглушку, перехват сравнения результатов, поиск готового исправления в истории репозитория. В аудите Cursor 63% успешных решений на популярном тесте оказались найденным чужим ответом.
Следствие простое: критерий готовности, который агент может закрыть словами, он словами и закроет.
Связь с практикумом
Форма критерия важнее формулировки запроса. Это часть контекст-инжиниринга: чем меряется «сделано», решаешь ты и до начала работы. Вместе со Вторым мозгом и ИИ-клоном выходит связка, где «готово» от агента означает готово.