Термин

Бенчмарк

Общий набор задач, на котором сравнивают ИИ-модели и агентов. Процент в таблице показывает, сколько чужих задач модель решила в чужих условиях. Как она справится с твоим проектом, он почти не говорит.

Что это

Бенчмарк - общий набор задач с заранее известными ответами. Все модели решают одни и те же задачи, проверяет их программа, итог сводят в таблицу, и такой таблицей открывается анонс любой новой модели.

Как читать процент

Смотри на условия. Процент говорит, сколько задач из чужого набора модель решила в чужих условиях, и та же модель в другой оболочке-агенте или на другом уровне усилий получает другую строку. Старые наборы годами лежат в открытом доступе и попадают в данные для тренировки моделей. Тогда высокий балл - просто хорошая память. Цифры, которые разработчик модели намерил сам, я читаю с поправкой «хвалятся, что», а два процента разницы между соседями считаю шумом.

Свой бенчмарк

У меня своя цифра. По таблицам новая модель бывает впереди на процент, а в работе разницы не замечаешь, поэтому я слежу за долей черновиков ИИ в поддержке, которые принял оператор. Вышла новая модель - гоняю её на своих задачах и смотрю, сдвинулась ли доля. Попроси агента собрать такой же замер под твой проект: десяток типичных задач и понятный признак, что задача решена.

Связанные концепты

Термин

Взлом награды

Поведение ИИ-модели, при котором она берёт заданную метрику обходным путём: буква задачи соблюдена, суть не выполнена. В программировании это правка теста, подмена проверки или поиск готового ответа.

Термин

IDE

Программа, в которой открывают проект целиком: слева дерево файлов, в центре код, внизу терминал. VS Code и Cursor - самые известные IDE. Вайб-кодеру она нужна, чтобы видеть, что агент поменял в проекте.

Термин

Галлюцинации

Ответ ИИ, который звучит уверенно и выглядит правдой, но выдуман: функция, которой нет в библиотеке, дата, цена, цитата или ссылка. Модель дописывает самое правдоподобное, даже когда данных у неё нет.

Термин

Токен

Кусочек текста, которым ИИ-модель читает и пишет: часть слова, короткое слово или знак препинания. В токенах считают цену запроса, лимиты подписки и то, сколько модель держит в голове.

Гайды, упоминающие этот концепт

Codex vs Claude Code 2026: как выбрать инструмент

Сравнение двух главных инструментов вайб-кодинга в 2026. Цены, лимиты, режимы reasoning, доступность из России и матрица «кому что подходит».

26 мин

Как загружать PDF в Claude Code без потери токенов: 3 способа в 2026

Каждая страница PDF в Claude Code стоит 1500-3000 токенов ещё до первого вопроса. Внутри: три способа конверсии в Markdown (MarkItDown, PyMuPDF4LLM, MCP-сервер), готовый скрипт для папки документов и точные лимиты Anthropic API в 2026.

17 мин

Cursor vs Claude Code в 2026: что выбрать вайб-кодеру

Cursor 3 и Claude Code Opus 4.7 - два главных конкурирующих инструмента вайб-кодинга. Разбираю где какой выигрывает, сколько токенов жрёт каждый и как платить из России.

19 мин

Рейтинг ИИ-агентов для программирования в 2026: кто реально решает задачи

Все спорят, какой ИИ-агент для кода лучше, и тыкают друг в друга процентами с бенчмарков. Разбираю, что эти проценты значат на самом деле, почему рейтинг строится по связке «агент плюс модель», а бренд тут вторичен, и как за пять минут прочитать любой замер и выбрать инструмент под свою задачу.

19 мин

DeepSeek vs Claude Code в 2026: счёт за ИИ-кодинг ниже в 5 раз

Reasonix - DeepSeek-агент с 99% cache hit. Разбираю экономику $12 vs $61, как оплатить из РФ, и какие задачи отдать Claude.

22 мин

Чем кодить в 2026: 8 ИИ-инструментов от Claude Code до Antigravity

Полный обзор 8 ИИ-инструментов программирования 2026: чем отличаются Claude Code, Cursor, Codex, Antigravity и другие, какой выбрать под свой проект.

24 мин

Как отслеживать расход токенов в Claude Code в 2026: 5 инструментов

5 бесплатных трекеров расхода токенов в Claude Code, что встроено в /usage и /cost, и 7 дисциплин рабочего ритуала от практика, который однажды сжёг свою Max-подписку за день.

16 мин

Что такое AGENTS.md и как написать свой за 30 минут в 2026

AGENTS.md - открытый формат файла-инструкции для ИИ-агентов, который придумал OpenAI в августе 2025. К декабрю того же года он попал в Linux Foundation вместе с MCP и goose, и сейчас его читают 60 000+ репозиториев и 15+ инструментов: Codex, Cursor, GitHub Copilot, Junie, Gemini CLI, Aider. С сентября 2026 его читает и Claude Code, если в проекте нет CLAUDE.md. Покажу, как держать оба файла в одном репо.

13 мин

Kimi K3 против Claude Code: обошла на фронтенде, стоит ли переходить

Kimi K3 - крупнейшая открытая модель, №1 на фронтенде и в разы дешевле Claude. Разбираю, где она сильнее, как подключить к Claude Code и оплатить из России.

18 мин

Sonnet или Opus 4.7 в Claude Code: выбор модели и /effort в 2026

Когда брать Sonnet, когда Opus 4.7 в Claude Code. Карта выбора модели + команды /effort и /fast - пошагово, с реальными сценариями.

22 мин