Каждый день в Telegram-канале - что нового в вайб-кодинге: инструменты, находки, ошибки. Подпишись, чтобы быть в курсе.
Что вышло из эксперимента, который я сам и предложил
Kimi K3 вышла 16 июля 2026. У неё 2,8 трлн параметров, миллион токенов контекста, открытые веса и первое место в слепом сравнении на фронтенде. Всю фактуру про архитектуру, замеры и цены я собрал в полном разборе Kimi K3 против Claude Code и повторять её тут не буду.
В конце того разбора я написал так: риск - потерять день на настройку, выгода - счёт, который падает со второй недели. Эксперимент я поставил на своих задачах.
Первые часы действительно радуют. Модель бодро подхватывает задачу, генерирует внятный фронтенд, не мнётся на объёмных файлах. Отсюда и мой пост в канале про приятный шок. Проблемы вылезли на длинных сессиях, на нескольких агентах, на правках по кругу, на вечере за терминалом.
В итоге я откатился обратно. Дальше - что именно к этому привело, с цифрами и ссылками на первоисточники, чтобы можно было перепроверить за мной.
Почему Kimi K3 выглядит первой по бумагам?
Вот где Kimi K3 выигрывает у Claude Fable 5:
| Замер | Kimi K3 | Claude Fable 5 | Разрыв |
|---|---|---|---|
| Terminal-Bench 2.1 | 88,3 | 84,6 | +3,7 |
| SWE-Marathon | 42,0 | 35,0 | +7,0 |
| BrowseComp | 91,2 | 88,0 | +3,2 |
| Program Bench | 77,8 | 76,8 | +1,0 |
Замеры свели llm-stats, оппонент во всех строках - Claude Fable 5.
Цифры настоящие. На всех 35 замерах из той же сводки Claude Fable 5 забирает 22 победы, Kimi K3 - двенадцать, одна ничья.
Интереснее, где именно Kimi K3 проваливается. На кодовых замерах отставание скромное, 4-5 пунктов. Проседает она на знании и рассуждении: на HLE Claude уходит вперёд почти на 10 пунктов. Это ровно то место, в которое упирается длинная задача: там сначала надо понять, и только потом писать.
В основной части релизного поста Moonshot пишет про это так:
Хотя по общей результативности она всё ещё уступает самым сильным закрытым моделям, Claude Fable 5 и GPT 5.6 Sol, Kimi K3 показала передовой уровень на всём нашем наборе замеров.
Почему Kimi K3 в работе ощущается вдвое медленнее?
| Показатель | Kimi K3 | Claude Opus 4.8 |
|---|---|---|
| Скорость потока | 34,7 токена/с | 61,3 токена/с |
| Время до первого токена | 4,19 с | 9,50 с |
| Индекс интеллекта | 57 | 56 |
| Смешанная цена за млн | $2,31 | $3,85 |
Замеры взяты из сравнения Artificial Analysis, оппонент - Claude Opus 4.8: это та версия Claude, на которой у них есть полный прогон по скорости.
Kimi K3 отвечает раньше, поэтому в коротком чате она субъективно кажется шустрее. В рабочем цикле время съедает скорость, с которой едет весь ответ целиком. Здесь она проигрывает почти вдвое, и на длинном ответе разрыв накапливается в минуты.
Kimi Code рекламирует 180-260 токенов в секунду, и цифра выглядит убедительно рядом с моими 34,7. Относится она к скоростной сборке прошлого поколения, K2.7 Code HighSpeed. У Kimi K3 такой сборки нет вовсе, и независимый замер идёт по ней самой.
Сессия, которая рвётся на седьмой ошибке и сжигает токены на повторных вызовах, - это провал контекст-инжиниринга, а выбор модели тут вторичен. На практикуме за 3 эфира собираешь все три: ИИ-клон + Второй мозг + Контекст-инжиниринг. Это 3 кита, без которых ИИ галлюцинирует.
Куда уходят токены, если размышление нельзя выключить?
Уровень усилия у модели понижается: в документации заявлены низкий, высокий и максимальный. Выключить размышление нельзя вообще, там прямо сказано, что размышление и сохранение его истории у Kimi K3 включены всегда. Дефолт на прямом входе - максимальный, и большинство обвязок его не трогают.
Замер с пеликаном, на котором видно расход, опубликовал Саймон Уиллисон в день релиза.
Каждый ход добавляет тысячи исходящих токенов по $15 за миллион. Плюс Moonshot требует возвращать сообщение ассистента целиком, вместе с историей размышления, и исходящие токены следующим ходом возвращаются во входящие.
Ты платишь за один и тот же поток размышления дважды - сначала как за ответ, потом как за контекст.
На общем индексе Kimi K3 тратит на 21% меньше исходящих токенов, чем предыдущая K2.6. Относительно себя прежней модель стала экономнее, до расхода Claude в моём дне ей всё равно далеко.
Запрос «hi» тарифицируется как 86 токенов. Под капотом висит скрытый системный промпт примерно на 85 токенов, и он оплачивается в каждом обращении.
Про то, как считать свой расход и где смотреть остаток, у меня есть отдельный разбор - сколько токенов даёт Claude Pro и Max. Логика подсчёта там та же, меняются только цены.
Что происходит, когда модель залипает в размышлении?
Выглядит это так. Модель начинает думать, и вместо развития мысли текст сползает в повтор: одно и то же слово, потом обрывки слогов, потом бесконечная лента из одного огрызка. Задача стоит, счётчик токенов при этом крутится.
Обращение от 28 июля в списке известных ошибок Moonshot описывает, как Kimi K3 шесть раз подряд пытается прочитать один и тот же файл, семь раз получает отказ «холостой вызов, файл не менялся с прошлого чтения» и после этого завершает ход как ни в чём не бывало. В журнале ошибок Kimi CLI автор перечисляет четыре разновидности одного и того же залипания - чтение, замена, тесты, анализ - и подводит итог одной фразой:
Даже прочитав файл несколько раз, я продолжаю читать. Даже после успешной замены продолжаю выполнять. Эти мёртвые циклы сожгли кучу токенов.
Причину Moonshot называет прямо. Модель обучена в режиме сохранённой истории размышления и болезненно реагирует на то, как обвязка воспроизводит её прошлые рассуждения. Если история приезжает неполной, модель пытается пересобрать ответ, выдаёт тот же самый вызов инструмента и уходит на второй круг.
Тот же диагноз ставит автор разбора в стороннем маршрутизаторе запросов: Kimi достаточно строга, чтобы отклонять запросы с неполной историей размышления. Чужая обвязка про эту строгость не знает и историю режет.
Почему многоагентная схема на Kimi K3 разваливается?
Начну с того, что написано в официальной документации Moonshot прямым текстом: этот вход пока не поддерживает WebFetch. То есть Claude Code, который штатно ходит в интернет за страницей, на Kimi K3 этого сделать не может. Обход - вставлять содержимое руками или подключать сторонний инструмент.
Claude Code умеет подгружать инструменты по требованию и кладёт в историю служебный блок с типом tool_reference. Kimi такой тип не принимает и отдаёт 400. Причём отдаёт молча, не называя ни поля, ни причины:
{"error":{"type":"invalid_request_error","message":"Invalid request Error"},"type":"error"}Для сравнения, вот как та же поломка выглядит на родном входе Anthropic, где сервер хотя бы называет поле и перечисляет принимаемые типы:
messages.166.content.0.tool_result.content.0: Input tag 'tool_reference' found
using 'type' does not match any of the expected tags: 'document', 'image',
'search_result', 'text'Разница здесь не косметическая. По первому сообщению разобраться невозможно: ни клиент, ни человек за ним не понимают, какой именно блок не понравился. Ровно на это и жалуются авторы обращений. Разработчики переключателей поставщиков уже предлагают отключать отложенную загрузку инструментов для Kimi по умолчанию либо помечать этот вход как не принимающий такие блоки.
Последствие описано в отдельном обращении, открытом 17 июля и до сих пор без ответа. Автор ловил такую ошибку семь раз за одну сессию. Первые шесть переживались, седьмая убила сессию окончательно: после неё падал даже ввод обычного текста «продолжай». Автор отдельно отмечает, что до предела контекста было далеко, так что версия «слишком длинная история» отпадает.
Соберу картину по типам блоков, которые вход Moonshot принимает и не принимает:
| Что делает Claude Code | Работает на Kimi K3 |
|---|---|
| Обычный вызов инструмента | да |
| Поиск в интернете | да |
| Загрузка страницы через WebFetch | нет, вход не поддерживает |
| Отложенная загрузка инструментов | нет, ошибка 400 и риск потери сессии |
Формулировка «совместимый вход» описывает форму запроса. Поведение за ней расходится по трём линиям: типы блоков, требования к истории, набор доступных инструментов.
Что не переезжает вместе с Kimi K3?
Раздел ограничений в релизном посте говорит про это дословно:
K3 обучалась в режиме сохранённой истории размышления. Если обвязка агента не возвращает всю историю размышления, как требуется, или если сессию, начатую на другой модели, переключают на K3, качество генерации может стать крайне нестабильным. Рекомендуем использовать обвязку с проверенной совместимостью, например Kimi Code, и избегать переключения на K3 в середине сессии.
Разработчик модели говорит: берите наш клиент, у чужого поведение не гарантируем.
Второй пункт того же раздела объясняет ещё одну вещь, которую я списывал на своеволие модели:
Обучение K3 сделано с упором на долгие сложные задачи. Из-за этого, столкнувшись с мелкой неувязкой или неоднозначным намерением пользователя во время работы, она может принять неожиданное решение за пользователя.
Мой CLAUDE.md написан под противоположную привычку: спросить, показать план, дождаться подтверждения. Инструкции никуда не делись, но читает их теперь модель с другим характером.
Если хочется держать один файл правил сразу под несколько агентов, я разбирал такую схему отдельно - один файл инструкций для Claude Code, Codex и Cursor.
Сколько Kimi K3 стоила на самом деле?
Сначала цены, они в пользу Kimi K3:
| Позиция | Kimi K3 | Claude Opus 5 |
|---|---|---|
| Входящие за млн | $3,00 | $5,00 |
| Входящие при попадании в кэш | $0,30 | $0,50 |
| Исходящие за млн | $15,00 | $25,00 |
Цены Kimi взяты из документации по кэшированию, оппонент в правой колонке - Claude Opus 5 на 30 июля 2026.
Кэш у Kimi автоматический, отключить его нельзя, и опознаётся он по хэшу начала запроса. Любая правка системного промпта или списка инструментов обнуляет кэш сообщений целиком.
Перечислю, что делает Claude Code в обычный рабочий день:
- Подключает и отключает внешние инструменты по ходу задачи.
- Подгружает инструменты по требованию, когда они понадобились.
- Запускает субагентов с другим набором инструментов.
- Дописывает файл инструкций в системный промпт.
- Пересобирает историю при сжатии контекста.
Каждый пункт из этого списка сбрасывает начало запроса, а значит - кэш. Вход возвращается с 30 центов на 3 доллара за миллион, то есть дорожает в десять раз. Наложи сверху постоянное размышление по 15 долларов за миллион исходящих, которые следующим ходом вернутся во входящих, и получишь механику, при которой дешёвая по цене модель выставляет неожиданный счёт.
По агрегату OpenCode почти 280 тысяч живых сессий средняя сессия на Kimi K3 стоит $1,86 при среднем объёме 3,1 млн токенов. Держится эта цифра на том, что 93% входящих токенов попадают в кэш, и стоит сломать начало запроса, как средняя перестаёт тебя описывать.
Тарифы Kimi идут по $19, $39, $99 и $199, квота считается из общего пула на всё членство, с недельным обновлением без переноса остатка и скользящим пятичасовым окном. В разборе тарифов это сформулировано так: четыре терминала вечно размышляющей Kimi K3 съедают пятичасовое окно быстро.
Тариф за $99 по квоте на код сопоставим с планом Anthropic за $200, и это против моей же позиции. Дешевизна Kimi сидит в цене за токен и до счёта за вечер не доезжает.
Где Kimi K3 объективно хороша?
- Фронтенд. Первое место в слепом сравнении живыми разработчиками. Верстает аккуратно и с приличным вкусом.
- Объём. Миллион токенов контекста и спокойное отношение к длинным файлам. Разобрать большой репозиторий и составить карту - её задача.
- Первая реакция. Время до первого токена вдвое короче, чем у Claude. В коротком диалоге это заметно и приятно.
- Цена за токен. Около 60% от цены Claude Opus 5. На объёмной механической работе с устойчивым началом запроса это даёт настоящую экономию.
- Открытые веса. Модель не заперта у одного поставщика.
Про последний пункт оговорка. Развернуть такую модель у себя дома нереально: даже в сжатом виде её вес измеряется терабайтами. Открытость тут даёт независимость от одного поставщика.
Как проверить всё это у себя за один вечер
- Настрой вход по инструкции. Три переменные окружения плюс подмена моделей по уровням - я расписал это в разборе Kimi K3 против Claude Code. Проверь связку командой
/status: в меню выбора модели Kimi не появится, там встроенный список псевдонимов, и трогать его не нужно. - Убери старый ключ. Если раньше стоял
ANTHROPIC_API_KEY, удали его. Вместе сANTHROPIC_AUTH_TOKENони конфликтуют, и ты получишь ошибку авторизации на ровном месте. - Отключи отложенную загрузку инструментов сразу. Не после первой смерти сессии, а до первого запуска.
- Не переключай модель посреди работы. Начал на Kimi K3 - доводи на Kimi K3. Обратное так же верно. Это прямое требование Moonshot, дословную цитату я привёл выше.
- Возьми свою настоящую задачу. Ту, которой занимался вчера, со всей её грязью и незакрытыми хвостами. На игре про змейку разница не проявится: она вылезает только на длинной дистанции.
- Запиши два числа. Сколько минут заняло и сколько денег ушло за вечер. Сравни с обычным вечером на Claude.
- Отдельно засеки моменты простоя. Когда агент висит, читает один файл по кругу или отвечает ошибкой - это тоже часть цены.
Если счёт за вечер вышел выше ожидаемого, дело почти всегда в кэше: считай, сколько раз за вечер сбрасывалось начало запроса. Цена за токен тут почти ни при чём.
Что я оставил себе в итоге
К этой же схеме независимо пришли читатели канала, которые тестировали модель вместе со мной: Kimi K3 отправляют смотреть репозиторий и давать второе мнение, а основную работу оставляют привычному агенту. Схема живучая, потому что не требует переносить обвязку и не ломает то, что уже работает.
Формулировать её можно так: одна задача целиком - Kimi K3, длинная цепочка с инструментами и субагентами - Claude Code. Чем больше в задаче переключений между инструментами, тем дороже она обходится на Kimi K3 и тем выше шанс поймать оборванную сессию.
Про то, как разводить двух агентов по ролям и не путаться в них, у меня есть отдельный разбор - три схемы совместной работы двух агентов.
Замеры отвечают на вопрос «кто сильнее в лабораторных условиях». Твой счёт за вечер и твой список сделанного отвечают на вопрос «кто сильнее у тебя». Когда эти два ответа расходятся, доверять надо второму - его считал ты, а не отдел маркетинга.
Источники
- Kimi K3, официальный релизный пост и раздел ограничений - Moonshot AI
- Документация Kimi по работе через Claude Code - переменные окружения, отсутствие WebFetch
- Документация Kimi по кэшированию контекста - механика и цены кэша
- Сравнение Kimi K3 и Claude Opus 4.8 - Artificial Analysis, независимые замеры скорости и цены
- Разбор Kimi K3 в день релиза - Саймон Уиллисон, замер расхода токенов
- Статистика живых агентных сессий на K3 - OpenCode
- Обращение о повторяющихся вызовах инструментов на K3 - Moonshot AI
- Обращение о мёртвых циклах в Kimi CLI - Moonshot AI
- Обращение о смерти сессии после ошибки 400 - Moonshot AI
- Ошибка 400 на блоке tool_reference на родном входе Anthropic - Claude Code
- Отложенная загрузка инструментов ломает работу через Kimi - переключатель поставщиков
- Строгость Kimi к истории размышления - сторонний маршрутизатор запросов
- Сведённая таблица замеров K3 против Fable 5 - llm-stats
- Тарифы и квоты Kimi Code - разбор планов подписки
Полная схема по вайб-кодингу за вечер: ИИ-клон + Второй мозг + Контекст-инжиниринг. 3 эфира, записи остаются у тебя.
Новые материалы - дайджестом, без спама
Гайды выходят регулярно. Подпишись, чтобы не пропускать: пришлю подборку в Telegram или на email. Раз в неделю или каждый день - выбираешь сам.

