Kimi K3 в работе: отзыв и почему я вернулся на Claude Code

Опубликовано 30.07.202615 мин чтенияСредний
Дирижер цифрового оркестра меняет сбойный новый инструмент на знакомый жезл, восстанавливая гармонию потока.
Что узнаешь
  • Почему модель, которая выигрывает по замерам, проигрывает в рабочем дне
  • Куда уходят токены, если размышление у модели нельзя выключить
  • Какие возможности Claude Code отваливаются при работе через чужой вход
  • Как отличить поломку модели от поломки обвязки вокруг неё
  • Схема на два мотора, к которой я пришёл вместо полной замены
Применить за 25 мин
Сэкономит 4 ч
Средний
Что понадобится

Каждый день в Telegram-канале - что нового в вайб-кодинге: инструменты, находки, ошибки. Подпишись, чтобы быть в курсе.

Что вышло из эксперимента, который я сам и предложил

Kimi K3 вышла 16 июля 2026. У неё 2,8 трлн параметров, миллион токенов контекста, открытые веса и первое место в слепом сравнении на фронтенде. Всю фактуру про архитектуру, замеры и цены я собрал в полном разборе Kimi K3 против Claude Code и повторять её тут не буду.

В конце того разбора я написал так: риск - потерять день на настройку, выгода - счёт, который падает со второй недели. Эксперимент я поставил на своих задачах.

Первые часы действительно радуют. Модель бодро подхватывает задачу, генерирует внятный фронтенд, не мнётся на объёмных файлах. Отсюда и мой пост в канале про приятный шок. Проблемы вылезли на длинных сессиях, на нескольких агентах, на правках по кругу, на вечере за терминалом.

В итоге я откатился обратно. Дальше - что именно к этому привело, с цифрами и ссылками на первоисточники, чтобы можно было перепроверить за мной.

Почему Kimi K3 выглядит первой по бумагам?

Вот где Kimi K3 выигрывает у Claude Fable 5:

ЗамерKimi K3Claude Fable 5Разрыв
Terminal-Bench 2.188,384,6+3,7
SWE-Marathon42,035,0+7,0
BrowseComp91,288,0+3,2
Program Bench77,876,8+1,0

Замеры свели llm-stats, оппонент во всех строках - Claude Fable 5.

Цифры настоящие. На всех 35 замерах из той же сводки Claude Fable 5 забирает 22 победы, Kimi K3 - двенадцать, одна ничья.

Интереснее, где именно Kimi K3 проваливается. На кодовых замерах отставание скромное, 4-5 пунктов. Проседает она на знании и рассуждении: на HLE Claude уходит вперёд почти на 10 пунктов. Это ровно то место, в которое упирается длинная задача: там сначала надо понять, и только потом писать.

В основной части релизного поста Moonshot пишет про это так:

Хотя по общей результативности она всё ещё уступает самым сильным закрытым моделям, Claude Fable 5 и GPT 5.6 Sol, Kimi K3 показала передовой уровень на всём нашем наборе замеров.

- Moonshot AI, https://www.kimi.com/blog/kimi-k3

Почему Kimi K3 в работе ощущается вдвое медленнее?

ПоказательKimi K3Claude Opus 4.8
Скорость потока34,7 токена/с61,3 токена/с
Время до первого токена4,19 с9,50 с
Индекс интеллекта5756
Смешанная цена за млн$2,31$3,85

Замеры взяты из сравнения Artificial Analysis, оппонент - Claude Opus 4.8: это та версия Claude, на которой у них есть полный прогон по скорости.

Kimi K3 отвечает раньше, поэтому в коротком чате она субъективно кажется шустрее. В рабочем цикле время съедает скорость, с которой едет весь ответ целиком. Здесь она проигрывает почти вдвое, и на длинном ответе разрыв накапливается в минуты.

Kimi Code рекламирует 180-260 токенов в секунду, и цифра выглядит убедительно рядом с моими 34,7. Относится она к скоростной сборке прошлого поколения, K2.7 Code HighSpeed. У Kimi K3 такой сборки нет вовсе, и независимый замер идёт по ней самой.

Сессия, которая рвётся на седьмой ошибке и сжигает токены на повторных вызовах, - это провал контекст-инжиниринга, а выбор модели тут вторичен. На практикуме за 3 эфира собираешь все три: ИИ-клон + Второй мозг + Контекст-инжиниринг. Это 3 кита, без которых ИИ галлюцинирует.

Практикум по вайб-кодингу
+Твой второй мозг
3 вечера - инструменты, метод, первый проект
Старт 25–27 августа  ·  2 000 ₽
Записаться →

Куда уходят токены, если размышление нельзя выключить?

Уровень усилия у модели понижается: в документации заявлены низкий, высокий и максимальный. Выключить размышление нельзя вообще, там прямо сказано, что размышление и сохранение его истории у Kimi K3 включены всегда. Дефолт на прямом входе - максимальный, и большинство обвязок его не трогают.

Замер с пеликаном, на котором видно расход, опубликовал Саймон Уиллисон в день релиза.

Каждый ход добавляет тысячи исходящих токенов по $15 за миллион. Плюс Moonshot требует возвращать сообщение ассистента целиком, вместе с историей размышления, и исходящие токены следующим ходом возвращаются во входящие.

Ты платишь за один и тот же поток размышления дважды - сначала как за ответ, потом как за контекст.

На общем индексе Kimi K3 тратит на 21% меньше исходящих токенов, чем предыдущая K2.6. Относительно себя прежней модель стала экономнее, до расхода Claude в моём дне ей всё равно далеко.

Запрос «hi» тарифицируется как 86 токенов. Под капотом висит скрытый системный промпт примерно на 85 токенов, и он оплачивается в каждом обращении.

Про то, как считать свой расход и где смотреть остаток, у меня есть отдельный разбор - сколько токенов даёт Claude Pro и Max. Логика подсчёта там та же, меняются только цены.

Что происходит, когда модель залипает в размышлении?

Выглядит это так. Модель начинает думать, и вместо развития мысли текст сползает в повтор: одно и то же слово, потом обрывки слогов, потом бесконечная лента из одного огрызка. Задача стоит, счётчик токенов при этом крутится.

Обращение от 28 июля в списке известных ошибок Moonshot описывает, как Kimi K3 шесть раз подряд пытается прочитать один и тот же файл, семь раз получает отказ «холостой вызов, файл не менялся с прошлого чтения» и после этого завершает ход как ни в чём не бывало. В журнале ошибок Kimi CLI автор перечисляет четыре разновидности одного и того же залипания - чтение, замена, тесты, анализ - и подводит итог одной фразой:

Даже прочитав файл несколько раз, я продолжаю читать. Даже после успешной замены продолжаю выполнять. Эти мёртвые циклы сожгли кучу токенов.

- Разработчик, журнал ошибок Kimi CLI, https://github.com/MoonshotAI/kimi-cli/issues/2557

Причину Moonshot называет прямо. Модель обучена в режиме сохранённой истории размышления и болезненно реагирует на то, как обвязка воспроизводит её прошлые рассуждения. Если история приезжает неполной, модель пытается пересобрать ответ, выдаёт тот же самый вызов инструмента и уходит на второй круг.

Тот же диагноз ставит автор разбора в стороннем маршрутизаторе запросов: Kimi достаточно строга, чтобы отклонять запросы с неполной историей размышления. Чужая обвязка про эту строгость не знает и историю режет.

Почему многоагентная схема на Kimi K3 разваливается?

Начну с того, что написано в официальной документации Moonshot прямым текстом: этот вход пока не поддерживает WebFetch. То есть Claude Code, который штатно ходит в интернет за страницей, на Kimi K3 этого сделать не может. Обход - вставлять содержимое руками или подключать сторонний инструмент.

Claude Code умеет подгружать инструменты по требованию и кладёт в историю служебный блок с типом tool_reference. Kimi такой тип не принимает и отдаёт 400. Причём отдаёт молча, не называя ни поля, ни причины:

{"error":{"type":"invalid_request_error","message":"Invalid request Error"},"type":"error"}

Для сравнения, вот как та же поломка выглядит на родном входе Anthropic, где сервер хотя бы называет поле и перечисляет принимаемые типы:

messages.166.content.0.tool_result.content.0: Input tag 'tool_reference' found
using 'type' does not match any of the expected tags: 'document', 'image',
'search_result', 'text'

Разница здесь не косметическая. По первому сообщению разобраться невозможно: ни клиент, ни человек за ним не понимают, какой именно блок не понравился. Ровно на это и жалуются авторы обращений. Разработчики переключателей поставщиков уже предлагают отключать отложенную загрузку инструментов для Kimi по умолчанию либо помечать этот вход как не принимающий такие блоки.

Последствие описано в отдельном обращении, открытом 17 июля и до сих пор без ответа. Автор ловил такую ошибку семь раз за одну сессию. Первые шесть переживались, седьмая убила сессию окончательно: после неё падал даже ввод обычного текста «продолжай». Автор отдельно отмечает, что до предела контекста было далеко, так что версия «слишком длинная история» отпадает.

Соберу картину по типам блоков, которые вход Moonshot принимает и не принимает:

Что делает Claude CodeРаботает на Kimi K3
Обычный вызов инструментада
Поиск в интернетеда
Загрузка страницы через WebFetchнет, вход не поддерживает
Отложенная загрузка инструментовнет, ошибка 400 и риск потери сессии

Формулировка «совместимый вход» описывает форму запроса. Поведение за ней расходится по трём линиям: типы блоков, требования к истории, набор доступных инструментов.

Что не переезжает вместе с Kimi K3?

Раздел ограничений в релизном посте говорит про это дословно:

K3 обучалась в режиме сохранённой истории размышления. Если обвязка агента не возвращает всю историю размышления, как требуется, или если сессию, начатую на другой модели, переключают на K3, качество генерации может стать крайне нестабильным. Рекомендуем использовать обвязку с проверенной совместимостью, например Kimi Code, и избегать переключения на K3 в середине сессии.

- Moonshot AI, раздел ограничений, https://www.kimi.com/blog/kimi-k3

Разработчик модели говорит: берите наш клиент, у чужого поведение не гарантируем.

Второй пункт того же раздела объясняет ещё одну вещь, которую я списывал на своеволие модели:

Обучение K3 сделано с упором на долгие сложные задачи. Из-за этого, столкнувшись с мелкой неувязкой или неоднозначным намерением пользователя во время работы, она может принять неожиданное решение за пользователя.

- Moonshot AI, раздел ограничений, https://www.kimi.com/blog/kimi-k3

Мой CLAUDE.md написан под противоположную привычку: спросить, показать план, дождаться подтверждения. Инструкции никуда не делись, но читает их теперь модель с другим характером.

Если хочется держать один файл правил сразу под несколько агентов, я разбирал такую схему отдельно - один файл инструкций для Claude Code, Codex и Cursor.

Сколько Kimi K3 стоила на самом деле?

Сначала цены, они в пользу Kimi K3:

ПозицияKimi K3Claude Opus 5
Входящие за млн$3,00$5,00
Входящие при попадании в кэш$0,30$0,50
Исходящие за млн$15,00$25,00

Цены Kimi взяты из документации по кэшированию, оппонент в правой колонке - Claude Opus 5 на 30 июля 2026.

Кэш у Kimi автоматический, отключить его нельзя, и опознаётся он по хэшу начала запроса. Любая правка системного промпта или списка инструментов обнуляет кэш сообщений целиком.

Перечислю, что делает Claude Code в обычный рабочий день:

  1. Подключает и отключает внешние инструменты по ходу задачи.
  2. Подгружает инструменты по требованию, когда они понадобились.
  3. Запускает субагентов с другим набором инструментов.
  4. Дописывает файл инструкций в системный промпт.
  5. Пересобирает историю при сжатии контекста.

Каждый пункт из этого списка сбрасывает начало запроса, а значит - кэш. Вход возвращается с 30 центов на 3 доллара за миллион, то есть дорожает в десять раз. Наложи сверху постоянное размышление по 15 долларов за миллион исходящих, которые следующим ходом вернутся во входящих, и получишь механику, при которой дешёвая по цене модель выставляет неожиданный счёт.

По агрегату OpenCode почти 280 тысяч живых сессий средняя сессия на Kimi K3 стоит $1,86 при среднем объёме 3,1 млн токенов. Держится эта цифра на том, что 93% входящих токенов попадают в кэш, и стоит сломать начало запроса, как средняя перестаёт тебя описывать.

Тарифы Kimi идут по $19, $39, $99 и $199, квота считается из общего пула на всё членство, с недельным обновлением без переноса остатка и скользящим пятичасовым окном. В разборе тарифов это сформулировано так: четыре терминала вечно размышляющей Kimi K3 съедают пятичасовое окно быстро.

Тариф за $99 по квоте на код сопоставим с планом Anthropic за $200, и это против моей же позиции. Дешевизна Kimi сидит в цене за токен и до счёта за вечер не доезжает.

Где Kimi K3 объективно хороша?

  1. Фронтенд. Первое место в слепом сравнении живыми разработчиками. Верстает аккуратно и с приличным вкусом.
  2. Объём. Миллион токенов контекста и спокойное отношение к длинным файлам. Разобрать большой репозиторий и составить карту - её задача.
  3. Первая реакция. Время до первого токена вдвое короче, чем у Claude. В коротком диалоге это заметно и приятно.
  4. Цена за токен. Около 60% от цены Claude Opus 5. На объёмной механической работе с устойчивым началом запроса это даёт настоящую экономию.
  5. Открытые веса. Модель не заперта у одного поставщика.

Про последний пункт оговорка. Развернуть такую модель у себя дома нереально: даже в сжатом виде её вес измеряется терабайтами. Открытость тут даёт независимость от одного поставщика.

Как проверить всё это у себя за один вечер

  1. Настрой вход по инструкции. Три переменные окружения плюс подмена моделей по уровням - я расписал это в разборе Kimi K3 против Claude Code. Проверь связку командой /status: в меню выбора модели Kimi не появится, там встроенный список псевдонимов, и трогать его не нужно.
  2. Убери старый ключ. Если раньше стоял ANTHROPIC_API_KEY, удали его. Вместе с ANTHROPIC_AUTH_TOKEN они конфликтуют, и ты получишь ошибку авторизации на ровном месте.
  3. Отключи отложенную загрузку инструментов сразу. Не после первой смерти сессии, а до первого запуска.
  4. Не переключай модель посреди работы. Начал на Kimi K3 - доводи на Kimi K3. Обратное так же верно. Это прямое требование Moonshot, дословную цитату я привёл выше.
  5. Возьми свою настоящую задачу. Ту, которой занимался вчера, со всей её грязью и незакрытыми хвостами. На игре про змейку разница не проявится: она вылезает только на длинной дистанции.
  6. Запиши два числа. Сколько минут заняло и сколько денег ушло за вечер. Сравни с обычным вечером на Claude.
  7. Отдельно засеки моменты простоя. Когда агент висит, читает один файл по кругу или отвечает ошибкой - это тоже часть цены.

Если счёт за вечер вышел выше ожидаемого, дело почти всегда в кэше: считай, сколько раз за вечер сбрасывалось начало запроса. Цена за токен тут почти ни при чём.

Что я оставил себе в итоге

К этой же схеме независимо пришли читатели канала, которые тестировали модель вместе со мной: Kimi K3 отправляют смотреть репозиторий и давать второе мнение, а основную работу оставляют привычному агенту. Схема живучая, потому что не требует переносить обвязку и не ломает то, что уже работает.

Формулировать её можно так: одна задача целиком - Kimi K3, длинная цепочка с инструментами и субагентами - Claude Code. Чем больше в задаче переключений между инструментами, тем дороже она обходится на Kimi K3 и тем выше шанс поймать оборванную сессию.

Про то, как разводить двух агентов по ролям и не путаться в них, у меня есть отдельный разбор - три схемы совместной работы двух агентов.

Замеры отвечают на вопрос «кто сильнее в лабораторных условиях». Твой счёт за вечер и твой список сделанного отвечают на вопрос «кто сильнее у тебя». Когда эти два ответа расходятся, доверять надо второму - его считал ты, а не отдел маркетинга.

Источники

Полная схема по вайб-кодингу за вечер: ИИ-клон + Второй мозг + Контекст-инжиниринг. 3 эфира, записи остаются у тебя.

Практикум по вайб-кодингу
+Твой второй мозг
3 вечера - инструменты, метод, первый проект
Старт 25–27 августа  ·  2 000 ₽
Записаться →

Новые материалы - дайджестом, без спама

Гайды выходят регулярно. Подпишись, чтобы не пропускать: пришлю подборку в Telegram или на email. Раз в неделю или каждый день - выбираешь сам.

Была инструкция полезна?
Артемий Миллер
Автор
Артемий Миллер
Предприниматель и вайб-кодер

Артемий Миллер - предприниматель и вайб-кодер. Бывший программист, собирает продукты исключительно вместе с ИИ-агентами, без найма разработчиков.

Связанные инструкции