Moonshot AI выпустила Kimi K3 — крупнейшую в мире открытую языковую модель с 2,8 триллиона параметров и контекстным окном до миллиона токенов. Релиз интересен не только рекордным размером: по собственным оценкам разработчиков, по общему уровню интеллекта K3 уступает лишь двум моделям в мире — Claude Fable 5 и GPT-5.6 Sol, обходя при этом Claude Opus 4.8.
Архитектурно K3 построена на Mixture of Experts: из 896 экспертов на каждый запрос активируется всего 16, что позволяет держать огромный размер без пропорционального роста стоимости инференса. Разработчики добавили собственные механизмы — гибридное внимание Kimi Delta Attention и Attention Residuals, которые помогают модели не терять контекст в длинных агентных цепочках. Модель мультимодальна на входе (понимает изображения), но не генерирует картинки — это чисто текстовый и кодовый инструмент.
В независимом рейтинге Artificial Analysis K3 набрала 57 баллов и заняла четвёртую строчку среди 189 моделей — серьёзный результат для команды, которая младше OpenAI на семь лет. На бенчмарке GDPval-AA v2, оценивающем задачи из 44 профессий, модель набрала 1687 баллов против 1600 у Claude Opus 4.8 Max, а на AA-Briefcase — заняла второе место в мире, обойдя даже GPT-5.6 Sol Max. Отдельно выделяется результат на BrowseComp (поиск труднодоступной информации в вебе) — 91,2 балла в одиночном агентном режиме, достигнутый просто за счёт миллионного контекстного окна без дополнительных ухищрений.
Разработчики уже показывают возможности модели на практике: за несколько часов работы K3 самостоятельно воссоздала практически полноценный клон macOS с интерфейсом Liquid Glass, работающий прямо в браузере — с Dock, Finder, Safari и другими приложениями. Это хорошая иллюстрация текущего уровня агентного кодинга у топовых моделей.
Полные веса модели Moonshot планирует опубликовать 27 июля, а сама K3 уже доступна в чат-боте Kimi, инструментах Kimi Code и Kimi Work. В API цена составляет 3 доллара за миллион входных токенов (0,3 доллара при попадании в кэш) и 15 долларов за миллион исходящих — заметно дешевле западных флагманов.
Прямой доступ к китайским чат-ботам и API из России обычно осложняется региональными ограничениями на оплату и нестабильностью привязки к иностранным сервисам. Поэтому на практике проще пользоваться российскими агрегаторами, где новые модели подключаются по мере релиза и оплата идёт в рублях.
Как и с любым свежим релизом, конкретная версия модели появляется у разных агрегаторов не одновременно — веса K3 выходят только 27 июля, поэтому часть сервисов подключит модель с задержкой. Перед регистрацией стоит уточнить актуальный список моделей на сайте конкретной платформы.
Для разовых тестов и экспериментов с длинным контекстом (документы, код, агентные сценарии) удобнее модель pay-as-you-go — она не привязывает пользователя к фиксированному тарифу и позволяет платить именно за использованные токены.
Для разработчиков ключевые параметры — стабильность API, прозрачная тарификация и поддержка кэширования запросов: у Kimi K3 кэш входных токенов снижает цену в 10 раз, и это стоит проверять на своих задачах, а не только на маркетинговых цифрах.
Для команд важна возможность работать с общим балансом и распределять доступ между сотрудниками без оформления подписки на каждого — это особенно актуально, когда модели вроде K3 меняются и обновляются быстрее, чем успевают устояться внутренние процессы компании.
Главный практический вывод из релиза Kimi K3: разные модели закрывают разные ниши — K3 выигрывает в цене и длинном контексте, а Anthropic и OpenAI остаются сильнее на самых сложных математических и кодовых задачах. Это весомый аргумент в пользу агрегаторов с широким набором моделей: рутинные задачи выгоднее решать через дешёвую K3, а для действительно сложной аналитики переключаться на Fable 5 или GPT-5.6 Sol в том же интерфейсе.