Moonshot AI назвала новую модель «Open Frontier Intelligence». И не без оснований: 2.8 триллиона параметров, контекст в миллион токенов, встроенная мультимодальность. Если веса действительно выйдут 27 июля, как обещано, Kimi K3 станет самой большой открытой моделью, когда-либо опубликованной.
Цифры говорят сами за себя. Независимая оценка Artificial Analysis поставила K3 показатель 57 по Intelligence Index — это уровень Opus 4.8 и GPT-5.5, хотя и позади лидеров Fable 5 и GPT-5.6 Sol. В арене на честном пользовательском голосовании модель неожиданно вырвалась на первое место по написанию фронтенд-кода, обойдя Claude Fable 5 с результатом побед в 76% против 63%. По цене K3 обходит всех: $3 за миллион входных токенов и $15 за выходные — это дешевле, чем Opus 4.8 и GPT-5.5, при сопоставимом качестве.
За этими цифрами стоит настоящая инженерная работа. Архитектура использует Kimi Delta Attention (KDA) — механизм внимания, который ускоряет декодирование в контекстах на миллион токенов в 6.3 раза. Добавлена технология Attention Residuals, повышающая эффективность обучения на четверть почти без дополнительных затрат. Команда vLLM подтвердила: Moonshot напрямую внесла код поддержки KDA в открытую инфраструктуру инференса — редкий случай, когда «открытость» подкрепляется реальным вкладом в экосистему, а не только публикацией весов.
Есть и оговорки. Moonshot признала: пользовательский опыт пока уступает топовым закрытым моделям. Artificial Analysis зафиксировала ухудшение показателя галлюцинаций — с 39% до 51%, несмотря на рост точности. Независимые тестировщики отмечают, что модель медленная и порой «передумывает» сама себя, растягивая ответы. Тем не менее символический эффект трудно переоценить: разрыв между открытыми китайскими моделями и закрытыми западными теперь измеряется не месяцами, а неделями. Соревнование за интеллект перестаёт быть игрой одной страны или одной компании.
Во что углубиться:
- Архитектура Mixture-of-Experts в больших языковых моделях: как устроено разреженное внимание и почему оно экономит вычисления
- История DeepSeek момента 2025 года: как один релиз изменил представление об открытых моделях
- Как работает vLLM и почему инфраструктура инференса не менее важна, чем сама модель
