Главным аргументом в пользу лидерства американских лабораторий была простая логика: больше вычислительной мощности — больше возможностей. K3 бьёт по этой логике напрямую. Модель показывает результаты уровня фронтира, хотя создана в условиях куда более скромного доступа к топовым чипам, чем у OpenAI, Anthropic или Google.
Аналитики всё чаще говорят не про «мощность», а про «эффективный стек»: продуманную маршрутизацию MoE, агрессивную квантизацию, тщательную курацию данных для обучения и нестандартные инфраструктурные решения вроде Mooncake. Китайские лаборатории, столкнувшись с ограничениями на экспорт передовых чипов, начали сжимать кривую «возможности на единицу вычислений» — и получают непропорционально много отдачи от постобучения моделей и качества харнесов.
Это не значит, что вычислительная мощность перестала иметь значение. Но K3 показывает: разрыв в возможностях моделей можно сокращать нелинейно, делая ставку на архитектурные решения, а не только наращивая датацентры. Самый обсуждаемый элемент релиза — Kimi Delta Attention, механизм памяти, который хранит компактное состояние запроса вместо пересчёта полного внимания по всему контексту. Заявленный эффект — ускорение в 6 раз при работе с контекстом в миллион токенов, причём цена почти не растёт с увеличением длины текста, в отличие от конкурентов.
Если эти характеристики подтвердятся в широком использовании — это одна из самых значимых архитектурных идей года, а не просто маркетинговая цифра.
Во что узнать глубже:
- Квантизация нейросетей: как модели сжимают в разы без значимой потери качества
- Fast weights и механизмы памяти в трансформерах: альтернативы классическому вниманию (attention)
- Экспортные ограничения США на чипы для Китая: как они повлияли на развитие локальных AI-лабораторий
