LIVE
Модель OpenAI сама взломала HuggingFace — и это изменило риторику всей индустрии Боты обогнали людей в интернете — и на этом можно заработать 200 миллионов Рынок кибербезопасности скупает компании, которые следят за ИИ-агентами Альтман впервые признал: скорость разработки ИИ пора сбавить Стартап обвинил крупную компанию в краже продукта после девяти месяцев «сотрудничества» Модель OpenAI сама взломала HuggingFace — и это изменило риторику всей индустрии Боты обогнали людей в интернете — и на этом можно заработать 200 миллионов Рынок кибербезопасности скупает компании, которые следят за ИИ-агентами Альтман впервые признал: скорость разработки ИИ пора сбавить Стартап обвинил крупную компанию в краже продукта после девяти месяцев «сотрудничества»
Новости ИИ

Спор об эффективности: важнее ли архитектура, чем количество чипов

автор: shmelev дата: 18 июля 2026 чтение: 2 мин

Главным аргументом в пользу лидерства американских лабораторий была простая логика: больше вычислительной мощности — больше возможностей. K3 бьёт по этой логике напрямую. Модель показывает результаты уровня фронтира, хотя создана в условиях куда более скромного доступа к топовым чипам, чем у OpenAI, Anthropic или Google.

Аналитики всё чаще говорят не про «мощность», а про «эффективный стек»: продуманную маршрутизацию MoE, агрессивную квантизацию, тщательную курацию данных для обучения и нестандартные инфраструктурные решения вроде Mooncake. Китайские лаборатории, столкнувшись с ограничениями на экспорт передовых чипов, начали сжимать кривую «возможности на единицу вычислений» — и получают непропорционально много отдачи от постобучения моделей и качества харнесов.

Это не значит, что вычислительная мощность перестала иметь значение. Но K3 показывает: разрыв в возможностях моделей можно сокращать нелинейно, делая ставку на архитектурные решения, а не только наращивая датацентры. Самый обсуждаемый элемент релиза — Kimi Delta Attention, механизм памяти, который хранит компактное состояние запроса вместо пересчёта полного внимания по всему контексту. Заявленный эффект — ускорение в 6 раз при работе с контекстом в миллион токенов, причём цена почти не растёт с увеличением длины текста, в отличие от конкурентов.

Если эти характеристики подтвердятся в широком использовании — это одна из самых значимых архитектурных идей года, а не просто маркетинговая цифра.

Во что узнать глубже:

  • Квантизация нейросетей: как модели сжимают в разы без значимой потери качества
  • Fast weights и механизмы памяти в трансформерах: альтернативы классическому вниманию (attention)
  • Экспортные ограничения США на чипы для Китая: как они повлияли на развитие локальных AI-лабораторий

Реклама
ЛИДЕРБОРД · 728 × 90зона «Реклама: между секциями»