LIVE
AstroForge доверит нейросети управление космическим кораблём без связи с Землёй Anthropic выпустила Opus 5.5 — и одновременно притормозила саму себя Человек, построивший Apple Store, не верит в AI-шопинг Muse от Meta растёт быстрее, чем рос ChatGPT на старте OpenAI решила больше 100 открытых математических задач — и математики в тревоге AstroForge доверит нейросети управление космическим кораблём без связи с Землёй Anthropic выпустила Opus 5.5 — и одновременно притормозила саму себя Человек, построивший Apple Store, не верит в AI-шопинг Muse от Meta растёт быстрее, чем рос ChatGPT на старте OpenAI решила больше 100 открытых математических задач — и математики в тревоге
Новости ИИ

Четыре стартапа готовят замену трансформерам — архитектуре, на которой держится весь современный AI

автор: shmelev дата: 10 августа 2026 чтение: 3 мин

В 2017 году исследователи Google опубликовали статью «Attention Is All You Need» и представили трансформер — архитектуру нейросети, ставшую фундаментом для всех крупных языковых моделей. Девять лет спустя трансформер начинает трещать по швам. Его сила — механизм плотного внимания (dense attention), сравнивающий каждое слово текста с каждым другим, — превратилась в слабость: документ на 10 000 слов требует около 50 миллионов операций умножения. Отсюда счета на электричество: OpenAI планирует потратить на вычисления 50 миллиардов долларов в этом году, а Международное энергетическое агентство прогнозирует удвоение потребления электричества дата-центрами к 2030-му.

Четыре стартапа предлагают четыре разных выхода.

Subquadratic (Майами) переизобретает внимание — их модель SubQ использует sparse attention, просчитывая связи не между всеми словами, а только между значимыми, и, по заявлению компании, впервые не уступает по качеству традиционным моделям в задачах поиска и написания кода. Индустрия относится к заявлению скептически, но очередь из желающих протестировать модель уже сформирована.

Manifest AI (Сан-Франциско) идет дальше — вообще выкидывает механизм внимания, заменяя его «power retention»: модель хранит не весь контекст, а его постоянно обновляемое сжатое резюме, отбрасывая неактуальное по ходу работы. Компания уже переделала открытую модель StarCoder в PowerCoder на этом принципе и утверждает, что новая модель Brumby конкурирует с версиями Qwen от Alibaba.

Liquid AI (выходцы из MIT) смешивает трансформеры с «жидкими нейросетями», вдохновленными устройством мозга червя. В их последних моделях трансформеров всего 20%, остальное — жидкие сети. Результат — модели, способные работать на Raspberry Pi за 50 долларов, уже скачанные почти 34 миллиона раз, и по качеству сопоставимые с моделями в четыре раза крупнее.

Inception (Пало-Альто) взяла технологию генерации изображений — диффузию — и применила ее к тексту: вместо последовательной генерации слово за словом модель сразу превращает случайный набор токенов в связный блок текста. Их модель Mercury 2 работает, по заявлению компании, на уровне GPT-4, но в десять раз быстрее.

Pathway (тоже Пало-Альто) пошла дальше всех — их Dragon Hatchling заменяет внимание математической структурой state space, которая не привязана к последовательности слов. Результат нагляден: модель решает 97% из 250 000 сложных судоку, тогда как ведущие LLM конкурентов не решают ни одной. Логика создателей проста — не всякое рассуждение укладывается в слова, а значит, модель, скованная языком, ограничена в принципе.

Ни один из четырех подходов пока не доказал, что способен полностью заменить трансформер в топовых моделях. Но если сработает хотя бы один — вся индустрия, вложившая триллионы в текущую архитектуру, окажется перед выбором: догонять или отстать.

Во что углубиться:

  • Статья Attention Is All You Need 2017 года: как трансформеры завоевали AI-индустрию
  • Diffusion-модели для генерации изображений: как работает технология, которую теперь применяют к тексту
  • Энергопотребление дата-центров и прогнозы IEA до 2030 года

Реклама
ЛИДЕРБОРД · 728 × 90зона «Реклама: между секциями»