В 2017 году исследователи Google опубликовали статью «Attention Is All You Need» и представили трансформер — архитектуру нейросети, ставшую фундаментом для всех крупных языковых моделей. Девять лет спустя трансформер начинает трещать по швам. Его сила — механизм плотного внимания (dense attention), сравнивающий каждое слово текста с каждым другим, — превратилась в слабость: документ на 10 000 слов требует около 50 миллионов операций умножения. Отсюда счета на электричество: OpenAI планирует потратить на вычисления 50 миллиардов долларов в этом году, а Международное энергетическое агентство прогнозирует удвоение потребления электричества дата-центрами к 2030-му.
Четыре стартапа предлагают четыре разных выхода.
Subquadratic (Майами) переизобретает внимание — их модель SubQ использует sparse attention, просчитывая связи не между всеми словами, а только между значимыми, и, по заявлению компании, впервые не уступает по качеству традиционным моделям в задачах поиска и написания кода. Индустрия относится к заявлению скептически, но очередь из желающих протестировать модель уже сформирована.
Manifest AI (Сан-Франциско) идет дальше — вообще выкидывает механизм внимания, заменяя его «power retention»: модель хранит не весь контекст, а его постоянно обновляемое сжатое резюме, отбрасывая неактуальное по ходу работы. Компания уже переделала открытую модель StarCoder в PowerCoder на этом принципе и утверждает, что новая модель Brumby конкурирует с версиями Qwen от Alibaba.
Liquid AI (выходцы из MIT) смешивает трансформеры с «жидкими нейросетями», вдохновленными устройством мозга червя. В их последних моделях трансформеров всего 20%, остальное — жидкие сети. Результат — модели, способные работать на Raspberry Pi за 50 долларов, уже скачанные почти 34 миллиона раз, и по качеству сопоставимые с моделями в четыре раза крупнее.
Inception (Пало-Альто) взяла технологию генерации изображений — диффузию — и применила ее к тексту: вместо последовательной генерации слово за словом модель сразу превращает случайный набор токенов в связный блок текста. Их модель Mercury 2 работает, по заявлению компании, на уровне GPT-4, но в десять раз быстрее.
Pathway (тоже Пало-Альто) пошла дальше всех — их Dragon Hatchling заменяет внимание математической структурой state space, которая не привязана к последовательности слов. Результат нагляден: модель решает 97% из 250 000 сложных судоку, тогда как ведущие LLM конкурентов не решают ни одной. Логика создателей проста — не всякое рассуждение укладывается в слова, а значит, модель, скованная языком, ограничена в принципе.
Ни один из четырех подходов пока не доказал, что способен полностью заменить трансформер в топовых моделях. Но если сработает хотя бы один — вся индустрия, вложившая триллионы в текущую архитектуру, окажется перед выбором: догонять или отстать.
Во что углубиться:
- Статья Attention Is All You Need 2017 года: как трансформеры завоевали AI-индустрию
- Diffusion-модели для генерации изображений: как работает технология, которую теперь применяют к тексту
- Энергопотребление дата-центров и прогнозы IEA до 2030 года
