OpenAI выпустила режим Ultrafast для GPT-5.6 Sol — своей самой мощной модели. Заявленный результат: до 750 токенов в секунду, что в 14 раз быстрее стандартной обработки. Для сравнения — обычно такую скорость получают только за счёт уменьшения или упрощения модели. OpenAI утверждает, что нашла способ получать больше полезной работы за секунду без такого компромисса.
Скорость здесь не про красивую цифру в презентации, а про новый класс сценариев использования: реагирование на инциденты, поддержка клиентов в реальном времени, анализ финансовых рынков, электронная коммерция — всё, где секунды задержки означают упущенную выгоду или недовольного пользователя. У Anthropic уже есть похожий fast mode для Claude, но, по словам OpenAI, он не дотягивает до заявленной здесь скорости.
Техническая база режима — партнёрство с Cerebras, чипмейкером, специализирующимся на железе для быстрого инференса. Это важная деталь: OpenAI явно делает ставку не только на собственные модели, но и на специализированное оборудование под конкретные задачи скорости. Пока Ultrafast доступен в превью узкому кругу корпоративных клиентов, доступ будет расширяться по мере роста вычислительных мощностей.
История с Ultrafast и апгрейдом Writer выходят из одного корня: индустрия перестала соревноваться исключительно в размере моделей и начала соревноваться в том, кто быстрее и дешевле доставит пользу клиенту. Через год конкуренция за миллисекунды инференса вполне может оказаться заметнее конкуренции за очередной процент в бенчмарках.
Во что углубиться:
- Cerebras и специализированные AI-чипы: чем архитектура для инференса отличается от GPU для обучения
- Инференс vs обучение моделей: почему скорость ответа стала отдельным полем конкуренции лабораторий
- GPT-5.6 Sol: что известно об этой модели и её месте в линейке OpenAI
