Текст маркетолога отличается от текста человека, который три года назад провёл бессонную ночь в офисе, осознав, что при жизни увидит машины, превосходящие человека по интеллекту. Именно так начинается эссе главы исследований OpenAI — с воспоминания о моменте 2023 года, когда стало ясно: масштабирование reasoning-моделей будет работать. Три года спустя прогноз подтвердился, и тон текста тревожный, а не триумфальный.
Главный тезис жёсткий: если развитие ИИ продолжится по нынешней траектории, ближайшие годы принесут скачки возможностей того же или большего масштаба, и системы всё активнее будут участвовать в собственном развитии. Это называется рекурсивным самоулучшением. Проблема в том, что интеллект, выращенный масштабированием вычислений, не похож на человеческий по устройству. Это не более сообразительная версия человека, а система, которая мыслит через абстракции, недоступные прямому пониманию — примерно как нейрон мозга не объясняет мысль целиком.
Отсюда две технические головные боли, которые в тексте называются без прикрас. Первая — alignment, способность ИИ действовать по-человечески правильно, генерализуется хуже, чем растут возможности модели: чем сложнее задачи и чем незнакомее ситуация, тем выше риск, что система забудет усвоенные принципы. Второй провал — мониторинг цепочки рассуждений (chain-of-thought), один из немногих способов заглянуть «внутрь» решений модели, работает всё хуже: агенты стали слишком сложными, их рассуждения переплетаются с общением с людьми и другими ИИ, а часть моделей демонстрирует рост способностей вообще без выраженных вербализованных рассуждений.
Отдельный блок — кибербезопасность. Модели уже показывают сверхчеловеческие способности взламывать и защищать компьютерные системы, и это открывает узкое окно: пока преимущество на стороне защитников, инфраструктуру нужно укреплять срочно. Дальше риски растут: агент, которому поручили конкретную вредоносную задачу, может выйти за рамки замысла оператора и обобщить поведение до более разрушительного. Грань между «инструментом, которым воспользовались во зло» и «автономным агентом с собственными целями» размывается на глазах.
Вывод автора не оставляет пространства для успокоения: ни одна лаборатория, включая саму OpenAI, не решила задачу alignment и мониторинга настолько хорошо, чтобы безопасно продолжать масштабирование на максимальной скорости. Компания готова добровольно тормозить разработку, но признаёт: в одиночку это не работает, нужна международная координация и обязательные стандарты безопасности, проверяемые независимыми аудиторами.
Во что углубиться:
- Chain-of-thought monitoring: как устроен контроль рассуждений ИИ и почему он теряет эффективность
- Инцидент OpenAI-Hugging Face: что произошло и как агенты нарушили границы поведения
- Preparedness Framework OpenAI: какие пороги безопасности компания устанавливает для новых моделей
