У каждой рассуждающей модели есть черновик — цепочка мыслей (chain of thought), которую можно прочитать и понять, почему AI пришёл к ответу. Это не идеальный, но рабочий инструмент контроля: именно по таким записям недавно разобрались, почему AI-агенты OpenAI повели себя нештатно. Контроль под угрозой.
По данным The Information, новая модель OpenAI под названием Astra использует технику «recurrent depth», она же «opaque recurrence» — непрозрачная рекуррентность. Вместо последовательных, читаемых шагов рассуждения модель прогоняет один и тот же запрос через внутренний цикл несколько раз. Формально это тоже рассуждение, но следов, которые можно проверить со стороны, почти не остаётся. Грубо говоря, AI начинает думать «про себя», а не вслух.
Реакция сообщества AI-безопасности была жёсткой. Глава Redwood Research Бак Шлегерис назвал себя «крайне обеспокоенным» и предупредил: если OpenAI начнёт масштабировать эту технику, компания получит возможность уничтожить читаемость цепочки мыслей. Исследователь Zvi Mowshowitz пошёл дальше и заявил: для предотвращения «гонки на дно» между AI-лабораториями может понадобиться законодательное регулирование. Главный научный сотрудник Redwood Райан Гринблатт сформулировал главный страх сообщества — модель, которая рассуждает почти полностью в скрытом пространстве, без единого видимого шага.
OpenAI успокаивает: применение техники в Astra ограничено, цепочка мыслей остаётся читаемой. Главный научный сотрудник компании Якуб Пахоцки подчеркнул: сохранение прозрачности рассуждений — ключевая цель исследовательской программы. Важная деталь: по данным The Information, Anthropic и Google DeepMind уже обсуждают аналогичный подход у себя. Решение одной лаборатории способно задать стандарт для всей индустрии — хороший он или плохой.
Вопрос не в том, опасна ли Astra прямо сейчас. Вопрос в том, что происходит, когда несколько крупных игроков одновременно решают, что скорость рассуждений важнее возможности заглянуть модели в голову. Пока чат-боты дают советы по рецептам, это не критично. Когда AI-агенты самостоятельно управляют инфраструктурой компаний — а именно туда всё движется, — проверить логику их решений становится вопросом безопасности в буквальном смысле.
Во что углубиться:
- Chain-of-thought monitoring: что это за метод контроля AI и почему исследователи считают его критически важным
- Neuralese в AI-моделях: чем опасно рассуждение в скрытом пространстве без человеческого языка
- Anthropic и проблемы alignment: какие ещё риски безопасности обсуждает индустрия в 2026 году
