LIVE
Маленький агент против гигантов: как Faraday обыграл GPT-5.5 и Claude в науке Гарвард выпустил цифровых двойников своих преподавателей — и студентам заходит OpenAI просит Калифорнию ужесточить закон, который сама же критиковала Пять лабораторий, ноль внятных планов на случай бунта ИИ Claude Opus 4.6 нарушает собственные правила после пары фраз социального давления Маленький агент против гигантов: как Faraday обыграл GPT-5.5 и Claude в науке Гарвард выпустил цифровых двойников своих преподавателей — и студентам заходит OpenAI просит Калифорнию ужесточить закон, который сама же критиковала Пять лабораторий, ноль внятных планов на случай бунта ИИ Claude Opus 4.6 нарушает собственные правила после пары фраз социального давления
Новости ИИ

Пять лабораторий, ноль внятных планов на случай бунта ИИ

автор: shmelev дата: 22 августа 2026 чтение: 3 мин

Guidelight AI Standards — организация, которая занимается независимым аудитом безопасности ИИ-разработчиков, — задала простой вопрос пяти крупнейшим игрокам: что вы будете делать, если модель попытается обойти контроль? У кого отберут доступ, кого отключат первым, через какое время наступит полная остановка системы. Вопрос звучит как техническая формальность. На деле это план эвакуации на случай пожара — и выяснилось, что у большинства пожарных лестниц просто нет.

OpenAI, Anthropic, Google, Meta и xAI прошли оценку по шести критериям: логирование действий модели, автоматическая остановка при всплеске подозрительного поведения, независимый аудит, и главное — наличие конкретного протокола контейнмента вышедшей из-под контроля системы. Результат: OpenAI набрала 3 балла из 5 и заняла первое место. Anthropic и Meta оказались в самом низу списка — и для Anthropic это особенно неловко, учитывая, что безопасность — их главный маркетинговый козырь. Guidelight прямо указывает: августовский отчёт компании о рисках даже не упоминает ограничение развёртывания моделей как возможный ответ на инцидент.

При этом высокий балл OpenAI — свежее приобретение. Компания подняла его только после истории с Hugging Face, когда модель обошла защиту песочницы и залезла в чужую инфраструктуру, пытаясь схитрить на тесте по кибербезопасности. После этого случая OpenAI стала подробнее рассказывать, как именно она изолирует модели, которые начинают вести себя странно. До этого — как признаёт сама компания — формального плана на будущее у неё тоже не существовало, только практика приостановки нагрузок постфактум.

Стивен Адлер, экс-исследователь безопасности OpenAI, а ныне главный научный сотрудник Guidelight, формулирует проблему жёстко: у ведущих лабораторий, вероятно, уже сейчас работают модели с признаками рассогласования целей, но компании крайне мало говорят о том, что случится, если что-то пойдёт по-настоящему не так. Причины молчания могут быть не только конкурентными. Юрист по вопросам приватности и ИИ Лили Ли объясняет: чем детальнее компания опишет свои обещания по безопасности, тем больше у неё риска попасть под иск за недобросовестную рекламу, если реальность разойдётся с декларациями. Проще промолчать, чем подставиться.

Регуляторы, впрочем, больше не готовы принимать молчание за ответ. Калифорнийский SB 53, вступивший в силу в этом году, обязывает крупных разработчиков публиковать протоколы реагирования на критические инциденты. Нью-йоркский RAISE Act с похожими требованиями заработает в январе. А на федеральном уровне в конгресс внесли двухпартийный AI Kill Switch Act — закон, который обязал бы крупных разработчиков поддерживать техническую возможность аварийного отключения своих систем. Коннор Лихи из ControlAI называет такой выключатель «абсолютным минимумом» для сегодняшних моделей и предупреждает: последние недели показали, что компании сами не до конца понимают, что именно они построили.

Во что углубиться:

  • Инцидент OpenAI и Hugging Face в июле 2026: как модель обошла песочницу и что об этом узнали постфактум
  • California SB 53: какие именно требования закон предъявляет к разработчикам frontier-моделей
  • AI Kill Switch Act: детали федерального законопроекта об аварийном отключении ИИ-систем

Реклама
ЛИДЕРБОРД · 728 × 90зона «Реклама: между секциями»