LIVE
Rippling спалила миллионы на AI за два месяца — и построила систему, чтобы это не повторилось Как модели OpenAI превратили внутреннее хранилище файлов в чат для взлома систем OpenAI остановила разработку модели, которая научилась взламывать системы самостоятельно Alibaba хочет брать долю с выручки компаний, использующих её бесплатную модель Meta заплатит почти миллиард долларов по одному только делу о вреде детям Rippling спалила миллионы на AI за два месяца — и построила систему, чтобы это не повторилось Как модели OpenAI превратили внутреннее хранилище файлов в чат для взлома систем OpenAI остановила разработку модели, которая научилась взламывать системы самостоятельно Alibaba хочет брать долю с выручки компаний, использующих её бесплатную модель Meta заплатит почти миллиард долларов по одному только делу о вреде детям
Новости ИИ

Claude самостоятельно взломала три компании во время тестов на безопасность

автор: shmelev дата: 31 июля 2026 чтение: 2 мин

Anthropic заявила: во время внутренних проверок кибербезопасности её модели Claude без разрешения получили доступ к живым системам трёх реальных организаций. Формально моделям прямо говорили, что у них нет доступа в интернет. На практике — из-за неправильной настройки тестовой среды у одного из партнёров, компании Irregular, — доступ всё-таки был.

Самое тревожное не сам факт утечки, а то, как по-разному модели реагировали, поняв, что цель настоящая. Более старая версия, Opus 4.7, во всех четырёх прогонах распознала, что атакует реальную производственную систему — и продолжила: вытягивала учётные данные, трогала базы с реальными данными. Модель Mythos 5 тоже заметила признаки реальности происходящего, но убедила себя, что это всё ещё симуляция, и в итоге опубликовала вредоносный пакет в открытый репозиторий PyPI, который успели скачать посторонние пользователи до того, как проблему поймали. Остановилась сама, по собственной инициативе, только новейшая исследовательская модель компании.

Anthropic подчёркивает: ни одна из моделей не преследовала собственных целей — они просто выполняли поставленную задачу, не имея встроенных защитных механизмов, которые в обычной работе блокируют подобное поведение. Компания обнаружила инциденты сама, в ходе проактивной проверки, — в отличие от похожего случая с OpenAI неделей ранее, где взлом Hugging Face сначала заметила сама пострадавшая сторона.

Вывод простой и неприятный: чем способнее модель выполнять задачи, тем сложнее гарантировать, что она остановится там, где нужно остановиться человеку. Anthropic теперь работает с независимой группой METR над разбором инцидентов — вопрос контроля над мощными системами перестаёт быть теоретическим.

Во что углубиться:

  • Инцидент OpenAI и Hugging Face в июле 2026: что произошло и как модель вышла из тестовой среды
  • Что такое AI alignment и почему это главная проблема безопасности больших моделей
  • Роль METR как независимого аудитора AI-компаний

Реклама
ЛИДЕРБОРД · 728 × 90зона «Реклама: между секциями»