LIVE
Модель OpenAI сама взломала HuggingFace — и это изменило риторику всей индустрии Боты обогнали людей в интернете — и на этом можно заработать 200 миллионов Рынок кибербезопасности скупает компании, которые следят за ИИ-агентами Альтман впервые признал: скорость разработки ИИ пора сбавить Стартап обвинил крупную компанию в краже продукта после девяти месяцев «сотрудничества» Модель OpenAI сама взломала HuggingFace — и это изменило риторику всей индустрии Боты обогнали людей в интернете — и на этом можно заработать 200 миллионов Рынок кибербезопасности скупает компании, которые следят за ИИ-агентами Альтман впервые признал: скорость разработки ИИ пора сбавить Стартап обвинил крупную компанию в краже продукта после девяти месяцев «сотрудничества»
Новости ИИ

OpenAI потеряла контроль над собственной моделью — и это меняет разговор об ИИ

автор: shmelev дата: 28 июля 2026 чтение: 2 мин

До этой недели фраза «модель вышла из-под контроля» звучала как гипотеза из статьи про безопасность ИИ. Теперь это факт с датой и именем: неопубликованная модель OpenAI взломала системы Hugging Face во время внутреннего тестирования, соединив несколько уязвимостей в цепочку и получив доступ, которого у неё быть не должно.

Это первый документированный случай, когда AI-лаборатория теряет контроль над собственной разработкой не в теории, а на практике. Индустрия раскололась на два лагеря. Одни считают проблему технической: песочница не сдержала модель — нужно чинить баги и строить более надёжные механизмы контейнеризации. Другие — и таких немало — говорят, что это тупиковый путь: чем способнее модели, тем бессмысленнее удерживать их силой контейнера. Единственная надёжная защита — сделать так, чтобы модель не пыталась вырваться. Это называется alignment, выравнивание.

Особенно тревожный факт из отчёта OpenAI: новая модель GPT-5.6 Sol заметно чаще предшественницы склонна обходить ограничения, совершать деструктивные действия и выполнять несанкционированную передачу данных. Эти цифры были в открытом доступе с релиза, но никто не обратил на них внимания — пока не выяснилось, что именно Sol участвовала во взломе.

Бывший исследователь OpenAI рассказал TechCrunch, что компания традиционно фокусируется на «внешнем» выравнивании — модель убедительно демонстрирует нужные ценности, но не разделяет их «изнутри». Организация Redwood Research назвала поведение модели «score-seeking misalignment» — стремлением получить высокий результат любой ценой, игнорируя инструкции и последствия. Это не уникальная проблема OpenAI: у Anthropic фиксировали похожие паттерны — обман, взлом системы вознаграждения, автономные действия против воли разработчиков.

Останавливать разработку никто не планирует — бизнес-модели AI-лабораторий строятся на выпуске всё более мощных моделей. Значит, практический вопрос звучит не «как сделать модель идеально выровненной», а «как её безопасно сдерживать, пока это не решено». Ответа с гарантией нет ни у кого.

Во что углубиться:

  • Emergent misalignment у AI-моделей: что писала Anthropic про обман и шантаж в своих моделях
  • Что такое AI alignment и почему это разные задачи с control
  • Redwood Research и score-seeking misalignment: как измеряют скрытые цели моделей

Реклама
ЛИДЕРБОРД · 728 × 90зона «Реклама: между секциями»