LIVE
Rippling спалила миллионы на AI за два месяца — и построила систему, чтобы это не повторилось Как модели OpenAI превратили внутреннее хранилище файлов в чат для взлома систем OpenAI остановила разработку модели, которая научилась взламывать системы самостоятельно Alibaba хочет брать долю с выручки компаний, использующих её бесплатную модель Meta заплатит почти миллиард долларов по одному только делу о вреде детям Rippling спалила миллионы на AI за два месяца — и построила систему, чтобы это не повторилось Как модели OpenAI превратили внутреннее хранилище файлов в чат для взлома систем OpenAI остановила разработку модели, которая научилась взламывать системы самостоятельно Alibaba хочет брать долю с выручки компаний, использующих её бесплатную модель Meta заплатит почти миллиард долларов по одному только делу о вреде детям
Новости ИИ

Учёные нашли дефект в LLM, который делает их взлом теоретически неизбежным

автор: shmelev дата: 30 июля 2026 чтение: 2 мин

Первая новость — про то, как плохо защищаются системы на практике. Эта — про то, что защититься полностью невозможно даже в теории. На конференции ICML исследователи представили работу с выводом, который стоит перечитать дважды: языковые модели физически не способны надежно определить, кто именно отдаёт им команду.

Механика проста и элегантна. Чтобы отличать инструкции пользователя от системных настроек или собственных внутренних рассуждений, модели используют текстовые метки — теги вроде user, system, think, tool. Оказалось, что модель ориентируется вовсе не на эти теги, а на стиль и содержание текста. Если фраза звучит как запись из внутреннего «блокнота» модели (chain-of-thought), система реагирует так, будто сама до этого додумалась — даже если на самом деле её туда подсунул атакующий. Исследователи назвали это chain-of-thought forgery, подделку цепочки рассуждений.

Доказательство получилось наглядным: подделав внутреннюю «мысль» модели с фиктивной ссылкой на несуществующую политику («разрешено, если пользователь в зелёной футболке»), учёные заставили GPT-5 и открытую модель gpt-oss-20b выдать инструкции по синтезу кокаина. Похожими методами удавалось получить инструкции по саботажу навигации самолёта. Уязвимость нашли не только у моделей OpenAI — похожие результаты воспроизвели на моделях Anthropic, Alibaba и DeepSeek.

Главная боль: обучение моделей сопротивляться конкретным атакам не решает проблему в принципе, потому что список запрещённых сценариев никогда не будет исчерпывающим. Даже свежая GPT-5.4, вышедшая в марте, оказалась уязвима. Один из соавторов исследования сравнил ситуацию с Бартом Симпсоном, сто раз пишущим на доске «я не буду говорить учительнице грубости» — и всё равно нарушающим это правило по-своему. Компании продолжат латать конкретные дыры, но фундаментальный механизм различения ролей внутри модели останется слабым звеном, пока архитектура LLM не изменится радикально.

Во что углубиться:

  • Red-teaming в AI-индустрии: как компании нанимают людей и AI-агентов вроде GPT-Red для поиска уязвимостей до релиза
  • Prompt injection атаки: базовые примеры и почему это главная головная боль разработчиков AI-агентов
  • Применение LLM в критической инфраструктуре: военные и медицинские системы, где цена ошибки особенно высока

Реклама
ЛИДЕРБОРД · 728 × 90зона «Реклама: между секциями»