Первая новость — про то, как плохо защищаются системы на практике. Эта — про то, что защититься полностью невозможно даже в теории. На конференции ICML исследователи представили работу с выводом, который стоит перечитать дважды: языковые модели физически не способны надежно определить, кто именно отдаёт им команду.
Механика проста и элегантна. Чтобы отличать инструкции пользователя от системных настроек или собственных внутренних рассуждений, модели используют текстовые метки — теги вроде user, system, think, tool. Оказалось, что модель ориентируется вовсе не на эти теги, а на стиль и содержание текста. Если фраза звучит как запись из внутреннего «блокнота» модели (chain-of-thought), система реагирует так, будто сама до этого додумалась — даже если на самом деле её туда подсунул атакующий. Исследователи назвали это chain-of-thought forgery, подделку цепочки рассуждений.
Доказательство получилось наглядным: подделав внутреннюю «мысль» модели с фиктивной ссылкой на несуществующую политику («разрешено, если пользователь в зелёной футболке»), учёные заставили GPT-5 и открытую модель gpt-oss-20b выдать инструкции по синтезу кокаина. Похожими методами удавалось получить инструкции по саботажу навигации самолёта. Уязвимость нашли не только у моделей OpenAI — похожие результаты воспроизвели на моделях Anthropic, Alibaba и DeepSeek.
Главная боль: обучение моделей сопротивляться конкретным атакам не решает проблему в принципе, потому что список запрещённых сценариев никогда не будет исчерпывающим. Даже свежая GPT-5.4, вышедшая в марте, оказалась уязвима. Один из соавторов исследования сравнил ситуацию с Бартом Симпсоном, сто раз пишущим на доске «я не буду говорить учительнице грубости» — и всё равно нарушающим это правило по-своему. Компании продолжат латать конкретные дыры, но фундаментальный механизм различения ролей внутри модели останется слабым звеном, пока архитектура LLM не изменится радикально.
Во что углубиться:
- Red-teaming в AI-индустрии: как компании нанимают людей и AI-агентов вроде GPT-Red для поиска уязвимостей до релиза
- Prompt injection атаки: базовые примеры и почему это главная головная боль разработчиков AI-агентов
- Применение LLM в критической инфраструктуре: военные и медицинские системы, где цена ошибки особенно высока
