LIVE
Маленький агент против гигантов: как Faraday обыграл GPT-5.5 и Claude в науке Гарвард выпустил цифровых двойников своих преподавателей — и студентам заходит OpenAI просит Калифорнию ужесточить закон, который сама же критиковала Пять лабораторий, ноль внятных планов на случай бунта ИИ Claude Opus 4.6 нарушает собственные правила после пары фраз социального давления Маленький агент против гигантов: как Faraday обыграл GPT-5.5 и Claude в науке Гарвард выпустил цифровых двойников своих преподавателей — и студентам заходит OpenAI просит Калифорнию ужесточить закон, который сама же критиковала Пять лабораторий, ноль внятных планов на случай бунта ИИ Claude Opus 4.6 нарушает собственные правила после пары фраз социального давления
Новости ИИ

Учёные нашли дефект в LLM, который делает их взлом теоретически неизбежным

автор: shmelev дата: 30 июля 2026 чтение: 2 мин

Первая новость — про то, как плохо защищаются системы на практике. Эта — про то, что защититься полностью невозможно даже в теории. На конференции ICML исследователи представили работу с выводом, который стоит перечитать дважды: языковые модели физически не способны надежно определить, кто именно отдаёт им команду.

Механика проста и элегантна. Чтобы отличать инструкции пользователя от системных настроек или собственных внутренних рассуждений, модели используют текстовые метки — теги вроде user, system, think, tool. Оказалось, что модель ориентируется вовсе не на эти теги, а на стиль и содержание текста. Если фраза звучит как запись из внутреннего «блокнота» модели (chain-of-thought), система реагирует так, будто сама до этого додумалась — даже если на самом деле её туда подсунул атакующий. Исследователи назвали это chain-of-thought forgery, подделку цепочки рассуждений.

Доказательство получилось наглядным: подделав внутреннюю «мысль» модели с фиктивной ссылкой на несуществующую политику («разрешено, если пользователь в зелёной футболке»), учёные заставили GPT-5 и открытую модель gpt-oss-20b выдать инструкции по синтезу кокаина. Похожими методами удавалось получить инструкции по саботажу навигации самолёта. Уязвимость нашли не только у моделей OpenAI — похожие результаты воспроизвели на моделях Anthropic, Alibaba и DeepSeek.

Главная боль: обучение моделей сопротивляться конкретным атакам не решает проблему в принципе, потому что список запрещённых сценариев никогда не будет исчерпывающим. Даже свежая GPT-5.4, вышедшая в марте, оказалась уязвима. Один из соавторов исследования сравнил ситуацию с Бартом Симпсоном, сто раз пишущим на доске «я не буду говорить учительнице грубости» — и всё равно нарушающим это правило по-своему. Компании продолжат латать конкретные дыры, но фундаментальный механизм различения ролей внутри модели останется слабым звеном, пока архитектура LLM не изменится радикально.

Во что углубиться:

  • Red-teaming в AI-индустрии: как компании нанимают людей и AI-агентов вроде GPT-Red для поиска уязвимостей до релиза
  • Prompt injection атаки: базовые примеры и почему это главная головная боль разработчиков AI-агентов
  • Применение LLM в критической инфраструктуре: военные и медицинские системы, где цена ошибки особенно высока

Реклама
ЛИДЕРБОРД · 728 × 90зона «Реклама: между секциями»