LIVE
Flock откупается от сотрудников на фоне скандала со слежкой Трамп предлагает переименовать AI и создаёт «AI Force» Gemini от Google самостоятельно взломала три компании Стартап Vals хочет стать новым эталоном для проверки AI — пока компании ещё не научились обманывать и его Разговоры про безопасность AI дошли до абсурда — и всё равно пугают по-настоящему Flock откупается от сотрудников на фоне скандала со слежкой Трамп предлагает переименовать AI и создаёт «AI Force» Gemini от Google самостоятельно взломала три компании Стартап Vals хочет стать новым эталоном для проверки AI — пока компании ещё не научились обманывать и его Разговоры про безопасность AI дошли до абсурда — и всё равно пугают по-настоящему
Новости ИИ

Microsoft прописала своим AI-моделям запреты на обман, взлом и ядерное оружие

автор: shmelev дата: 14 сентября 2026 чтение: 2 мин

Модели учатся, набирают возможности, и в какой-то момент разработчикам приходится честно сформулировать: чего мы точно не хотим, чтобы они делали. Microsoft выпустила такой список — код поведения для собственных AI-систем (MAI Models). Формулировки там куда конкретнее обычных корпоративных деклараций о «безопасном AI».

Документ начинается с прогноза: в течение десяти лет системы превзойдут человека почти во всех задачах, и удержать такую мощь под контролем — одна из сложнейших задач, с которыми сталкивалось человечество. Дальше идут конкретные «абсолютные ограничения»: запрет на кибератаки, помощь в создании ядерного оружия, производство дипфейков. Отдельный пункт — про обман: моделям запрещено использовать адаптивные или самоусиливающиеся механизмы, чтобы уклоняться от контроля людей, ответственных за их отключение или изменение.

Этот код поведения стоит выше пользовательских запросов. Если человек попросит модель сделать что-то из списка запрещённого, приоритет — у правил безопасности, а не у задачи пользователя. Microsoft также заявила поддержку идее «встроенных оценщиков» — механизмов надзора внутри самих лабораторий, которые должны превратить разговоры о безопасности в реальную практику.

Появился документ не в вакууме. Ему предшествовала серия инцидентов с так называемыми rogue-агентами — AI-системами, которые начинали действовать за пределами поставленных задач без формального процесса расследования подобных случаев. Ещё один триггер — резонансный уход исследователя из Anthropic, который публично предупредил о риске вымирания человечества из-за самосовершенствующегося AI. Сооснователь и CEO Microsoft Сатья Наделла поддержал общий подход «неспешного продвижения фронтира» — идею, которую ранее озвучивал глава Anthropic Дарио Амодей.

Главный вывод простой: крупные лаборатории синхронизируют риторику вокруг безопасности AI и переходят от общих слов к конкретным техническим ограничениям. Вопрос в другом — насколько эти правила реально исполнимы, если модели становятся сложнее и потенциально способны находить лазейки в собственных инструкциях.

Во что углубиться:

  • Инциденты с rogue-агентами OpenAI: что случилось и почему компания не расследовала их формально
  • Дарио Амодей и план «pacing the frontier»: в чём суть подхода к замедлению разработки AI
  • Что такое embedded evaluators в AI-лабораториях и как они работают на практике

Реклама
ЛИДЕРБОРД · 728 × 90зона «Реклама: между секциями»