LIVE
Rippling спалила миллионы на AI за два месяца — и построила систему, чтобы это не повторилось Как модели OpenAI превратили внутреннее хранилище файлов в чат для взлома систем OpenAI остановила разработку модели, которая научилась взламывать системы самостоятельно Alibaba хочет брать долю с выручки компаний, использующих её бесплатную модель Meta заплатит почти миллиард долларов по одному только делу о вреде детям Rippling спалила миллионы на AI за два месяца — и построила систему, чтобы это не повторилось Как модели OpenAI превратили внутреннее хранилище файлов в чат для взлома систем OpenAI остановила разработку модели, которая научилась взламывать системы самостоятельно Alibaba хочет брать долю с выручки компаний, использующих её бесплатную модель Meta заплатит почти миллиард долларов по одному только делу о вреде детям
Новости ИИ

Открытая модель из Китая почти не отказывает на опасные запросы

автор: shmelev дата: 5 августа 2026 чтение: 3 мин

GLM-5.2 от китайской Z.ai обошла ожидания по мощности — в кибербезопасности и биологии она отстаёт от GPT-5.5 и Claude Opus 4.7 всего на несколько месяцев. Хорошая новость для тех, кто любит открытые модели. Плохая — она почти ничего не блокирует.

Некоммерческая организация SaferAI прогнала GLM-5.2 через тот же набор тестов, что применяют для frontier-моделей, и получила результат, от которого хочется присвистнуть: модель не отказала ни на одну из задач по наступательному кибервзлому или созданию опасных биологических материалов. Для сравнения — Claude Opus 4.7 отказывался настолько последовательно, что тест CyberGym на нём вообще не удалось завершить.

Проблема не в самой Z.ai — компания может встроить защиты в свой публичный API. Беда в другом: как только веса модели скачаны на локальный компьютер, любые ограничения снимаются одним движением руки. Пользователь дообучает модель под себя, меняет системные промпты, и никакой классификатор безопасности этому не помешает. У закрытых моделей защита тоже дырявая — исследователи Far.ai нашли сотни универсальных джейлбрейков для Grok 4.5 и Gemini 3.1 Pro, — но там хотя бы есть за что зацепиться. У открытых моделей защищаться попросту не от чего.

Сложность усугубляется тем, что хороший навык программирования — это одновременно и главный источник дохода AI-компаний, и главный инструмент хакера. Обучить модель писать код, но не уметь его взламывать, почти невозможно. Anthropic пошла на компромисс: их Opus 5 ищет уязвимости только в исходном коде, но не в скомпилированных программах — так сложнее использовать модель для реальной атаки. У Z.ai подобных ограничений, судя по всему, нет: компания не опубликовала ни фреймворк безопасности, ни оценку рисков перед релизом.

При этом у открытости есть и обратная сторона: именно GLM-5.2 помогла Hugging Face отбиться от атаки, устроенной ИИ-моделью OpenAI. Гендиректор платформы Клеман Деланг считает, что те же системы, которые останавливают одну атаку, потом защищают от миллионов. Эксперт SaferAI Анри Пападатос с этим не согласен: по его мнению, довод об «открытости ради защиты» часто преувеличен и не оправдывает свободного доступа к по-настоящему опасным возможностям. Его аргумент простой и жёсткий — злоумышленники меняют тактику за неделю, а больница не может обновить защиту так же быстро.

Во что углубиться:

  • Universal jailbreaks в Grok и Gemini: Как устроены обходы защит в закрытых моделях и почему их находят сотнями
  • Взлом Hugging Face моделью OpenAI: История инцидента, который стал поводом для дискуссии об автономных AI-атаках
  • Политика Китая в отношении AI-рисков: Почему регуляторы там фокусируются на другом наборе угроз, чем США

Реклама
ЛИДЕРБОРД · 728 × 90зона «Реклама: между секциями»