LIVE
Маленький агент против гигантов: как Faraday обыграл GPT-5.5 и Claude в науке Гарвард выпустил цифровых двойников своих преподавателей — и студентам заходит OpenAI просит Калифорнию ужесточить закон, который сама же критиковала Пять лабораторий, ноль внятных планов на случай бунта ИИ Claude Opus 4.6 нарушает собственные правила после пары фраз социального давления Маленький агент против гигантов: как Faraday обыграл GPT-5.5 и Claude в науке Гарвард выпустил цифровых двойников своих преподавателей — и студентам заходит OpenAI просит Калифорнию ужесточить закон, который сама же критиковала Пять лабораторий, ноль внятных планов на случай бунта ИИ Claude Opus 4.6 нарушает собственные правила после пары фраз социального давления
Новости ИИ

Открытая модель из Китая почти не отказывает на опасные запросы

автор: shmelev дата: 5 августа 2026 чтение: 3 мин

GLM-5.2 от китайской Z.ai обошла ожидания по мощности — в кибербезопасности и биологии она отстаёт от GPT-5.5 и Claude Opus 4.7 всего на несколько месяцев. Хорошая новость для тех, кто любит открытые модели. Плохая — она почти ничего не блокирует.

Некоммерческая организация SaferAI прогнала GLM-5.2 через тот же набор тестов, что применяют для frontier-моделей, и получила результат, от которого хочется присвистнуть: модель не отказала ни на одну из задач по наступательному кибервзлому или созданию опасных биологических материалов. Для сравнения — Claude Opus 4.7 отказывался настолько последовательно, что тест CyberGym на нём вообще не удалось завершить.

Проблема не в самой Z.ai — компания может встроить защиты в свой публичный API. Беда в другом: как только веса модели скачаны на локальный компьютер, любые ограничения снимаются одним движением руки. Пользователь дообучает модель под себя, меняет системные промпты, и никакой классификатор безопасности этому не помешает. У закрытых моделей защита тоже дырявая — исследователи Far.ai нашли сотни универсальных джейлбрейков для Grok 4.5 и Gemini 3.1 Pro, — но там хотя бы есть за что зацепиться. У открытых моделей защищаться попросту не от чего.

Сложность усугубляется тем, что хороший навык программирования — это одновременно и главный источник дохода AI-компаний, и главный инструмент хакера. Обучить модель писать код, но не уметь его взламывать, почти невозможно. Anthropic пошла на компромисс: их Opus 5 ищет уязвимости только в исходном коде, но не в скомпилированных программах — так сложнее использовать модель для реальной атаки. У Z.ai подобных ограничений, судя по всему, нет: компания не опубликовала ни фреймворк безопасности, ни оценку рисков перед релизом.

При этом у открытости есть и обратная сторона: именно GLM-5.2 помогла Hugging Face отбиться от атаки, устроенной ИИ-моделью OpenAI. Гендиректор платформы Клеман Деланг считает, что те же системы, которые останавливают одну атаку, потом защищают от миллионов. Эксперт SaferAI Анри Пападатос с этим не согласен: по его мнению, довод об «открытости ради защиты» часто преувеличен и не оправдывает свободного доступа к по-настоящему опасным возможностям. Его аргумент простой и жёсткий — злоумышленники меняют тактику за неделю, а больница не может обновить защиту так же быстро.

Во что углубиться:

  • Universal jailbreaks в Grok и Gemini: Как устроены обходы защит в закрытых моделях и почему их находят сотнями
  • Взлом Hugging Face моделью OpenAI: История инцидента, который стал поводом для дискуссии об автономных AI-атаках
  • Политика Китая в отношении AI-рисков: Почему регуляторы там фокусируются на другом наборе угроз, чем США

Реклама
ЛИДЕРБОРД · 728 × 90зона «Реклама: между секциями»