Opus 5.5 обошёл в бенчмарках более крупную модель Fable — редкий случай, когда младшая версия обыгрывает старшую по факту, а не на бумаге. Компания прямо назвала её «самой сильной моделью, которую мы когда-либо тестировали». Цена на вывод токенов упала с $25 до $20 за миллион, скорость работы выросла, вычислительные затраты на генерацию ответа снизились.
Изменился и стиль общения модели: меньше профессионального жаргона, важная информация — в начале ответа, а не спрятана в конце длинного текста. Мелочь, которая экономит время всем, кто использует Opus для работы, а не для развлечения.
Главное здесь не бенчмарки. Opus 5.5 — первый релиз Anthropic после того, как CEO Дарио Амодей публично призвал индустрию замедлить темп развития возможностей ИИ, чтобы системы безопасности успевали за ростом мощности моделей. «Я убеждён, что для полного устранения рисков нужна ещё большая осторожность — не просто инвестиции в предотвращение рисков, а сознательное сдерживание темпа развития возможностей, чтобы защита успевала», — написал он в своём блоге. Из-за сходства с Fable по биологическим и кибербезопасностным возможностям на Opus 5.5 наложены те же ограничения: модель не должна помогать искать уязвимости в скомпилированных программах или создавать биологическое оружие. Проверки прошли независимые организации METR и Frontier Design, а в компании уже готовят более продвинутые системы мониторинга для будущих версий.
Получилось редкое сочетание: лидер рынка улучшает продукт и публично признаёт, что скорость прогресса нужно сдерживать. В индустрии, где обычно хвастаются, кто быстрее выпустил следующую версию, это осознанный отход от гонки ради самой гонки.
Во что углубиться:
- «Dario Amodei pace the frontier»: полный текст заявления главы Anthropic о сдерживании темпов развития AI
- METR AI safety evaluations: как независимые организации тестируют модели на риски перед релизом
- AI biosecurity safeguards: какие ограничения накладывают на модели, способные помогать в биологии и кибербезопасности
