Alibaba выпустила Qwen-Image-2.1 — открытую модель для генерации и редактирования изображений — и заявляет, что её визуальный компонент при всего 7 миллиардах параметров обходит большинство закрытых систем на собственном бенчмарке компании. Независимые тесты пока не подтвердили результат, но сама заявка звучит громко: для конкуренции с гигантами больше не нужны гигантские модели.
Практический эффект такого размера — доступность. Модель работает на потребительских видеокартах уровня RTX 3090, а значит, для экспериментов не нужен дата-центр — достаточно игрового компьютера. Из функциональных особенностей выделяется нативная поддержка RGBA: модель умеет работать с прозрачностью, изолировать объекты на отдельных слоях, менять текст, не трогая фон. Это удобно для дизайнеров, у которых раньше подобные задачи решались через набор костылей и сторонних инструментов.
Ещё одна деталь — модель одновременно обрабатывает до десяти референсных изображений. На практике это значит: можно собрать групповой портрет из отдельных фотографий разных людей, примерить одежду виртуально или спроектировать интерьер комнаты, подавая модели сразу несколько исходников. Alibaba также утверждает, что архитектурные изменения и переиспользование KV-кэша ускоряют работу модели именно в сценариях с множеством референсов.
Веса модели выложены на Hugging Face, GitHub и Model Scope, есть демо-версия для тестирования прямо в браузере. Правда, лицензия исследовательская — коммерческое использование запрещено, бизнесу придётся отдельно запрашивать разрешение у Qwen. Открытость здесь не абсолютная, но для разработчиков, исследователей и энтузиастов барьер входа снижен ощутимо.
Во что углубиться:
- Открытые веса против закрытых моделей: в чём разница лицензий Apache, MIT и research-only на примере китайских AI-лабораторий
- RGBA-генерация изображений: зачем нейросетям поддержка прозрачности и где это применяется в дизайне
- Qwen от Alibaba: история развития линейки моделей и её место среди китайских конкурентов DeepSeek и Tencent
