Top.Mail.Ru
Alibaba представила Qwen-Image-2.1 — открытая 7b-модель для генерации и редактирования изображений | Блог Serverflow Скачать
прайс-лист
Бесплатная
доставка по РФ
Бонус за
обратную связь
Интернет-магазин
Серверного оборудования
8 (800) 222-70-01 Консультация IT-специалиста Сравнение

Alibaba представила Qwen-Image-2.1 — открытая 7b-модель для генерации и редактирования изображений

~ 2 мин
43
Простой
Новости
Alibaba представила Qwen-Image-2.1 — открытая 7b-модель для генерации и редактирования изображений

Введение

Alibaba открыла исходный код Qwen-Image-2.1 — новой генеративной модели, которая объединяет создание изображений по текстовому описанию и редактирование в единой архитектуре. Модель имеет всего 7 млрд параметров, что делает ее компактной и доступной для развертывания для большинства пользователей, при этом сохраняя эффективность и качество создаваемого контента. Исходный код Qwen-Image-2.1 доступен на GitHub и ModelScope.

Подробнее о Qwen-Image-2.1

Модель построена на 32 слоях Single-Stream DiT и использует смешанную гранулярность внимания. Текст, включая системный префикс и инструкции редактирования, обрабатывается с токен-уровневой причинной маской, а генерация изображения — с чанк-уровневой. Повторное использование KV-кэша позволяет входным изображениям и инструкциям служить статическим контекстом, который вычисляется один раз и кэшируется. Это ускоряет инференс и снижает потребление памяти, особенно при работе с несколькими входными изображениями.

Нативная поддержка генерации/редактирования прозрачных объектов стала одним из главных нововведений. Модель сама определяет по запросу, нужно ли создать обычное изображение или картинку с альфа-каналом. Это позволяет генерировать прозрачные объекты и композиции, редактировать прозрачные слои, менять текст внутри них, а также извлекать объекты из фотографий в формате RGBA для дальнейшего использования в дизайне. Раньше для этого требовалась отдельная модель Qwen-Image-Layered, теперь возможность встроена в единую систему.

Qwen-Image-2.1 принимает до 10 референсных изображений, что позволяет собирать групповые портреты, примерять одежду по нескольким предметам гардероба или создавать интерьеры из отдельных предметов мебели. Локальные правки можно задавать кругами, рисованными аннотациями или отдельной маской. Модель сохраняет внешний вид объектов при изменениях: черты остаются узнаваемыми, а текст, текстуры и форма — неизменными. Поддерживаются панорамы, инфографика и раскадровки. Качество генерации улучшено за счет проработки типографики и портретного освещения. Текст рендерится с учетом стиля, макета и композиции, а лица получают более реалистичное освещение и детализацию.

Выводы

Qwen-Image-2.1 — это практичный инструмент для дизайна, контента, электронной коммерции и визуального сторителлинга. Открытый исходный код и компактная архитектура снижают порог входа, позволяя разработчикам разворачивать модель локально и адаптировать под свои задачи. Унификация генерации и редактирования в одной модели упрощает пайплайны, а поддержка прозрачности и десяти референсов закрывает сценарии, которые раньше требовали нескольких специализированных решений.
Автор: Serverflow Serverflow
Поделиться

Комментарии 0

Написать комментарий
Сейчас тут ничего нет. Ваш комментарий может стать первым.
Написать отзыв
До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Написать комментарий

Комментарий появится на сайте после предварительной модерации

До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Мы свяжемся с вами утром

График работы: Пн-Пт 10:00-18:30 (по МСК)

Обработаем вашу заявку
в ближайший рабочий день

График работы: Пн-Пт 10:00-18:30 (по МСК)