Top.Mail.Ru
Alibaba представила Qwen-Image-2.1 Turbo — открытая 7b-модель для генерация и редактирование изображений | Блог Serverflow Скачать
прайс-лист
Бесплатная
доставка по РФ
Бонус за
обратную связь
Интернет-магазин
Серверного оборудования
8 (800) 222-70-01 Консультация IT-специалиста Сравнение

Alibaba представила Qwen-Image-2.1 Turbo — открытая 7b-модель для генерация и редактирование изображений

~ 2 мин
78
Простой
Новости
Alibaba представила Qwen-Image-2.1 Turbo — открытая 7b-модель для генерация и редактирование изображений

Введение

Alibaba выпустила Qwen-Image-2.1 Turbo — ускоренную версию открытой модели Qwen-Image-2.1 для генерации изображений по тексту и их редактирования. Turbo выдает результат всего за 8 шагов денойзинга вместо 40 у базовой модели, что значительно ускоряет генерацию изображений. При этом архитектура осталась прежней: визуальный генератор на 7 млрд параметров, поддержка вывода в 2K, работа с прозрачностью и до 10 референсных изображений. Веса модели уже доступны на Hugging Face и ModelScope.

Подробнее о Qwen-Image-2.1 Turbo

Qwen-Image-2.1 Turbo — это ускоренный чекпоинт Qwen-Image-2.1, а не отдельная модель: 8-шаговое семплирование зашито прямо в веса, а CFG по умолчанию равен 1. В отличие от сторонних turbo-LoRA, которые сообщество выпускало после релиза базовой модели, Turbo не требует подключать адаптеры или кастомные ноды — достаточно загрузить чекпоинт через стандартный пайплайн Diffusers. Из базовой модели перешла и архитектура со смешанной гранулярностью внимания: промпт и входные изображения рассчитываются один раз и кэшируются в KV-кэше, поэтому на каждом шаге модель обрабатывает только токены изображения.

Сам генератор, 32-слойный Diffusion Transformer, содержит около 7 млрд параметров, но полный пайплайн почти вдвое больше. Текстовый энкодер Qwen3-VL, который обрабатывает промпты и референсы, насчитывает 8,8 млрд параметров — больше, чем генератор. Вместе с VAE выходит около 16,2 млрд параметров (32,5 ГБ весов в оригинальной точности BF16).

Для запуска в BF16 понадобится видеокарта на 48 ГБ. После квантизации в INT8 веса сжимаются примерно до 16–17 ГБ, и для генерации в разрешении 1024 × 1024 хватит карты на 24 ГБ. Смешанная 4-битная квантизация уменьшает пайплайн до 10–12 ГБ, и модель укладывается в 16 ГБ видеопамяти. Владельцы карт на 8–12 ГБ тоже смогут запустить Qwen-Image-2.1 Turbo, если загружать энкодер, генератор и VAE по очереди, но работать модель будет заметно медленнее. При этом запас памяти нужен не только под веса: при разрешении 2048 × 2048 вычисления могут потребовать еще 5–9 ГБ.

Все возможности Qwen-Image-2.1 Turbo унаследовала от базовой версии. Модель по тексту промпта сама решает, создать обычное изображение или картинку с альфа-каналом (RGBA). Она редактирует прозрачные слои и вырезает объекты с фотографий. Для редактирования можно загрузить до 10 референсов, например для групповых фото, виртуальной примерки или дизайна интерьера. Область правки задается кругами, закрашенной зоной или отдельной маской.

Выводы

Qwen-Image-2.1 Turbo исправляет единственный недостаток базовой модели — скорость. Сократив число шагов в пять раз при той же архитектуре, Alibaba делает генерацию и редактирование изображений пригодными для массовых сценариев, где счет идет на тысячи картинок: e-commerce, маркетинг, дизайн и создание контента. Однако экономия касается времени, а не железа: Turbo требует столько же видеопамяти, сколько базовая версия.
Автор: Serverflow Serverflow
Поделиться

Комментарии 0

Написать комментарий
Сейчас тут ничего нет. Ваш комментарий может стать первым.
Написать отзыв
До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Написать комментарий

Комментарий появится на сайте после предварительной модерации

До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Мы свяжемся с вами утром

График работы: Пн-Пт 10:00-18:30 (по МСК)

Обработаем вашу заявку
в ближайший рабочий день

График работы: Пн-Пт 10:00-18:30 (по МСК)