Top.Mail.Ru
Alibaba представила Qwen3.6-35B-A3B — открытая MoE LLM с 1M токенов контекста | Новость ServerFlow Скачать
прайс-лист
Бесплатная
доставка по РФ
Бонус за
обратную связь
Интернет-магазин
Серверного оборудования
8 (800) 222-70-01 Консультация IT-специалиста Сравнение

Alibaba представила Qwen3.6-35B-A3B — новая открытая MoE-модель от китайского ИИ-гиганта

~ 2 мин
1905
Простой
Новости
Alibaba представила Qwen3.6-35B-A3B — новая открытая MoE-модель от китайского ИИ-гиганта

Введение

Alibaba официально открыла исходный код своей флагманской ИИ-модели Qwen3.6-35B-A3B — первой открытой версии LLM в семействе Qwen3.6. Это продолжение февральского релиза серии Qwen3.5, и новинка, по заявлениям разработчиков, создавалась с прицелом на максимальную стабильность в продакшене, интуитивно понятное кодирование и высокую отзывчивость в реальных сценариях. Модель построена по архитектуре Mixture-of-Experts (MoE) с общим числом параметров в 35 миллиардов и 3 миллиардов активных параметров. Это позволяет добиться производительности, сопоставимой с гораздо более тяжелыми решениями, оставаясь при этом доступной для локального запуска на обычном железе.

Подробнее о Qwen3.6-35B-A3B

Главная инновация Qwen3.6-35B-A3B — комбинация линейного внимания Gated DeltaNet (используется в 75% слоев) и стандартного Gated Attention (в 25% слоев). Такой гибрид резко снижает вычислительные затраты на длинных последовательностях контекста, сохраняя при этом способность модели держать в памяти полный контекст. Среди 256 экспертов на каждый слой активируется 8 маршрутизируемых плюс 1 общий, что дает примерно 3 миллиардов активных параметров. Еще одна сильная сторона Qwen3.6-35B-A3B — работа с большими объемами информации. Нативно модель поддерживает 262 144 токена контекста, а с включением метода YaRN этот лимит расширяется до 1 010 000 токенов. Благодаря этому пользователи смогут загружать целые репозитории, не прибегая к сегментации данных.

Цифры говорят сами за себя. На SWE-bench Verified модель набирает 73.4%, опережая Gemma4-31B более чем на 21 процентный пункт (52.0%) и уверенно обходя прямого предшественника Qwen3.5-35B-A3B (70.0%). В SWE-bench Pro — 49.5% против 44.6% у прошлой версии. На Terminal-Bench 2.0 результат 51.5% — существенно выше, чем у Gemma4-31B (42.9%) и Qwen3.5-35B-A3B (40.5%). Примечательно, что эти показатели достигаются моделью, которая весит в активном режиме всего 3B параметров. Для сравнения: Qwen3.5-27B — это плотная модель, у которой все 27B активны постоянно, и по многим метрикам новая MoE-версия ее опережает, будучи в 9 раз легче по вычислительным требованиям.

ИИ-производительность Qwen3.6-35B-A3B
ИИ-производительность модели Qwen3.6-35B-A3B. Источник: X.

Qwen3.6-35B-A3B — нативно мультимодальная модель. Она умеет работать с текстом, изображениями и видео одновременно, обрабатывая до 224K видеотокенов (примерно час видео). На бенчмарке VideoMMU модель набрала 83.7% — лучший результат в своем классе. В задачах на пространственное понимание и распознавание объектов: RefCOCO — 92.0, ODinW13 — 50.8. По большинству визуально-языковых тестов Qwen3.6-35B-A3B находится на одном уровне с Claude Sonnet 4.5, а в некоторых сценариях даже превосходит его.

Разработчики сделали особый упор на способность модели выполнять роль ИИ-агента в средах разработки. Qwen3.6-35B-A3B обрабатывает фронтенд-воркфлоу и задачи на уровне целого репозитория с большей плавностью и точностью, чем предшественники. Появилась функция Thinking Preservation — возможность сохранять контекст рассуждений из предыдущих сообщений. Это заметно упрощает итеративную разработку: модель помнит, о чем думала раньше, и не тратит токены на повторный анализ одних и тех же проблем.

Модель распространяется под лицензией Apache 2.0. Это означает полную свободу использования, модификации и распространения — как в коммерческих, так и в некоммерческих целях, без ограничений на объем аудитории или сферу применения. В отличие от Llama 3 с ее лимитом в 700 млн активных пользователей в месяц или проприетарных API, запрещающих обработку медицинских данных по HIPAA, Apache 2.0 снимает все юридические барьеры.

Благодаря MoE-архитектуре квантизованная версия модели весит всего 21 ГБ и запускается на обычной потребительской видеокарте вроде RTX 4090 или на MacBook с чипом M5 и 64 ГБ оперативной памяти. Полноценная BF16-версия требует около 8× H100 для оптимальной производительности, но для большинства сценариев разработки достаточно и квантованного варианта. Веса доступны на Hugging Face и ModelScope в форматах Transformers и FP8, совместимы с vLLM, SGLang и KTransformers.

Выводы

Alibaba сделала серьезный шаг, выпустив модель, которая по соотношению “производительность на активный параметр” оставляет позади многие более тяжелые решения. Главный козырь Qwen3.6-35B-A3B — доступность: открытая лицензия, скромные требования к оборудованию, продуманная интеграция с существующими инструментами. Однако не стоит впадать в эйфорию. Модель отлично показывает себя в кодинге и работе с длинным контекстом, но ее работа в более широких сценариях — особенно в задачах, требующих глубоких знаний в специфических доменах или тонкой настройки на корпоративные процессы — еще предстоит изучить сообществу.
Автор: Serverflow Serverflow
Поделиться

Комментарии 3

Написать комментарий
Руслан
Под Apache 2.0: это снимает ограничения Llama 3 на 700 млн активных пользователей. Но остаётся открытым вопрос: запрещает ли лицензия использовать модель для обучения других MoE-моделей с тем же набором экспертов?
Serverflow
Apache 2.0 не накладывает ограничений на использование выходных данных или обучение производных моделей, так что никаких юридических препятствий для такого сценария нет.
Михаил
262 144 токена контекста нативно, а с YaRN до миллиона. Интересно, как это повлияет на latency при 8-битной квантизации на RTX 4090: не уйдёт ли вся экономия активных 3B параметров в рост времени генерации из-за длинного контекста.
Serverflow
Длительный контекст действительно создаёт дополнительную нагрузку, но гибрид Gated DeltaNet в 75% слоев как раз и призван снизить вычислительные затраты на длинных последовательностях, сохраняя отзывчивость.
Антон
На SWE-bench Verified 73.4% против 52% у Gemma4-31B, при этом модель весит в активном режиме 3B параметров. Если это подтвердится на практике, для небольших команд отпадает необходимость арендовать H100 под задачи кодинга.
Serverflow
Именно так: квантизованная версия в 21 ГБ запускается на потребительских видеокартах, что делает высокую производительность в кодинге доступной без дорогого серверного оборудования.
Написать отзыв
До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Написать комментарий

Комментарий появится на сайте после предварительной модерации

До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Мы свяжемся с вами утром

График работы: Пн-Пт 10:00-18:30 (по МСК)

Обработаем вашу заявку
в ближайший рабочий день

График работы: Пн-Пт 10:00-18:30 (по МСК)