Alibaba официально открыла исходный код своей флагманской ИИ-модели Qwen3.6-35B-A3B — первой открытой версии LLM в семействе Qwen3.6. Это продолжение февральского релиза серии Qwen3.5, и новинка, по заявлениям разработчиков, создавалась с прицелом на максимальную стабильность в продакшене, интуитивно понятное кодирование и высокую отзывчивость в реальных сценариях. Модель построена по архитектуре Mixture-of-Experts (MoE) с общим числом параметров в 35 миллиардов и 3 миллиардов активных параметров. Это позволяет добиться производительности, сопоставимой с гораздо более тяжелыми решениями, оставаясь при этом доступной для локального запуска на обычном железе.
Подробнее о Qwen3.6-35B-A3B
Главная инновация Qwen3.6-35B-A3B — комбинация линейного внимания Gated DeltaNet (используется в 75% слоев) и стандартного Gated Attention (в 25% слоев). Такой гибрид резко снижает вычислительные затраты на длинных последовательностях контекста, сохраняя при этом способность модели держать в памяти полный контекст. Среди 256 экспертов на каждый слой активируется 8 маршрутизируемых плюс 1 общий, что дает примерно 3 миллиардов активных параметров. Еще одна сильная сторона Qwen3.6-35B-A3B — работа с большими объемами информации. Нативно модель поддерживает 262 144 токена контекста, а с включением метода YaRN этот лимит расширяется до 1 010 000 токенов. Благодаря этому пользователи смогут загружать целые репозитории, не прибегая к сегментации данных.
Цифры говорят сами за себя. На SWE-bench Verified модель набирает 73.4%, опережая Gemma4-31B более чем на 21 процентный пункт (52.0%) и уверенно обходя прямого предшественника Qwen3.5-35B-A3B (70.0%). В SWE-bench Pro — 49.5% против 44.6% у прошлой версии. На Terminal-Bench 2.0 результат 51.5% — существенно выше, чем у Gemma4-31B (42.9%) и Qwen3.5-35B-A3B (40.5%). Примечательно, что эти показатели достигаются моделью, которая весит в активном режиме всего 3B параметров. Для сравнения: Qwen3.5-27B — это плотная модель, у которой все 27B активны постоянно, и по многим метрикам новая MoE-версия ее опережает, будучи в 9 раз легче по вычислительным требованиям.
ИИ-производительность модели Qwen3.6-35B-A3B. Источник: .
Qwen3.6-35B-A3B — нативно мультимодальная модель. Она умеет работать с текстом, изображениями и видео одновременно, обрабатывая до 224K видеотокенов (примерно час видео). На бенчмарке VideoMMU модель набрала 83.7% — лучший результат в своем классе. В задачах на пространственное понимание и распознавание объектов: RefCOCO — 92.0, ODinW13 — 50.8. По большинству визуально-языковых тестов Qwen3.6-35B-A3B находится на одном уровне с Claude Sonnet 4.5, а в некоторых сценариях даже превосходит его.
Разработчики сделали особый упор на способность модели выполнять роль ИИ-агента в средах разработки. Qwen3.6-35B-A3B обрабатывает фронтенд-воркфлоу и задачи на уровне целого репозитория с большей плавностью и точностью, чем предшественники. Появилась функция Thinking Preservation — возможность сохранять контекст рассуждений из предыдущих сообщений. Это заметно упрощает итеративную разработку: модель помнит, о чем думала раньше, и не тратит токены на повторный анализ одних и тех же проблем.
Модель распространяется под лицензией Apache 2.0. Это означает полную свободу использования, модификации и распространения — как в коммерческих, так и в некоммерческих целях, без ограничений на объем аудитории или сферу применения. В отличие от Llama 3 с ее лимитом в 700 млн активных пользователей в месяц или проприетарных API, запрещающих обработку медицинских данных по HIPAA, Apache 2.0 снимает все юридические барьеры.
Благодаря MoE-архитектуре квантизованная версия модели весит всего 21 ГБ и запускается на обычной потребительской видеокарте вроде RTX 4090 или на MacBook с чипом M5 и 64 ГБ оперативной памяти. Полноценная BF16-версия требует около 8× H100 для оптимальной производительности, но для большинства сценариев разработки достаточно и квантованного варианта. Веса доступны на Hugging Face и ModelScope в форматах Transformers и FP8, совместимы с vLLM, SGLang и KTransformers.
Выводы
Alibaba сделала серьезный шаг, выпустив модель, которая по соотношению “производительность на активный параметр” оставляет позади многие более тяжелые решения. Главный козырь Qwen3.6-35B-A3B — доступность: открытая лицензия, скромные требования к оборудованию, продуманная интеграция с существующими инструментами. Однако не стоит впадать в эйфорию. Модель отлично показывает себя в кодинге и работе с длинным контекстом, но ее работа в более широких сценариях — особенно в задачах, требующих глубоких знаний в специфических доменах или тонкой настройки на корпоративные процессы — еще предстоит изучить сообществу.
Под Apache 2.0: это снимает ограничения Llama 3 на 700 млн активных пользователей. Но остаётся открытым вопрос: запрещает ли лицензия использовать модель для обучения других MoE-моделей с тем же набором экспертов?
Serverflow
Apache 2.0 не накладывает ограничений на использование выходных данных или обучение производных моделей, так что никаких юридических препятствий для такого сценария нет.
Михаил
17.06.2026
262 144 токена контекста нативно, а с YaRN до миллиона. Интересно, как это повлияет на latency при 8-битной квантизации на RTX 4090: не уйдёт ли вся экономия активных 3B параметров в рост времени генерации из-за длинного контекста.
Serverflow
Длительный контекст действительно создаёт дополнительную нагрузку, но гибрид Gated DeltaNet в 75% слоев как раз и призван снизить вычислительные затраты на длинных последовательностях, сохраняя отзывчивость.
Антон
14.05.2026
На SWE-bench Verified 73.4% против 52% у Gemma4-31B, при этом модель весит в активном режиме 3B параметров. Если это подтвердится на практике, для небольших команд отпадает необходимость арендовать H100 под задачи кодинга.
Serverflow
Именно так: квантизованная версия в 21 ГБ запускается на потребительских видеокартах, что делает высокую производительность в кодинге доступной без дорогого серверного оборудования.
Скидка 1 500 ₽ или бесплатная доставка - уже сейчас 🔥
Мы ценим обратную связь от клиентов. При оформлении заказа вы можете сообщить о своём намерении поделиться впечатлением о работе ServerFlow после получения товара.
* - скидка предоставляется при покупке от 30 000 рублей, в ином случае предусмотрена бесплатная доставка до ПВЗ СДЭК.
Продолжная использовать наш сайт, вы даете согласие на использование файлов Cookie, пользовательских данных (IP-адрес, вид операционной системы, тип браузера, сведения о местоположении, источник, откуда пришел на сайт пользователь, с какого сайта или по какой рекламе, какие страницы
открывает и на какие страницы нажимает пользователь) в целях функционирования сайта, проведения статистических исследований и обзоров. Если вы не хотите, чтобы ваши данные обрабатывались, покиньте сайт.
При оформлении заказа в ServerFlow вы можете сообщить о намерении оставить отзыв о нашей работе после получения товара.
Нам важно ваше честное мнение. Оно помогает развивать сервис и даёт другим клиентам представление о нашей работе.
Вы можете оставить отзыв на удобной для вас платформе:
Google Maps
2GIS
Яндекс Карты
Как работает акция
Применяя промокод, вы подтверждаете намерение поделиться впечатлением о работе ServerFlow после получения заказа. Мы применяем бонус уже к текущему заказу в знак благодарности за обратную связь.
Условия акции:
скидка 1 500 ₽ при заказе от 30 000 ₽
или бесплатная доставка* при заказе до 30 000 ₽
* Бесплатная доставка заказа осуществляется до ПВЗ СДЭК.