Top.Mail.Ru
Alibaba представила Qwen3-Coder-Next — открытую LLM для кодинга и агентных задач | Новости ServerFlow Скачать
прайс-лист
Бесплатная
доставка по РФ
Бонус за
обратную связь
Интернет-магазин
Серверного оборудования
8 (800) 222-70-01 Консультация IT-специалиста Сравнение

Alibaba представила Qwen3-Coder-Next — открытая LLM для кодинга и агентных задач

~ 2 мин
2445
Простой
Новости
Alibaba представила Qwen3-Coder-Next — открытая LLM для кодинга и агентных задач

Введение

Alibaba выпустила Qwen3-Coder-Next — новую языковую модель с открытым исходным кодом и объемом 80 миллиардов параметров для задач программирования и агентской разработки. Alibaba отметила, что нейросеть создавалась как основа для создания кодинг-агентов, которые способны работать в исполняемых средах, использовать инструменты и выполнять многоуровневые операции.

Подробнее о Qwen3-Coder-Next

Qwen3-Coder-Next базируется на ранее выпущенной модели Qwen3-Next-80B-A3B-Base и использует MoE с 3 миллиардами активных параметров при 80 миллиардов общих параметров, благодаря чему при инференсе модель требует меньше вычислительных ресурсов при сохранении высокой точности в агентных сценариях. При обучении Qwen3-Coder-Next разработчики сместили фокус в сторону масштабирования агентных сигналов — модель прошла крупномасштабное предобучение на датасете, ориентированном на код и агентскую разработку, а также дополнительное дообучение на проверяемых задачах в исполняемых окружениях, где обратная связь формируется напрямую от среды. Помимо этого, для еще большего повышения точности модель обучалась на агентных траекториях, подготовленных для реальных сценариев разработки ПО, тестирования и веб-задач, с последующей дистилляцией специализированных экспертов в единую модель, пригодную для практического развертывания.

ИИ-производительность модели Qwen3-Coder-Next
ИИ-производительность модели Qwen3-Coder-Next в агентских бенчмарках. Источник: Hugging Face.

Эффективность модели подтверждается в агентно-ориентированных бенчмарках, где Qwen3-Coder-Next демонстрирует более чем конкурентоспособные результаты. На SWE-Bench Verified модель преодолевает отметку в 70% точности при использовании стандартного агентного окружения, сохраняя устойчивость показателей в многоязычных конфигурациях и на усложненном SWE-Bench Pro. Qwen3-Coder-Next выходит на уровень проприетарной модели Claude Sonnet 4.5 и на порядок превосходит топовые открытые решения, такие как GLM 4.7, DeepSeek V3.2 и Kimi K2.5. Отдельно отмечается способность модели эффективно масштабироваться по числу агентных шагов, что указывает на эффективные навыки рассуждения на длинном горизонте и стабильное поведение в многошаговых задачах.

Результаты тестирования Qwen3-Coder-Next в SWE-Bench Pro
ИИ-производительность модели Qwen3-Coder-Next в бенчмраке SWE-Bench Pro. Источник: Hugging Face.

Выводы

Релиз Qwen3-Coder-Next подтверждает смещение фокуса в развитии кодинговых LLM от простого увеличения параметров к оптимизации агентских навыков и эффективности инференса. Открытые веса, архитектура MoE и сильные результаты на SWE-Bench делают новое ИИ-решение Alibaba отличным выбором для локальной разработки кода и построения автономных кодинг-агентов. Для экосистемы open source релиз Qwen3-Coder-Next крайне важен, так как благодаря нему у открытого сообщества появился еще один практичный инструмент, ориентированный не на демонстрационные сценарии, а на реальное применение в автоматизации разработки ПО.
Автор: Serverflow Serverflow
Поделиться

Комментарии 4

Написать комментарий
Максим
Alibaba выбрала именно кодовый домен для развития агентных навыков, а не общий reasoning. Это контрастирует с подходом DeepSeek, где R1 сначала учили рассуждать на абстрактных задачах, а только потом адаптировали под код. Получается, Qwen3-Coder-Next с самого начала заточена под исполнение, а не под логические цепочки вне контекста программирования.
Serverflow
Да, это принципиальное различие: Qwen3-Coder-Next выращивает агентные навыки именно в среде исполнения кода, а не на синтетических рассуждениях. Как такой подход скажется на переносе навыков в другие предметные области, пока открытый вопрос.
Роман
Сравнение с Claude Sonnet 4.5 на SWE-Bench Verified корректно только если условия тестирования идентичны: количество попыток, доступные инструменты и контекстное окно. Если у Qwen3-Coder-Next было больше попыток или более широкий инструментарий, разрыв может быть не таким значительным, как выглядит из чисел.
Serverflow
Вы затронули важный нюанс. По данным Alibaba, окружение и протокол тестирования стандартизированы, но детали числа попыток не раскрыты. Мы уточним этот момент при самостоятельном бенчмаркинге.
Вадим
В статье упомянуто дообучение на проверяемых задачах с обратной связью от среды, но не указано, как именно оценивали корректность этой обратной связи. Если среда генерирует сигнал по формальным критериям вроде прохождения тестов, не захватываются семантические ошибки в коде, которые тесты не покрывают. Была ли использована какая-то дополнительная валидация поверх автоматических чеков?
Serverflow
Действительно, на этапе RL среда даёт только бинарный сигнал успеха или ошибки тестов. Семантическая валидация в текущей схеме не предусмотрена, и это осознанный компромисс ради масштабируемости сбора данных.
Валерий
MoE с 3 млрд активных параметров из 80 млрд это соотношение 1:27. На практике такой разрыв может означать, что при высокой нагрузке на параллельные запросы реальная пропускная способность упрётся не в память, а в коммутацию между экспертами. Для локального развёртывания это критично: на одной consumer GPU 24 ГБ модель не запустится, а на серверных решениях нужно считать inter-node latency.
Serverflow
Вы правы: узким местом становится не столько объём активных параметров, сколько организация коммутации между экспертами в MoE. Мы планируем отдельно протестировать производительность модели в условиях параллельных инференсов на кластерной инфраструктуре.
Написать отзыв
До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Написать комментарий

Комментарий появится на сайте после предварительной модерации

До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Мы свяжемся с вами утром

График работы: Пн-Пт 10:00-18:30 (по МСК)

Обработаем вашу заявку
в ближайший рабочий день

График работы: Пн-Пт 10:00-18:30 (по МСК)