Top.Mail.Ru
Nvidia представила Nemotron 3.5 Lightning — открытая MoE-модель на 30 миллиардов параметров для агентных сред | Блог Serverflow Скачать
прайс-лист
Бесплатная
доставка по РФ
Бонус за
обратную связь
Интернет-магазин
Серверного оборудования
8 (800) 222-70-01 Консультация IT-специалиста Сравнение

Nvidia представила Nemotron 3.5 Lightning — открытая MoE-модель на 30 миллиардов параметров для агентных сред

~ 2 мин
33
Простой
Новости
Nvidia представила Nemotron 3.5 Lightning — открытая MoE-модель на 30 миллиардов параметров для агентных сред

Введение

NVIDIA представила Nemotron 3.5 Lightning — компактную открытую модель семейства Nemotron 3, построенную по архитектуре Mixture-of-Experts с 30 млрд общих и всего 3 млрд активных параметров. Модель специально спроектирована как исполнительный слой для постоянно работающих ИИ-агентов, которые большую часть времени выполняют рутинные, но критичные задачи: вызовы инструментов, проверку результатов, делегирование субагентам. Для таких операций гонять фронтирные модели неэффективно — растут задержки и стоимость токенов. Nemotron 3.5 Lightning закрывает эту нишу, обеспечивая сочетание высокой точности и скорости, которое выводит ее на границу Парето среди небольших открытых моделей. Веса и рецепты опубликованы по стандарту OpenMDW-1.1, а поддержка спекулятивного декодирования, квантования NVFP4 и популярных рантаймов делает модель пригодной как для дата-центров, так и для локальных устройств вплоть до DGX Spark и GeForce RTX 5090.

Подробнее о Nemotron 3.5 Lightning

Ключевое преимущество Nemotron 3.5 Lightning — разделение вычислительных затрат в многослойных агентных системах. Тяжелые модели уровня Nemotron 3 Ultra или закрытые фронтиры берут на себя планирование, сложное рассуждение и оркестровку, а Nemotron 3.5 Lightning отвечает за быстрое выполнение конкретных действий. Благодаря маршрутизатору, который активирует лишь небольшую долю экспертов для каждого токена, модель потребляет значительно меньше вычислительных ресурсов, чем ее плотные аналоги того же размера, но сохраняет достаточный уровень интеллекта для точного вызова инструментов и следования инструкциям.

Обучение Nemotron 3.5 Lightning включало несколько этапов, направленных на оптимизацию под фреймворки агентов и спекулятивное декодирование. Модель прошла специальный этап предварительного обучения с многотокеновым предсказанием (Multi-Token Prediction), аналогичный старшим моделям семейства — Nemotron 3 Super и Ultra. Это позволило встроить в модель эффективный механизм генерации нескольких токенов за один проход. В релиз входят две черновые модели: DSpark, рекомендованная для логического вывода на DGX Spark и в сценариях с низким параллелизмом, и DFlash для сравнения и специфических задач. Выбор между ними зависит от уровня параллелизма: при высоком параллелизме оптимальная длина черновика сокращается, а MTP показывает лучшие результаты.

Для сжатия и ускорения Nemotron 3.5 Lightning поставляется с контрольной точкой NVFP4 наряду с BF16. Используются те же специализированные ядра NVFP4, что и у Nemotron 3 Ultra на графических процессорах NVIDIA Blackwell, Hopper и Ampere. Это означает, что один и тот же файл модели одинаково эффективно работает и в серверных стойках, и на настольном DGX Spark. По данным Artificial Analysis Intelligence Index Nemotron 3.5 Lightning выдающиеся результаты — Nemotron 3.5 Lightning выполняет задачи  на 30% быстрее, чем Qwen3.6 35B при том же уровне точности.

Для интеграции Nemotron 3.5 Lightning поддерживает популярные открытые фреймворки — OpenClaw и Hermes Agent, а также работает с NVIDIA NeMo Switchyard. Эта библиотека маршрутизации позволяет направлять простые запросы на компактные модели, а сложные — на фронтирные, оптимизируя бюджет токенов и латентность. Модель также полностью настраиваема: LoRA или полный SFT возможны через NeMo Automodel и NeMo Megatron Bridge, а обучение с подкреплением — через NeMo RL и NeMo Gym. В релиз включен новый открытый датасет Nemotron-RL Agentic Terminal Pivot, использованный для тренировки агентных кодирующих способностей.

Результаты тестирования Nemotron 3.5 Lightning
Результаты тестирования Nemotron 3.5 Lightning. Источник: Nvidia.

Выводы

Nemotron 3.5 Lightning — это прагматичный ответ NVIDIA на зрелость рынка агентных систем: пока все гонятся за пиковым интеллектом, основная масса вычислительной работы в долгоживущих агентах выполняется именно такими компактными моделями-исполнителями. MoE-архитектура с 30 миллиардами общих и 3 миллиардами активных параметров снижает стоимость токена на порядок без потери качества выполнения инструментальных вызовов, а встроенное спекулятивное декодирование и NVFP4-квантование делают модель быстрой даже на потребительском железе. Модель уже доступна на Hugging Face.
Автор: Serverflow Serverflow
Поделиться

Комментарии 0

Написать комментарий
Сейчас тут ничего нет. Ваш комментарий может стать первым.
Написать отзыв
До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Написать комментарий

Комментарий появится на сайте после предварительной модерации

До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Мы свяжемся с вами утром

График работы: Пн-Пт 10:00-18:30 (по МСК)

Обработаем вашу заявку
в ближайший рабочий день

График работы: Пн-Пт 10:00-18:30 (по МСК)