NVIDIA представила Nemotron 3.5 Lightning — компактную открытую модель семейства Nemotron 3, построенную по архитектуре Mixture-of-Experts с 30 млрд общих и всего 3 млрд активных параметров. Модель специально спроектирована как исполнительный слой для постоянно работающих ИИ-агентов, которые большую часть времени выполняют рутинные, но критичные задачи: вызовы инструментов, проверку результатов, делегирование субагентам. Для таких операций гонять фронтирные модели неэффективно — растут задержки и стоимость токенов. Nemotron 3.5 Lightning закрывает эту нишу, обеспечивая сочетание высокой точности и скорости, которое выводит ее на границу Парето среди небольших открытых моделей. Веса и рецепты опубликованы по стандарту OpenMDW-1.1, а поддержка спекулятивного декодирования, квантования NVFP4 и популярных рантаймов делает модель пригодной как для дата-центров, так и для локальных устройств вплоть до DGX Spark и GeForce RTX 5090.
Подробнее о Nemotron 3.5 Lightning
Ключевое преимущество Nemotron 3.5 Lightning — разделение вычислительных затрат в многослойных агентных системах. Тяжелые модели уровня Nemotron 3 Ultra или закрытые фронтиры берут на себя планирование, сложное рассуждение и оркестровку, а Nemotron 3.5 Lightning отвечает за быстрое выполнение конкретных действий. Благодаря маршрутизатору, который активирует лишь небольшую долю экспертов для каждого токена, модель потребляет значительно меньше вычислительных ресурсов, чем ее плотные аналоги того же размера, но сохраняет достаточный уровень интеллекта для точного вызова инструментов и следования инструкциям.
Обучение Nemotron 3.5 Lightning включало несколько этапов, направленных на оптимизацию под фреймворки агентов и спекулятивное декодирование. Модель прошла специальный этап предварительного обучения с многотокеновым предсказанием (Multi-Token Prediction), аналогичный старшим моделям семейства — Nemotron 3 Super и Ultra. Это позволило встроить в модель эффективный механизм генерации нескольких токенов за один проход. В релиз входят две черновые модели: DSpark, рекомендованная для логического вывода на DGX Spark и в сценариях с низким параллелизмом, и DFlash для сравнения и специфических задач. Выбор между ними зависит от уровня параллелизма: при высоком параллелизме оптимальная длина черновика сокращается, а MTP показывает лучшие результаты.
Для сжатия и ускорения Nemotron 3.5 Lightning поставляется с контрольной точкой NVFP4 наряду с BF16. Используются те же специализированные ядра NVFP4, что и у Nemotron 3 Ultra на графических процессорах NVIDIA Blackwell, Hopper и Ampere. Это означает, что один и тот же файл модели одинаково эффективно работает и в серверных стойках, и на настольном DGX Spark. По данным Artificial Analysis Intelligence Index Nemotron 3.5 Lightning выдающиеся результаты — Nemotron 3.5 Lightning выполняет задачи на 30% быстрее, чем Qwen3.6 35B при том же уровне точности.
Для интеграции Nemotron 3.5 Lightning поддерживает популярные открытые фреймворки — OpenClaw и Hermes Agent, а также работает с NVIDIA NeMo Switchyard. Эта библиотека маршрутизации позволяет направлять простые запросы на компактные модели, а сложные — на фронтирные, оптимизируя бюджет токенов и латентность. Модель также полностью настраиваема: LoRA или полный SFT возможны через NeMo Automodel и NeMo Megatron Bridge, а обучение с подкреплением — через NeMo RL и NeMo Gym. В релиз включен новый открытый датасет Nemotron-RL Agentic Terminal Pivot, использованный для тренировки агентных кодирующих способностей.
Результаты тестирования Nemotron 3.5 Lightning. Источник: .
Выводы
Nemotron 3.5 Lightning — это прагматичный ответ NVIDIA на зрелость рынка агентных систем: пока все гонятся за пиковым интеллектом, основная масса вычислительной работы в долгоживущих агентах выполняется именно такими компактными моделями-исполнителями. MoE-архитектура с 30 миллиардами общих и 3 миллиардами активных параметров снижает стоимость токена на порядок без потери качества выполнения инструментальных вызовов, а встроенное спекулятивное декодирование и NVFP4-квантование делают модель быстрой даже на потребительском железе. Модель уже доступна на Hugging Face.
Сейчас тут ничего нет. Ваш комментарий может стать первым.
Скидка 1 500 ₽ или бесплатная доставка - уже сейчас 🔥
Мы ценим обратную связь от клиентов. При оформлении заказа вы можете сообщить о своём намерении поделиться впечатлением о работе ServerFlow после получения товара.
* - скидка предоставляется при покупке от 30 000 рублей, в ином случае предусмотрена бесплатная доставка до ПВЗ СДЭК.
Продолжная использовать наш сайт, вы даете согласие на использование файлов Cookie, пользовательских данных (IP-адрес, вид операционной системы, тип браузера, сведения о местоположении, источник, откуда пришел на сайт пользователь, с какого сайта или по какой рекламе, какие страницы
открывает и на какие страницы нажимает пользователь) в целях функционирования сайта, проведения статистических исследований и обзоров. Если вы не хотите, чтобы ваши данные обрабатывались, покиньте сайт.
При оформлении заказа в ServerFlow вы можете сообщить о намерении оставить отзыв о нашей работе после получения товара.
Нам важно ваше честное мнение. Оно помогает развивать сервис и даёт другим клиентам представление о нашей работе.
Вы можете оставить отзыв на удобной для вас платформе:
Google Maps
2GIS
Яндекс Карты
Как работает акция
Применяя промокод, вы подтверждаете намерение поделиться впечатлением о работе ServerFlow после получения заказа. Мы применяем бонус уже к текущему заказу в знак благодарности за обратную связь.
Условия акции:
скидка 1 500 ₽ при заказе от 30 000 ₽
или бесплатная доставка* при заказе до 30 000 ₽
* Бесплатная доставка заказа осуществляется до ПВЗ СДЭК.