Когда Дженсен Хуанг показал Nvidia Vera Rubin и Groq 3 LPU, весь мир замер в ожидании, вспоминая фурор, произведенный экосистемой Grace Blackwell, и предвкушая, какую революцию совершит новое поколение ИИ-ускорителей после выхода на рынок. Все видели огромные цифры, завороженно слушали главу компании и ждали громких новостей об очередном прорыве Куртки. Но что стоит за этим прорывом, как работает связка Nvidia Vera Rubin + Groq 3 LPU, да и зачем вообще Nvidia решила использовать в GPU-экосистеме ASIC-ускорители — задумываются очень немногие. Но мы решили задуматься, и внимательно изучили материалы малоизвестного, но очень толкового китайского исследователя под ником “Zarbot”, чтобы сделать максимально подробную выжимку и наконец-то рассказать вам, как на самом деле работает Groq 3 LPU в экосистеме Nvidia Vera Rubin.
Почему Nvidia выбрала Groq?
Главное узкое место современных ИИ-вычислений — это, конечно же, огромная задержка при передаче данных во время разных этапов обработки искусственного интеллекта. Ни сверхбыстрая память HBM новейших поколений, ни размещение всех компонентов ИИ-ускорителей на одной подложке, ни использование сверхбыстрых интерконнектов на базе NVLink не могут полностью устранить время ожидания данных из-за внеочередного исполнения инструкций, промахов KV-кэша или динамической маршрутизации трафика. В масштабах одного ИИ-ускорителя или даже GPU-сервера все эти факторы не ставят серьезных палок в колеса, но у задержек есть свойство накладываться друг на друга, поэтому в масштабах огромных ИИ-стоек и целых GPU-кластеров даже небольшое промедление приводит к простою процессоров, а так как в ИИ-ЦОД таких процессоров десятки тысяч, это оборачивается в многомиллионные издержки.
Решений этой проблемы очень много — буквально каждый ИИ-стартап и каждый технологический гигант стремится внести свою лепту в фундаментальную работу по устранению задержек. Но из сотен технологий Nvidia выбрала именно подход стартапа Groq — аппаратный детерминизм в их уникальных ASIC-ускорителях LPU (ранее TSP, Tensor Streaming Processor). Аппаратный детерминизм представляет из себя концепцию предсказуемости вычислений, при которой процессор работает без внутренних планировщиков, предсказателей переходов или кэшей. Время выполнения каждой операции известно заранее, что исключает зависания и гарантирует максимально точный инференс в реальном времени. Детерминизм обеспечивается за счет использования модульной архитектуры LPU-чипа, динамического планировщика задач и собственного компилятора. Дополнительно в ISA процессора встроены инструкции, которые компенсируют микроскопический дрейф тактовых генераторов на отдельных чипах, поддерживая синхронность по всей системе. В результате все операции спланированы заранее, у компонентов не возникает никаких конфликтов за данные и ресурсы, а джиггеры полностью устраняются — задержки сводятся к абсолютному минимуму, и именно это привлекло Nvidia, чтобы оптимизировать инференс в экосистеме Vera Rubin.
Микроархитектура Groq 3 LPU
Поскольку мы рассказывали о чипах Groq в отдельной статье, мы не станем плавно погружать вас особенности Groq 3 LPU — сразу перейдем к архитектурным тонкостям этих передовых процессоров. Как мы уже упоминали, у LPU-чипов модульная архитектура, в которой за все основные ИИ-функции отвечают 4 ключевых функциональных блока:
MXM — отвечает за матричное умножение;
VXM — отвечает за векторные вычисления;
MEM — отвечает за управление SRAM-памятью;
SXM — отвечает за процесс обмена данными.
Функциональные блоки Groq 3 LPU. Источник: .
Все блоки объединяются в единый конвейер под названием SuperLane, выполняющий передачу трафика и исполнение SIMD-команд. Именно благодаря SuperLane-конвейеру обеспечивается тот самый хваленый детерминизм процессоров Groq, обеспечивая ИИ-производительность в 1,2 PFLOPS на чип в режиме FP8. Но на этом инновационность этих чипов не заканчивается.
Конвейер SuperLane в архитектуре Groq 3 LPU. Источник: .
Groq LPU реализуют концепцию Scratchpad Memory (сверхоперативная бескешевая память), при которой вместо стандартной DDR, GDDR или HBM памяти чип использует SRAM — память с огромной пропускной способностью, которая обычно используется для формирования кэша центральных процессоров, обеспечивая сверхбыстрый доступ к горячим данным. В большинстве CPU объем SRAM не превышает нескольких десятков мегабайт, тогда как во флагманских Groq 3 LPU на 4-нм техпроцессе объем SRAM достигает 500 МБ с пропускной способностью 150 ТБ/с — феноменальная скорость, в десятки раз превышающая пропускную способность HBM4E (3-4 ТБ/с), благодаря чему время выполнения ИИ-инференса на Groq 3 LPU кратно ускоряется.
Микроархитектура Groq 3 LPU. Источник: .
Аппаратная экосистема Groq 3 LPU
Так как сами по себе чипы Groq 3 LPU с их 500 МБ SRAM-VRAM были бы каплей в море на фоне нейронок с терабайтами параметров, Хуанг принял решение объединять инференс процессоры в ComputeTray LPX — вычислительные ноды на базе восьми LPU-чипов, напрямую объединенных интерконнектом 112G SerDes (96-линий) с однонаправленной скоростью 10 Тбит/с на чип. Один ComputeTray LPX дает 9,6 PFLOPS FP8 производительности и уже внушительные 4 ГБ SRAM с пропускной способностью 1,2 ПБ/с.
В свою очередь, 32 ноды ComputeTray LPX формируют полноценную вычислительную стойку Groq LPX, внутри которой 256 чипов Groq 3 LPU дают огромную производительность 315 PFLOPS в режиме FP8, суммарный объем SRAM в 128 ГБ и совокупную пропускную способность памяти около 40 ПБ/с.
Вычислительная нода Groq LPX. Источник: .
Кажется, что Groq 3 LPU собираются в целые стойки также просто, как конструктор, но на деле здесь действует весьма сложная иерархия межчиповых, внутристоечных и межстоечных подключений. Топология стоек строится по иерархической схеме Dragonfly — излюбленная топология HPC-инфраструктур. Внутри ComputeTray 8 LPU объединены полносвязным графом (full‑mesh) через 56 каналов C2C (каждый 100 Гбит/с), что дает на один LPU 5,6 Тбит/с совокупной внутринодовой пропускной способности.
Топология объединения Groq 3 LPU в ноде. Источник: .
Для связи между 32 лотками внутри стойки каждый LPU выделяет 31 канал C2C, обеспечивая 3,1 Тбит/с на чип для межнодовых обменов данными. Межстоечные соединения реализуются через 4 канала C2C на LPU (400 Гбит/с) с передней панели лотка; ещё 4 канала (400 Гбит/с) отводятся на FPGA Fabric Expansion Logic для пользовательской маршрутизации и offload-функций. Остальные служебные интерфейсы: PCIe к хостовому CPU для управления, мониторинга и загрузки, а также выделенный DPU BlueField‑4 или ConnectX‑9 для интеграции с внешними сетями Ethernet. Такая трехуровневая структура с адаптивной маршрутизацией обеспечивает масштабируемость до тысяч узлов без экспоненциального роста числа линков и с предсказуемой задержкой на каждом уровне.
Характеристики стойки Groq LPX. Источник: .
Fabric Expansion Logic
Кстати, а что за FPGA Fabric Expansion Logic? А это особая отдельная микросхема в ноде ComputeTray LPU, которая подключена к каждому чипу и несет на борту 256 ГБ DRAM. Зачем она нужна? 128 ГБ SRAM на всю стойку — это очень мало, если мы говорим о моделях MoE с триллионом параметров. DeepSeek-V3, например, содержит 256 экспертов на слой плюс общий эксперт на каждом из 58 слоев, что в сумме требует более 650 ГБ только под параметры экспертов. Без внешней памяти Groq не сможет адресовать такие модели иначе как через установку нескольких стоек.
FEL решает эту проблему: эксперты хранятся в DRAM и подкачиваются в SRAM по мере необходимости. Ключевой момент — подключение DRAM выполнено не через традиционный PCIe, а напрямую к сетевому контроллеру чипа (что-то вроде архитектуры NetDAM). Это позволяет устранять всплески трафика и джиттер, изолируя недетерминированную внешнюю память от детерминированной внутренней фабрики Groq. По сути, FEL выполняет роль “барьера”, который не дает хаосу DDR проникнуть в синхронную среду Groq.
Сравнение архитектуры FEL и NetDAM. Источник: .
Как Groq 3 LPU взаимодействует с Nvidia Vera Rubin
Groq 3 LPU — это не столько самостоятельный продукт, сколько еще один компонент экосистемы Nvidia Vera Rubin, поэтому как бы не был крут ИИ-инференс ускоритель, он обязательно должен качественно взаимодействовать с фирменными GPU/CPU решениями Хуанга. А взаимодействует он с ними лишь косвенно, выполняя строго поставленную задачу — декодирование.
Весь рабочий цикл агентных ИИ состоит из двух фаз. Prefill — модель получает промпт и накопленные результаты работы агента. Здесь нужно много памяти и вычислительная мощь. Decoding — генерация новых токенов. На этом этапе на каждый токен требуется загрузить параметры активных экспертов (в MoE до 8 экспертов на токен) и вычислить FFN-слои. Именно здесь на первый план выходит пропускная способность памяти, и GPU с его ограниченной полосой HBM начинает буксовать при малых батчах. LPU Groq 3 со 150 ТБ/с SRAM на чип решает эту проблему радикально. NVIDIA предложила схему Attention-FFN Disaggregation (AFD): GPU Rubin выполняет Prefill и вычисляет Attention на этапе декодирования (KV-кэш хранится в его HBM), а LPU берет на себя FFN-слои и экспертов MoE. Токены передаются от Rubin к Groq через InfiniBand GPUDirect Async с минимальной задержкой.
Для модели уровня DeepSeek-V3 (MoE, 671B параметров) это работает так: один эксперт весит около 44 МБ в FP8, всего 256 маршрутизируемых экспертов и один общий на каждом из 58 слоев. Суммарно требуется 656,6 ГБ. Одна стойка LPX со 128 ГБ SRAM не вмещает все, поэтому эксперты подкачиваются из DRAM на FEL. При использовании DDR5-6400 четыре планки дают 204,8 ГБ/с, а с MRDIMM-12800 — вдвое больше. Передача 44 МБ параметров одного эксперта со скоростью 400 Гбит/с занимает 800 мкс. Для устранения этого узкого места требуется несколько стоек LPX.
Тесты Nvidia показывают, что при размере пакета 16 на GPU время вычисления MLA на слое составляет 67-400 мкс в зависимости от длины контекста, а FFN на LPU — около 20 мкс, то есть фиксирует прирост в 3-20 раз. Итоговый показатель TPS (токенов в секунду) без спекулятивного декодирования получается 39-188 token/s. С включением спекулятивного декодирования достигается 2-3-кратный прирост, что позволяет поднять сквозной TPS выше 100 token/s — это минимальное требование для агентных нагрузок. Без LPU чистый Rubin при попытке дать такой же TPS на пользователя вынужден использовать настолько малый батч, что общая пропускная способность падает, делая всю ИИ-инфраструктуру неэффективной.
Прирост TPS при использовании Groq 3 LPU в экосистеме Nvidia Rubin. Источник: .
Что дальше: Groq 3.5, Feynman и перспективы LPX
Текущая версия LPU — это не более, чем временное, экспериментальное решение, позволяющее Nvidia быстро вывести на рынок новый класс устройств и увеличить эффективность генерации токенов на инференсе. Ввиду этого, LPU-чипы в их текущем виде имеют определенные недостатки, в частности, касающиеся пропускной способности между DRAM и LPX — даже с MRDIMM-12800 загрузка параметров одного эксперта занимает сотни микросекунд. Кроме того, как бы Nvidia ни пыталась добавить LPU поддержку NVLink, пока что сделать этого не удалось, и чипы Groq объединяются в единое целое с помощью RealScale, а связь стоек LPX и Vera Rubin обеспечивается за счет коммутаторов Spectrum-X. С форматами вычислений тоже беда — пока что в Groq 3 LPU доступны режимы INT8, FP8 и FP16, а поддержка флагманского режима NVFP4 осталась на стороне GPU.
Следующий шаг — Groq 3.5 с поддержкой NVFP4, который сокращает объем данных вдвое и делает подкачку экспертов значительно быстрее, а в поколении Feynman, по всей видимости, межчиповые соединения LPU переведут на NVLink, а функции Fabric Expansion Logic интегрируют в коммутатор CX10 с поддержкой DDR6. Это позволит построить полностью когерентную систему, где GPU и LPU разделяют единое адресное пространство, а эксперты подкачиваются в SRAM с задержками, сравнимыми с локальной памятью. По сути, NVIDIA строит фабрику, где грань между вычислениями и памятью стирается, а выбор между HBM, SRAM и DRAM превращается в вопрос оркестрации, решаемый компилятором, а не закупщиком железа.
Выводы
Связка Vera Rubin и Groq 3 LPU показала всему миру, что даже такая бигтех компания, как Nvidia, осознает, что возможности GPU в ИИ-индустрии не безграничны, и переход на альтернативные кремниевые решения жизненно необходим, чтобы продолжать создавать инновации. Префилл и расчет внимания остаются за графическими процессорами, ведь там объем HBM перекрывает преимущества SRAM, а декодирование станет ношей LPU, где 150 ТБ/с и детерминированная архитектура обеспечат сверхнизкую задержку на малых батчах. Конечно, пока что Groq 3 LPU выглядит как надстройка, чем новый неотъемлемый компонент экосистемы Nvidia, на что указывает наличие костылей вроде виде FEL на FPGA, но в будущем, когда компания реализует свои планы, мы можем увидеть совершенно новый класс устройств, где GPU и ASIC являются единым, универсальным чипом, объединяя в себе SRAM, HBM и DRAM, обеспечивая высочайшую скорость как в инференсе, так и обучении ИИ на всех этапах обработки данных искусственного интеллекта.
Сейчас тут ничего нет. Ваш комментарий может стать первым.
Скидка 1 500 ₽ или бесплатная доставка - уже сейчас 🔥
Мы ценим обратную связь от клиентов. При оформлении заказа вы можете сообщить о своём намерении поделиться впечатлением о работе ServerFlow после получения товара.
* - скидка предоставляется при покупке от 30 000 рублей, в ином случае предусмотрена бесплатная доставка до ПВЗ СДЭК.
Продолжная использовать наш сайт, вы даете согласие на использование файлов Cookie, пользовательских данных (IP-адрес, вид операционной системы, тип браузера, сведения о местоположении, источник, откуда пришел на сайт пользователь, с какого сайта или по какой рекламе, какие страницы
открывает и на какие страницы нажимает пользователь) в целях функционирования сайта, проведения статистических исследований и обзоров. Если вы не хотите, чтобы ваши данные обрабатывались, покиньте сайт.
При оформлении заказа в ServerFlow вы можете сообщить о намерении оставить отзыв о нашей работе после получения товара.
Нам важно ваше честное мнение. Оно помогает развивать сервис и даёт другим клиентам представление о нашей работе.
Вы можете оставить отзыв на удобной для вас платформе:
Google Maps
2GIS
Яндекс Карты
Как работает акция
Применяя промокод, вы подтверждаете намерение поделиться впечатлением о работе ServerFlow после получения заказа. Мы применяем бонус уже к текущему заказу в знак благодарности за обратную связь.
Условия акции:
скидка 1 500 ₽ при заказе от 30 000 ₽
или бесплатная доставка* при заказе до 30 000 ₽
* Бесплатная доставка заказа осуществляется до ПВЗ СДЭК.