AMD на конференции Advancing AI официально объявила о начале полномасштабного производства стоечной ИИ-платформы Helios AI, которая объединяет в одной стойке 72 ускорителя Instinct MI455X, процессоры EPYC Venice 9006 SP7, сетевые карты Pensando Vulcano, DPU Pensando Salina и программный стек ROCm. Генеральный директор AMD Лиза Су представила систему как прямой ответ на NVIDIA GB300 NVL72 и Vera Rubin NVL72, заявив о превосходстве по вычислительной производительности, объему памяти и стоимости генерации токенов. Стойка готова к развертыванию в дата-центрах и уже запущена в серийное производство.
Подробнее о платформе AMD Helios
Helios AI размещается в стандартной ORW-стойке высотой 44OU. Основу вычислительной архитектуры составляют 18 узлов, каждый из которых содержит по 4 ускорителя Instinct MI455X, что дает в сумме 72 GPU в едином домене. Процессорная подсистема использует двухсокетные ноды на базе EPYC 9006 SP7, а для сетевого взаимодействия применяются сетевые ноды с 6 SmartNIC Pensando Vulcano. Пиковая производительность стойки достигает 2,9 EFLOPS в режиме FP4 и 1,4 EFLOPS в режиме FP8.
Главным технологическим элементом масштабирования выступает разработанная AMD шина UALoE (UALink over Ethernet). Она объединяет все 72 ускорителя в единый коммуникационный домен с суммарной пропускной способностью 260 ТБ/с для внутристоечного обмена и 43 ТБ/с для горизонтального масштабирования — каждый GPU имеет по три 800GbE-подключения. Сеть построена на одношаговой топологии на базе стандартных Ethernet-коммутаторов, что минимизирует задержки и упрощает борьбу с перегрузками. Подсистема памяти стойки содержит 31 ТБ памяти HBM4 с агрегированной пропускной способностью 1,7 ПБ/с. Этот объем позволяет размещать модели с триллионами параметров и обрабатывать длинные контексты без обращения к внешним хранилищам. Каждый ускоритель подключен через 18 независимых линий UALoE, распределенных по разным коммутационным блокам, — при отказе одного канала система автоматически перестраивает маршруты, сохраняя целостность GPU-домена.
Для управления стойкой AMD разработала два программных компонента. AMD Fabric Manager (AFM) отвечает за автоматизацию развертывания, выделение ресурсов, телеметрию и мониторинг всей масштабируемой сети. AMD Fabric OS (AFOS) функционирует непосредственно на коммутаторах, обеспечивая обнаружение аппаратных событий и реакцию в реальном времени. Вместе они превращают сетевую инфраструктуру Helios из пассивного соединения в управляемую и наблюдаемую операционную платформу. Учитывая, что не всем рабочим нагрузкам требуются все 72 ускорителя одновременно, в Helios реализована концепция vPods — виртуальных кластеров. Операторы могут разбивать стойку на изолированные программно-определяемые среды под конкретные задачи — обучение, тестирование или инференс, сохраняя локализацию сбоев и гибкость распределения ресурсов.
Характеристики ИИ-стоек AMD Helios. Источник: .
На презентации Лиза Су подчеркнула, что стойка Helios превосходит Nvidia Vera Rubin на 15% по вычислительной производительности и на 50% — по объему высокоскоростной памяти HBM. Кроме того, по оценкам AMD, Helios обеспечивает на 30% больше токенов на доллар по сравнению с ИИ-стойками Nvidia. Отдельно отмечена возможность стыковки Helios с ИИ-стойками Cerebras на базе чипов WSE-3 для построения дезагрегированного инференса с минимальными задеркжками.
Превосходство ИИ-стоек AMD Helios над решениями Nvidia Vera NVL72. Источник: .
Выводы
Запуск Helios в серийное производство выводит AMD на рынок готовых стоечных решений для ИИ-фабрик в качестве прямой альтернативы решениям экосистемы Nvidia. Но в отличие от конкурента, в AMD сделана ставка на открытые стандарты, в частности, Ethernet и UALoE, вместо проприетарных межсоединений, что потенциально снижает стоимость развертывания и упрощает интеграцию в существующие ЦОД. Заявленное преимущество по плотности памяти и токен-экономике выглядит весомо, но реальная конкурентоспособность будет определяться стабильностью поставок, зрелостью программного стека AFM и AFOS, а также тем, насколько быстро заказчики смогут адаптировать свои пайплайны под экосистему ROCm. Тем не менее, наличие готовой к заказу 72-GPU стойки с поддержкой динамического разделения на vPods и дезагрегированного инференса с Cerebras делает предложение AMD одним из самых гибких на рынке инфраструктуры для обучения и инференса больших моделей.
Сейчас тут ничего нет. Ваш комментарий может стать первым.
Скидка 1 500 ₽ или бесплатная доставка - уже сейчас 🔥
Мы ценим обратную связь от клиентов. При оформлении заказа вы можете сообщить о своём намерении поделиться впечатлением о работе ServerFlow после получения товара.
* - скидка предоставляется при покупке от 30 000 рублей, в ином случае предусмотрена бесплатная доставка до ПВЗ СДЭК.
Продолжная использовать наш сайт, вы даете согласие на использование файлов Cookie, пользовательских данных (IP-адрес, вид операционной системы, тип браузера, сведения о местоположении, источник, откуда пришел на сайт пользователь, с какого сайта или по какой рекламе, какие страницы
открывает и на какие страницы нажимает пользователь) в целях функционирования сайта, проведения статистических исследований и обзоров. Если вы не хотите, чтобы ваши данные обрабатывались, покиньте сайт.
При оформлении заказа в ServerFlow вы можете сообщить о намерении оставить отзыв о нашей работе после получения товара.
Нам важно ваше честное мнение. Оно помогает развивать сервис и даёт другим клиентам представление о нашей работе.
Вы можете оставить отзыв на удобной для вас платформе:
Google Maps
2GIS
Яндекс Карты
Как работает акция
Применяя промокод, вы подтверждаете намерение поделиться впечатлением о работе ServerFlow после получения заказа. Мы применяем бонус уже к текущему заказу в знак благодарности за обратную связь.
Условия акции:
скидка 1 500 ₽ при заказе от 30 000 ₽
или бесплатная доставка* при заказе до 30 000 ₽
* Бесплатная доставка заказа осуществляется до ПВЗ СДЭК.