Top.Mail.Ru
Liqid UltraStack 30: платформа с 30 ИИ-ускорителями AMD Instinct MI350P, 4,3 ТБ HBM3E и 69 PFLOPS FP8 для ИИ-инференса | Блог Serverflow Скачать
прайс-лист
Бесплатная
доставка по РФ
Бонус за
обратную связь
Интернет-магазин
Серверного оборудования
8 (800) 222-70-01 Консультация IT-специалиста Сравнение

Liqid UltraStack 30: платформа с 30 ИИ-ускорителями AMD Instinct MI350P, 4,3 ТБ HBM3E и 69 PFLOPS FP8 для ИИ-инференса

~ 2 мин
63
Простой
Новости
Liqid UltraStack 30: платформа с 30 ИИ-ускорителями AMD Instinct MI350P, 4,3 ТБ HBM3E и 69 PFLOPS FP8 для ИИ-инференса

Введение

Компания Liqid в партнерстве с AMD представила новую аппаратную платформу UltraStack 30, спроектированную для крупномасштабного ИИ-инференса. Решение базируется на 30 ускорителях AMD Instinct MI350P в составе единого серверного узла под управлением 2 центральных процессоров AMD EPYC 9005 Turin, устраняя накладные расходы многоузловых кластеров и принципиально меняя экономику генерации токенов. Платформа нацелена на обслуживание больших языковых моделей, работу с длинными контекстами, мультимодельный сервинг, агентный ИИ, RAG и векторный поиск, а также на высокопроизводительные научные вычисления. Заявленные характеристики включают 4,3 ТБ агрегированной памяти HBM3E, пиковую производительность 69 PFLOPS в формате FP8 и суммарное энергопотребление около 22 кВт.

Подробнее о Liqid UltraStack 30

Архитектура UltraStack 30 построена вокруг центрального двухсокетного сервера на базе CPU AMD EPYC 9005, который через коммутатор Liqid PCIe Fabric Switch соединяется с 3 внешними шасси. В каждом внешнем шасси размещено по 10 ИИ-ускорителей Instinct MI350P с 144 ГБ памяти HBM3E, 4096-битной шиной и интерфейсом PCIe, что дает суммарный объем видеопамяти 4,3 ТБ. Все 30 GPU объединяются в единый пул, управляемый программным обеспечением Liqid Matrix. Matrix в реальном времени распределяет ИИ-ускорители между рабочими нагрузками по высокоскоростной шине PCIe. Это исключает многоузловые задержки, обеспечивает предсказуемое линейное масштабирование и доводит загрузку GPU практически до 100%. Платформа поддерживает Kubernetes для мультимодельного сервинга из коробки и готова к подключению пулов памяти CXL 3.0, что в перспективе открывает путь к расширению общего пула памяти до терабайтных значений, который будет использоваться для хранения KV-кэша и других ресурсоемких нагрузок. Взаимодействие между ускорителями реализовано через традиционную peer-to-peer коммуникацию.

Liqid приводит детальные метрики превосходства над традиционными серверными архитектурами, в которых обычно установлено от 2 до 8 GPU и которые вынуждают разносить большие модели по нескольким системам. UltraStack 30 демонстрирует до 3,7 раза больше токенов в секунду, в 2,1 раза больше токенов на доллар и в 1,8 раза больше токенов на ватт по сравнению с базовыми многоузловыми конфигурациями. Затраты на развертывание сокращаются на 65%, а энергопотребление — на 50%. Удельная производительность достигает 3,14 PFLOPS/кВт, а плотность HBM — 195 ГБ/кВт и 62 ГБ/PFLOPS. Таким образом, одна система UltraStack 30 способна заменить 4 и более обычных серверов при обработке аналогичных по масштабу ИИ-моделей.

Выводы

Несмотря на то, что AMD уже представила новое поколение центральных процессоров и графичесих ускорителей, спрос на решения EPYC 9005 Turin и ИИ-ускорители Instinct MI350P с интерфейсом PCIe не только не падает, но и растет по экспоненте, и Liqid со своей системой UltraStack 30 готова максимально удовлетворить потребности клиентов, ищущих новый, более эффективный способ конвертировать оборудование AMD в прибыль. Liqid UltraStack 30 решает главную проблему современных инференсных инфраструктур — фрагментацию GPU-памяти по множеству физических узлов. Консолидация 30 ускорителей в единый пул под управлением одного сервера позволяет обслуживать тяжелые LLM и контекстно-зависимые сценарии без дорогих межсерверных сетей и с практически полной загрузкой ускорителей. При производительности 69 PFLOPS FP8 и 4,3 ТБ HBM3E на 22 кВт UltraStack 30 задает новый ориентир плотности и экономической эффективности для инференса больших моделей в частных дата-центрах.
Автор: Serverflow Serverflow
Поделиться

Комментарии 0

Написать комментарий
Сейчас тут ничего нет. Ваш комментарий может стать первым.
Написать отзыв
До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Написать комментарий

Комментарий появится на сайте после предварительной модерации

До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Мы свяжемся с вами утром

График работы: Пн-Пт 10:00-18:30 (по МСК)

Обработаем вашу заявку
в ближайший рабочий день

График работы: Пн-Пт 10:00-18:30 (по МСК)