Top.Mail.Ru
AMD и Cerebras анонсировали стоечные решения на базе Helios и WSE для низколатентного инференса | Блог Serverflow Скачать
прайс-лист
Бесплатная
доставка по РФ
Бонус за
обратную связь
Интернет-магазин
Серверного оборудования
8 (800) 222-70-01 Консультация IT-специалиста Сравнение

AMD и Cerebras анонсировали стоечные решения на базе Helios и WSE для низколатентного инференса

~ 2 мин
93
Простой
Новости
AMD и Cerebras анонсировали стоечные решения на базе Helios и WSE для низколатентного инференса

Введение

Компании AMD и Cerebras объявили о техническом партнерстве, в рамках которого они создадут совершенно новые дезагрегированные ИИ-решения для инференса с рекордно низкой задержкой. Представленные на Advancing AI 2026, новые стоечные системы будут совмещать графические ускорители AMD Instinct MI455X и тензорные ускорители Cerebras Wafer-Scale Engine 3 в едином кластере и рабочем процессе. Разработка нацелена на сегмент наиболее чувствительных к задержкам приложений, от real-time-ассистентов и агентных систем до робототехники и научных расчетов, и обещает 5-кратное повышение производительности на ватт по сравнению с традиционными GPU-подходами. Доступ к решению откроется во второй половине 2026 года через облачную платформу Cerebras Cloud.

Подробнее о сотрудничестве AMD и Cerebras

Современные нагрузки инференса искусственного интеллекта все сильнее поляризуются: более массовые ИИ-сценарии требуют максимальной скорости генерации токенов, тогда как задачи кодинга ИИ-ассистентов, агентов реального времени требуют минимального времени отклика. Это расслоение формирует спрос на гетерогенную инфраструктуру, способную адресовать разные стадии обработки запросов разными вычислительными архитектурами. AMD и Cerebras ответили на этот вызов концепцией дезагрегированного инференса, подобно тому, как Nvidia объединила мощности Rubin с решениями Groq.

В основе ИИ-стоек AMD и Cerebras лежит принцип разделения классического конвейера на два этапа. Первый — обработка промптов, больших контекстных окон и массивных параллельных запросов, который закрепляется за стойками AMD Helios, построенными на базе AMD EPYC 9006 Venice и Instinct MI455X. Helios будут выступать в роли высокопроизводительного движка пропускной способности и обеспечивает масштабируемую обработку сложных запросов. Второй этап — генерация токенов с минимальной задержкой, узким местом которого традиционно является пропускная способность памяти, который передается “Царь-чипам” Cerebras Wafer-Scale Engine 3, спроектированных для сверхбыстрой потоковой выдачи данных.

Характеристики AMD Instinct MI455X и Cerebras WSE-3
Характеристики AMD Instinct MI455X и Cerebras WSE-3. Источник: AMD.

Интеграция двух машин в единый инференс-пайплайн позволяет достичь характеристик, недоступных при использовании каждого из решений по отдельности. AMD подчеркивает, что Helios обеспечивает лидирующую в отрасли масштабируемость и производительность для самого широкого спектра инференс-нагрузок, а Cerebras добавляет уникальные показатели по скорости декодирования. Суммарный выигрыш — пятикратное увеличение токенов в секунду на ватт. Cerebras уже планирует развертывание систем AMD Helios в собственных ЦОД, и уже во второй половине 2026 года совместные решения будут доступны в облаке Cerebras Cloud.

Снижение задержек и увеличение токенов/с AMD Helios и Cerebras WSE
Снижение задержек и увеличение токенов/с на ватт за счет совместного использования AMD Helios и Cerebras WSE. Источник: AMD.

Выводы

Партнерство AMD и Cerebras можно расценивать как прямой ответ на стратегию Nvidia с ее интеграцией ИИ-чипов Groq в экосистему Rubin, и оба подхода выполняют буквально одну и ту же задачу — свести задержки к минимуму. Примечательно, что именно чипы WSE-3 обладают наибольшей скоростью генерации токенов, и с ней не могут сравниться даже передовые чипы Groq 3 LPU, поэтому у AMD есть явное преимущество в этом секторе. Однако точно ли у красной компании удастся утереть нос своему главному зеленому конкуренту в сегменте дезагрегированного ультралатентного инференса — узнаем лишь во второй половине 2026 года, когда совмещенные ИИ-стойки появятся в облаке Cerebras.
Автор: Serverflow Serverflow
Поделиться

Комментарии 0

Написать комментарий
Сейчас тут ничего нет. Ваш комментарий может стать первым.
Написать отзыв
До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Написать комментарий

Комментарий появится на сайте после предварительной модерации

До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Мы свяжемся с вами утром

График работы: Пн-Пт 10:00-18:30 (по МСК)

Обработаем вашу заявку
в ближайший рабочий день

График работы: Пн-Пт 10:00-18:30 (по МСК)