Top.Mail.Ru
Cerebras представила CS-4 — новое поколение ИИ-стоек с производительностью 750 PFLOPS в FP16 и задержкой 2 мкс | Блог Serverflow Скачать
прайс-лист
Бесплатная
доставка по РФ
Бонус за
обратную связь
Интернет-магазин
Серверного оборудования
8 (800) 222-70-01 Консультация IT-специалиста Сравнение

Cerebras представила CS-4 — новое поколение ИИ-стоек с производительностью 750 PFLOPS в FP16 и задержкой 2 мкс

~ 2 мин
43
Простой
Новости
Cerebras представила CS-4 — новое поколение ИИ-стоек с производительностью 750 PFLOPS в FP16 и задержкой 2 мкс

Введение

Cerebras Systems анонсировала стоечную систему CS-4, построенную на трех ускорителях WSE-3 Turbo. Компания утверждает, что в задачах инференса новинка обеспечивает до 30-кратного превосходства над платформами на базе современных GPU. В основе — те же пластины WSE-3 с 4 трлн транзисторов, 900 тыс. ядер и 44 ГБ SRAM на площади 46 225 мм², но с удвоенной пропускной способностью памяти и ввода-вывода, а также двукратным ростом вычислительной производительности за счет повышения рабочих частот. Суммарная производительность стойки достигает 750 PFLOPS в разреженных FP16-вычислениях, а задержка между пластинами — всего 2 мкс. Поставки запланированы на текущий квартал.

Подробнее о CS-4 на базе WSE-3 Turbo

Ускоритель WSE-3 Turbo сохранил архитектуру оригинального WSE-3: он по-прежнему производится по 5-нм техпроцессу TSMC и содержит 4 трлн транзисторов, 900 тыс. ядер и 44 ГБ встроенной SRAM на пластине площадью 46 225 мм². Однако пропускная способность памяти выросла вдвое — с 21,6 до 43,2 Пбайт/с, а подсистемы ввода-вывода — с 1,2 до 2,4 Тбит/с. Производительность в разреженных FP16-операциях поднялась со 125 до 250 PFLOPS, а в обычных FP16 — с 12,5 до 25 PFLOPS. Это стало возможным благодаря форсированию тактовых частот, ориентировочно с 1,4 ГГц до 2,8 ГГц. Одновременно выросло энергопотребление: TDP пластины увеличился с 15 до 33 кВт, узла — с 23 до 46 кВт, а вся стойка CS-4 потребляет порядка 120-140 кВт.

Вычислительная нода стойки CS-4 на базе 3 WSE-3 Turbo
Вычислительная нода стойки CS-4 на базе 3 WSE-3 Turbo. Источник: Cerebras.

Стойка CS-4 выполнена на модульной архитектуре Nexus, которая разделяет систему на три ключевых функциональных блока: вычислительный узел Wafer-Scale Backpack, подсистему питания и IO-подсистему. В составе стойки установлены три автономных узла Wafer-Scale Backpack. Каждый такой узел объединяет ускоритель, преобразователь питания, прямое жидкостное охлаждение, компоненты высокоскоростного ввода-вывода и управляющую электронику. Модульность упрощает производство, развертывание, обслуживание и обновление компонентов без остановки всей системы.

Ключевая инженерная инновация — подсистема питания. В CS-4 энергия подводится вплотную к чипам: расстояние составляет всего около 0,5 мм, тогда как в традиционных платах с GPU оно достигает 50 мм. Это почти полностью исключает потери на уровне платы и позволяет подавать больше мощности, что напрямую обеспечивает высокие тактовые частоты и скорость генерации токенов. IO-модуль, в свою очередь, соединяет пластины WSE-3 Turbo внутри стойки и между стойками без внешнего коммутатора, благодаря чему задержка передачи данных между пластинами составляет лишь 2 мкс.

Практическая производительность CS-4 впечатляет. На модели GPT-OSS-120B система показала более 4400 токенов в секунду на одного пользователя — для сравнения, по заявлению Cerebras, наиболее производительный на сегодняшний день GPU-сервис инференса демонстрирует около 350 токенов в секунду. На моделях с более чем 10 трлн параметров заявляется свыше 1000 токенов в секунду. Это делает CS-4 одним из самых быстрых решений для инференса сверхбольших моделей, где время отклика критично.

Архитектура Cerebras CS-4
Архитектура Cerebras CS-4. Источник: Cerebras.

Выводы

CS-4 — это специализированное решение для сегмента, где минимальная задержка и предельная плотность вычислений важнее энергопотребления и универсальности. Cerebras устранила ключевые узкие места классических GPU-кластеров: потери при передаче питания сведены к минимуму, межпластинчатые соединения работают без внешних коммутаторов, а модульная архитектура позволяет наращивать и обслуживать систему без остановки. Все это дает качественный отрыв по скорости генерации токенов на сверхбольших моделях, что критично для инференса в реальном времени. Однако цена такого рывка — 120-140 кВт на стойку и ограниченная совместимость с массовыми программными стеками, что сужает аудиторию до hyperscale-провайдеров и специализированных ИИ-фабрик. Если Cerebras сумеет масштабировать производство и доказать стабильность работы с популярными фреймворками, CS-4 может занять уникальную нишу, где традиционные GPU-платформы проигрывают по самой своей архитектуре.
Автор: Serverflow Serverflow
Поделиться

Комментарии 0

Написать комментарий
Сейчас тут ничего нет. Ваш комментарий может стать первым.
Написать отзыв
До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Написать комментарий

Комментарий появится на сайте после предварительной модерации

До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Мы свяжемся с вами утром

График работы: Пн-Пт 10:00-18:30 (по МСК)

Обработаем вашу заявку
в ближайший рабочий день

График работы: Пн-Пт 10:00-18:30 (по МСК)