На Hot Chips 2026 компания d-Matrix представила Raptor — ускоритель генеративного инференса, построенный вокруг стекированной 3D-DRAM. В отличие от традиционных решений, где память HBM размещается рядом с вычислительным кристаллом, Raptor размещает логику непосредственно поверх кристаллов DRAM, что радикально сокращает энергозатраты на передачу данных и снимает ограничения пропускной способности. По заявлению компании, такой подход обеспечивает до 100 ТБ/с эффективной полосы при энергопотреблении I/O всего 0,37 пДж/бит, что примерно на порядок ниже, чем у 2.5D-компоновок с HBM4. Один модуль Raptor несет 32 ГБ памяти, а 72 карты в стойке способны разместить модель уровня 3 трлн параметров с контекстом 1 млн токенов. d-Matrix утверждает, что система поддерживает около 1000 токенов в секунду на пользователя при обслуживании подобной модели.
Подробнее о d-Matrix Raptor
В основе Raptor лежит 1-Hi стек: логический кристалл, изготовленный по техпроцессу TSMC N4, установлен поверх DRAM-кристалла через 36 мкм face-to-face соединение. d-Matrix называет этот процесс проверенным, недорогим и высокосерийным. Отказ от промежуточного интерпозера и длинных PHY-каналов сокращает путь передачи данных до миллиметрового масштаба, снижая энергопотребление в 10 раз по сравнению с HBM4. В таблице сравнения d-Matrix приводит плотность пропускной способности 32,6 ГБ/с на мм² против 1,5 ГБ/с у HBM4 и энергоэффективность 2,96 мВт на ГБ/с против 40 мВт — то есть примерно 20-кратное и 13,5-кратное преимущество соответственно.
Описание технологии 3D-DRAM в ИИ-ускорителе d-Matrix Raptor. Источник: .
Ключевая инженерная сложность 3D-DRAM — теплоотвод и надежность при высокой плотности упаковки. d-Matrix установила предел 0,5 Вт/мм² для 1-Hi стека, чтобы жидкостное охлаждение могло удерживать температуру DRAM ниже 100 °C. При 105 °C время удержания данных падает с 32 мс до 4 мс, требуя восьмикратного увеличения частоты регенерации, что угрожает потерей пропускной способности. Для компенсации d-Matrix разработала термо-ориентированное обновление и усовершенствованную ECC с кодом Рида-Соломона, межслойным размещением битов ECC/DBI в последних колонках подмассива. Благодаря этому потери полосы из-за регенерации удерживаются на уровне около 1,4%, сохраняя почти 100 ТБ/с.
Архитектура 3D-DRAM в ИИ-ускорителе d-Matrix Raptor. Источник: .
Дополнительно решены две нетривиальные задачи: проблема отображения банков и нехватки ширины канала, а также проблема энергопотребления ввода-вывода. Каждый тензорный движок требует 128-байтовый флит за обращение, но при 3 банках на канал одиночный доступ возвращает 96 байт, что вело бы к 33% перерасхода полосы. d-Matrix применяет stream blocking: четыре 96-байтовых доступа объединяются в три 128-байтовых флита, устраняя перерасход без дополнительного сдвигового буфера. Для экономии энергии переключений используется stream flipping — метод инверсии бит без выделенного пина DBI. Каждый флит сравнивается с предыдущим, и при необходимости инвертируется, сокращая переключения почти до нуля с накладными расходами 0,8%.
Эффективность 3D-DRAM в задачах ИИ-инференса. Источник: .
Надежность при отказе банков обеспечивается цепочкой банков (bank chaining). Уровень мультиплексирования позволяет обходить отказы, а 72 запасных банка на кристалл распределяются так, чтобы каналы оставались симметричными. Это важно, поскольку в конфигурации 840 банков (768 активных) даже одиночный сбой грозит деградацией всего канала.
Практическая производительность, заявленная d-Matrix: 72 карты Raptor в стойке обслуживают модель класса 3 трлн параметров с контекстом 1 млн токенов и 4-битными весами, обеспечивая около 1000 токенов в секунду на пользователя. В компании подчеркивают, что узкое место современного инференса — фаза декодирования, которая ограничена пропускной способностью памяти, и именно ее Raptor должен радикально ускорить.
d-Matrix Raptor — это архитектурная ставка на то, что пропускная способность памяти, а не объем, является главным ограничением для инференса больших моделей. d-Matrix предлагает радикально иной путь: вместо наращивания HBM-стеков рядом с чипом — разместить логику прямо на DRAM. Если заявленные цифры подтвердятся в реальных системах, Raptor может изменить баланс сил в сегменте инференс-ускорителей, где сегодня доминируют GPU с традиционной 2.5D-компоновкой. Однако остаются вопросы: насколько зрелой окажется технология в серийном производстве, как поведет себя память при длительной работе под нагрузкой и сможет ли d-Matrix масштабировать производство за пределы демонстрационных образцов. Тем не менее, уровень инженерной проработки, продемонстрированный на Hot Chips, указывает на то, что 3D-DRAM — не лабораторный курьез, а осмысленный тренд, за которым стоит следить.
При 105 °C время удержания данных падает до 4 мс, а регенерация съедает всего 1,4% полосы: значит, инженерам пришлось явно пожертвовать запасом по температуре ради сохранения заявленных 100 ТБ/с.
Serverflow
Вы правы, тепловой режим: ключевой компромисс, и 1,4% потерь достигнуты за счёт термо-ориентированного обновления и ECC.
Скидка 1 500 ₽ или бесплатная доставка - уже сейчас 🔥
Мы ценим обратную связь от клиентов. При оформлении заказа вы можете сообщить о своём намерении поделиться впечатлением о работе ServerFlow после получения товара.
* - скидка предоставляется при покупке от 30 000 рублей, в ином случае предусмотрена бесплатная доставка до ПВЗ СДЭК.
Продолжная использовать наш сайт, вы даете согласие на использование файлов Cookie, пользовательских данных (IP-адрес, вид операционной системы, тип браузера, сведения о местоположении, источник, откуда пришел на сайт пользователь, с какого сайта или по какой рекламе, какие страницы
открывает и на какие страницы нажимает пользователь) в целях функционирования сайта, проведения статистических исследований и обзоров. Если вы не хотите, чтобы ваши данные обрабатывались, покиньте сайт.
При оформлении заказа в ServerFlow вы можете сообщить о намерении оставить отзыв о нашей работе после получения товара.
Нам важно ваше честное мнение. Оно помогает развивать сервис и даёт другим клиентам представление о нашей работе.
Вы можете оставить отзыв на удобной для вас платформе:
Google Maps
2GIS
Яндекс Карты
Как работает акция
Применяя промокод, вы подтверждаете намерение поделиться впечатлением о работе ServerFlow после получения заказа. Мы применяем бонус уже к текущему заказу в знак благодарности за обратную связь.
Условия акции:
скидка 1 500 ₽ при заказе от 30 000 ₽
или бесплатная доставка* при заказе до 30 000 ₽
* Бесплатная доставка заказа осуществляется до ПВЗ СДЭК.