Top.Mail.Ru
Лучшие процессоры для искусственного интеллекта — как выбрать CPU для ИИ-сервера | Блог Serverflow Скачать
прайс-лист
Бесплатная
доставка по РФ
Бонус за
обратную связь
Интернет-магазин
Серверного оборудования
8 (800) 222-70-01 Консультация IT-специалиста Сравнение

Лучшие процессоры для искусственного интеллекта — как выбрать CPU для ИИ-сервера

~ 15 мин
118
Средний
Статьи
Лучшие процессоры для искусственного интеллекта — как выбрать CPU для ИИ-сервера

Введение

Интернет кишмя кишит статьями о том, как правильно выбрать ИИ-ускоритель, и это совсем неудивительно — фокс у всей ИИ-индустрии сместился в сторону GPU, NPU, TPU, и всех остальных PU, которые эффективно считают векторы и матрицы, чтобы обрабатывать веса и активации LLM. Центральные процессоры перестали вписываться в эту парадигму, их стали воспринимать как элемент, который не нужен для ИИ напрямую, но без него никуда — просто хост, который подает питание, маршрутизирует PCIe-линии и не вмешивается в работу нейросети. Однако времена, когда CPU выполнял только роль корневого комплекса для подключения ускорителей, стремительно уходят. С появлением агентного ИИ, мультиагентных систем и нагрузок, требующих плотного взаимодействия моделей с внешним миром, процессор снова стал критическим звеном, способным поднимать целые рои ИИ-агентов, выжимать максимум из ИИ-сервера или даже в соло запускать локальный инференс. В этой статье специалисты компании ServerFlow расскажут вам, почему процессор снова стал нужен для ИИ, какими характеристиками обладают лучшие CPU для искусственного интеллекта, какой класс процов появился в эпоху агентов и с какими проблемами можно столкнуться.

Почему процессор снова нужен для ИИ

Еще два года назад доминирующей нагрузкой были классические LLM, которые работали по принципу “получил промпт — сгенерировал ответ”. В таких сценариях все, что требовалось от CPU — это загрузить модель в память GPU, генерировать линии PCIe и обслуживать ввод-вывод. Ядра простаивали, частота была не критична, и даже скромный Xeon Gold с парой десятков ядер мог справлялся с подобными задачами без нареканий. Современные агентные системы устроены иначе. Агент не просто генерирует текст, он выполняет код, делает запросы к внешним API, шарит в интернете, обрабатывает результаты и передает их обратно в контекст модели. Вся эта оркестрация ложится именно на CPU, причем задержка выполнения одного агентного цикла напрямую влияет на отзывчивость системы в целом. Если у вас установлен ускоритель уровня Instinct MI350P, но под капотом — процессор с низкой однопоточной производительностью, то каждый вызов Python-функции или обращение к базе данных будет выполняться медленно, и дорогущий GPU окажется заложником тормознутого хоста. Из-за этого процессор в ИИ-сервере перестал быть рут-комплексом, а стал полноценным исполнительным движком агентной логики.

Сервер для инференса ИИ на база AMD EPYC
Сервер для инференса искусственного интеллекта на база центрального процессора AMD EPYC.

Характеристики лучшего процессора для ИИ

Пытаться найти идеальный процессор с совершенным соотношением ядер, потоков, частоты, линий PCIe и так далее — дело гиблое. На самом деле, лучший центральный процессор для искусственного интеллекта — это буквально идеальный универсальный процессор для всего. Ни перекос в сторону множества медленных ядер, ни ставка только на высокую частоту с малым числом ядер не подойдут. Идеальный CPU для ИИ — это крепкий серверный универсал, который одинаково хорош и в параллельной работе, и в однопоточных рывках, вроде AMD EPYC 9005F: порядка 64 ядер с заоблачной частотой за 5 ГГц — вот вам и нужный баланс. А теперь разложим, какие конкретные параметры делают процессор пригодным для ИИ-нагрузок. 

Количество ядер

Для современных агентных систем количество ядер определяет, сколько параллельных задач сможет обслуживать сервер. Каждый ИИ-агент порождает десятки процессов: выполнение сгенерированного кода, HTTP-запросы, обработка JSON, взаимодействие с базами данных. Если ядер не хватает, агенты выстраиваются в очередь, и общая пропускная способность падает. С другой стороны, гнаться за экстремальными 128-ядерными монстрами без оглядки на тактовую частоту — верный способ получить вялую однопоточку. Оптимальный баланс лежит в диапазоне 48-64 высокопроизводительных ядер: этого хватает для обслуживания десятков агентов и сопутствующих служб без потери отзывчивости.

Тактовая частота

Агентная логика, написанная на Python или JavaScript, критична к однопоточной производительности. Каждый вызов функции, сериализация данных или обработка HTTP — это операции, которые практически не распараллеливаются. Процессор с кучей ядер, но низкой частотой будет “заикаться” на таких задачах, создавая микро-задержки. Именно поэтому лучшими CPU для ИИ считаются модели с максимальной частотой в своем классе. Серии вроде EPYC 9005F (префикс Frequency Optimized) спроектированы именно под такие сценарии: много ядер и высокая частота одновременно.

AMD EPYC 9575F
64-ядерный CPU AMD EPYC 9575F с тактовой частотой до 5 ГГц станет отличным решением для построения ИИ-сервера.

Количество линий PCIe

Это первый аппаратный фильтр. Каждый современный GPU требует минимум 8 линий PCIe (а лучше 16), чтобы не стать узким горлом. Если планируется подключение четырех или восьми ускорителей, суммарная потребность легко переваливает за 100 линий. Десктопные платформы с их 20-28 линиями отпадают сразу — вы просто не воткнете больше двух карт. Серверные процессоры предлагают от 80 до 128 и более линий на сокет, что позволяет напрямую подключить до 8 GPU без промежуточных свичей. Поколение PCIe также важно: для высокоскоростных ускорителей уровня B200 или MI350P критично, чтобы шина не становилась бутылочным горлышком.

Подсистема памяти

Пропускная способность памяти — ахиллесова пята CPU по сравнению с GPU. Даже топовые серверные процессоры с 12 каналами DDR5 выдают порядка 460–500 ГБ/с, в то время как ускорители оперируют терабайтами. Однако для агентных нагрузок, RAG-систем и работы с большими контекстами важно, чтобы CPU мог быстро подавать данные агентам. Здесь ключевое правило — активировать все доступные каналы памяти и ставить максимальное количество модулей. Двухпроцессорные платформы с полной активацией каналов могут обеспечить суммарную полосу до 800–1000 ГБ/с, что хоть как-то сокращает разрыв.

Модули оперативной памяти LRDIMM
В ИИ-серверах для агентного ИИ крайне важен большой объем быстрой оперативной памяти.

Поддерживаемые инструкции

Для ИИ-нагрузок критически важна поддержка векторных расширений. AVX-512, присутствующая в современных Xeon и EPYC, дает кратный прирост в матричных операциях — именно то, что нужно для CPU-инференса или обработки эмбеддингов. Процессор без AVX-512 просто не сможет эффективно конкурировать даже в нишевых задачах. Кроме того, чем новее архитектура, тем выше IPC и эффективнее предсказатели ветвлений — все это напрямую ускоряет интерпретируемый код, характерный для ИИ-пайплайнов.

Проблема двухсокетных ИИ-северов

Если посмотреть на топовые HGX-серверы от Supermicro или эталонные DGX-системы, вы увидите, что они поголовно имеют по 2 сокета. Такая конфигурация дает больше ядер, больше каналов памяти и вдвое больше линий PCIe, но знающий человек сразу начнет задаваться вопросом — а как быть с NUMA-задержками?

Между процессорами работает скоростная межсоединительная шина: UPI у Intel Xeon и Infinity Fabric у AMD EPYC. Оба процессора выступают корнями PCIe, и когда ускоритель подключен к одному CPU, а данные лежат в памяти другого, возникает необходимость передачи данных через межпроцессорную шину. В агентных сценариях, где модель постоянно гоняет данные туда-сюда, эти задержки могут стать заметными и просадить производительность, да и в обычных ИИ-сценариях эта проблема не менее актуальна, особенно когда сервер под завязку забит GPU, подключенных к двум процам.

Решение — либо тщательная NUMA-привязка процессов и пулов памяти к тому процессору, к которому физически подключен GPU, либо использование PCIe-свичей. Свичи позволяют построить топологию, где ускорители видят единое адресное пространство без переходов через межпроцессорную шину. Но это дополнительные затраты и усложнение архитектуры. Именно поэтому выбор между одно- и двухпроцессорной платформой должен быть продиктован реальной необходимостью в линиях PCIe, а не просто желанием “поставить два сокета”. Так что если вы собираетесь делать топовую GPU-сборку с двумя сокетами для ИИ-задач, обязательно обратите внимание на наличие свича, либо покупайте односокетные варианты и не ломайте голову.

Двухпроцессорный сервер на базе AMD EPYC
Двухпроцессорный сервер на базе AMD EPYC для ИИ — возможный, но не самый лучший сценарий.

Intel vs AMD — чьи процессоры лучше подходят для ИИ

Серверный ландшафт на вторую половину 2020-х выглядит так: AMD уверенно доминирует в сегменте ИИ по соотношению производительности и энергоэффективности. EPYC 9005 серии с большим количеством ядер, высокой частотой и эффективной Infinity Fabric стали выбором по умолчанию для тех, кто строит ИИ-серверы. Intel с Xeon 6 (Granite Rapids) отстает: у него выше энергопотребление, а запутанная система нейминга не добавляет ясности. Хотя Xeon 6+ на подходе, пока EPYC воспринимается как стопроцентный вариант для ИИ.

Однако у Intel остается козырь — количество линий PCIe. У Intel линий больше, и они напрямую доступны для подключаемых устройств через UPI. У AMD буквально половина линий отводится под межчиплетный интерконнект Infinity Fabric, из-за чего их нельзя так же легко суммировать. Именно поэтому в системах уровня DGX B200 стоят Xeon: они позволяют набрать огромное количество линий (200+), не теряя половину на внутреннюю кухню. К тому же, NVIDIA не хочет кормить конкурента — зачем ставить процессоры AMD, если та сама производит ускорители Instinct? В итоге, если вам нужна максимальная плотность GPU на сокет и рекордное число линий PCIe, Intel еще держит позиции. Но для большинства же частных ИИ-серверов EPYC предпочтительнее: у него выше частота, лучше межпроцессорная связь и ниже энергопотребление.

AMD EPYC 9115 и Intel Xeon Gold 6154 для ИИ-сервера
Выбор между AMD EPYC и Intel Xeon для ИИ-сервера — вопрос того, какие возможности CPU для вас предпочтительнее.

ARM-процессоры для искусственного интеллекта

В облачной индустрии сформировался новый класс центральных процессоров, заточенных под агентные нагрузки, и почти все они строятся на архитектуре ARM. Выбор в пользу ARM объясняется не только энергоэффективностью, но и архитектурной гибкостью: лицензионная модель позволяет создавать кастомные ядра, а тесная интеграция с GPU через унифицированную память радикально снижает задержки при передаче данных между агентом и моделью. В x86 такая глубокая когерентность памяти пока достигается сложнее, да и тепловой пакет на ядро у традиционных серверных x86 выше, что ограничивает плотность развертывания. Именно поэтому гиперскейлеры и разработчики ИИ-фабрик все чаще заказывают специализированные ARM-процессоры, а не полагаются на универсальные x86-решения.
  • NVIDIA Grace — 72 ядра Arm Neoverse V2 (ARMv9), частота до 3,0 ГГц, техпроцесс 4 нм, унифицированная память LPDDR5X с пропускной способностью 500 ГБ/с, прямое соединение с GPU через NVLink-C2C. Применяется в суперчипах Grace Hopper и Grace Blackwell, где CPU и GPU видят единый пул памяти без копирования через PCIe.
  • NVIDIA Vera — 144 ядра Arm Neoverse V3 (ARMv9), частота до 3,6 ГГц, техпроцесс 3 нм, унифицированная память LPDDR6 с пропускной способностью 800 ГБ/с, прямое соединение с GPU через NVLink-C2C. Применяется в суперчипах Vera Rubin, где CPU и GPU видят единый пул памяти без копирования через PCIe.
  • AWS Graviton5 — 192 ядер Neoverse V3, частота до 3,0 ГГц, техпроцесс 3 нм, 12 каналов DDR5, пиковая пропускная способность 650 ГБ/с. Основной процессор для облачных инстансов Amazon, активно используется для инференса и легких агентных задач.
  • Microsoft Azure Cobalt 200 — 132 ядер Neoverse V3, частота до 3,2 ГГц, техпроцесс 3 нм, 8 каналов DDR5. Спроектирован специально под облачные сервисы Azure, включая AI-нагрузки типа инференса и оркестрации агентов.
  • ARM AGI — 136 ядра Neoverse V3 с встроенными тензорными ускорителями, частота до 3,7 ГГц, техпроцесс 3 нм, унифицированная память с пропускной способностью 1 ТБ/с. Ориентирован на самые тяжелые агентные сценарии и задачи, приближающиеся к AGI, с минимальной задержкой и максимальной плотностью вычислений.
Двухчиповая нода Nvidia Vera
Центральный процессор Nvidia Vera на архитектуре ARM для выполнения хост-функций в ИИ-сервере. Источник: Phoronix.

ИИ-инференс на CPU

Существует категория пользователей, которые до сих пор инференсят модели прямо на центральном процессоре. Сегодня эта идея в массе обречена на провал — с учетом реалий дефицита оперативной памяти DDR это буквально сделает вас банкротом. Однако есть задачи, которые можно сгрузить на CPU, например RAG-конвейеры или легкие модели, где инференс — часть общего пайплайна. Для такого сценария нужно сконцентрировать максимальную вычислительную мощность на CPU: как можно больше ядер, а частота уже не так сильно влияет, при условии что вы активируете все каналы. Для хорошего инференса процессор обязан поддерживать AVX-инструкции, а каналов памяти должно быть как можно больше. У видеокарты память работает быстро, а у процессора нет — это его самое уязвимое место. Можно даже инференсить на двух процессорах одновременно, но это далеко не самая распространенная задача. В общем, если вы эрудированный энтузиаст и понимаете, как правильно организовать ИИ-нагрузки в сервере, лучше отложить идею инференса на CPU, в долгий ящик, во всяком случае, пока цены на RAM не придут в норму.

AMD EPYC 9004
Для инференса ИИ на центральном процессоре важно выбирать чипы с максимальным количеством ядер, такие как AMD EPYC 9004 или EPYC 9005.

Выводы

Люди из разных сфер IT определяют процессор для ИИ по-разному. Один собирает ИИ-ПК и инференсит небольшие модели локально, другой строит сервер, где сила в PCIe-линках и восьми ИИ-ускорителях, третий разворачивает агентную платформу, где CPU должен молотить код 24/7. Но если обобщить весь этот сыр-бор, то вывод один: лучший процессор для ИИ сегодня — это лучший серверный процессор общего назначения с упором на высокую тактовую частоту, достаточное количество ядер и большое число линий PCIe. И никогда не недооценивайте значимость процессоров в ИИ-сервере: без правильного CPU самый мощный ускоритель упрется в тормозной хост, как спорткар в городские пробки. А если вы сомневаетесь в выборе подходящего CPU — просто обращайтесь в ServerFlow. Мы поможем собрать сбалансированный ИИ-сервер под ваши задачи, предложим лучшие комплектующие под сценарий использования платформы и проведем вас за руку от покупки системы до ее развертывания в продакшене.
Автор: Serverflow Serverflow
Поделиться

Комментарии 1

Написать комментарий
Руслан
Хорошо, что упомянули NUMA-задержки в двухсокетных конфигурациях. На практике без привязки процессов к конкретному процессору и его памяти теряется до 20% пропускной способности агентов.
Написать отзыв
До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Написать комментарий

Комментарий появится на сайте после предварительной модерации

До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Мы свяжемся с вами утром

График работы: Пн-Пт 10:00-18:30 (по МСК)

Обработаем вашу заявку
в ближайший рабочий день

График работы: Пн-Пт 10:00-18:30 (по МСК)