Интернет кишмя кишит статьями о том, как правильно выбрать ИИ-ускоритель, и это совсем неудивительно — фокс у всей ИИ-индустрии сместился в сторону GPU, NPU, TPU, и всех остальных PU, которые эффективно считают векторы и матрицы, чтобы обрабатывать веса и активации LLM. Центральные процессоры перестали вписываться в эту парадигму, их стали воспринимать как элемент, который не нужен для ИИ напрямую, но без него никуда — просто хост, который подает питание, маршрутизирует PCIe-линии и не вмешивается в работу нейросети. Однако времена, когда CPU выполнял только роль корневого комплекса для подключения ускорителей, стремительно уходят. С появлением агентного ИИ, мультиагентных систем и нагрузок, требующих плотного взаимодействия моделей с внешним миром, процессор снова стал критическим звеном, способным поднимать целые рои ИИ-агентов, выжимать максимум из ИИ-сервера или даже в соло запускать локальный инференс. В этой статье специалисты компании ServerFlow расскажут вам, почему процессор снова стал нужен для ИИ, какими характеристиками обладают лучшие CPU для искусственного интеллекта, какой класс процов появился в эпоху агентов и с какими проблемами можно столкнуться.
Почему процессор снова нужен для ИИ
Еще два года назад доминирующей нагрузкой были классические LLM, которые работали по принципу “получил промпт — сгенерировал ответ”. В таких сценариях все, что требовалось от CPU — это загрузить модель в память GPU, генерировать линии PCIe и обслуживать ввод-вывод. Ядра простаивали, частота была не критична, и даже скромный Xeon Gold с парой десятков ядер мог справлялся с подобными задачами без нареканий. Современные агентные системы устроены иначе. Агент не просто генерирует текст, он выполняет код, делает запросы к внешним API, шарит в интернете, обрабатывает результаты и передает их обратно в контекст модели. Вся эта оркестрация ложится именно на CPU, причем задержка выполнения одного агентного цикла напрямую влияет на отзывчивость системы в целом. Если у вас установлен ускоритель уровня Instinct MI350P, но под капотом — процессор с низкой однопоточной производительностью, то каждый вызов Python-функции или обращение к базе данных будет выполняться медленно, и дорогущий GPU окажется заложником тормознутого хоста. Из-за этого процессор в ИИ-сервере перестал быть рут-комплексом, а стал полноценным исполнительным движком агентной логики.
Сервер для инференса искусственного интеллекта на база центрального процессора AMD EPYC.
Характеристики лучшего процессора для ИИ
Пытаться найти идеальный процессор с совершенным соотношением ядер, потоков, частоты, линий PCIe и так далее — дело гиблое. На самом деле, лучший центральный процессор для искусственного интеллекта — это буквально идеальный универсальный процессор для всего. Ни перекос в сторону множества медленных ядер, ни ставка только на высокую частоту с малым числом ядер не подойдут. Идеальный CPU для ИИ — это крепкий серверный универсал, который одинаково хорош и в параллельной работе, и в однопоточных рывках, вроде AMD EPYC 9005F: порядка 64 ядер с заоблачной частотой за 5 ГГц — вот вам и нужный баланс. А теперь разложим, какие конкретные параметры делают процессор пригодным для ИИ-нагрузок.
Количество ядер
Для современных агентных систем количество ядер определяет, сколько параллельных задач сможет обслуживать сервер. Каждый ИИ-агент порождает десятки процессов: выполнение сгенерированного кода, HTTP-запросы, обработка JSON, взаимодействие с базами данных. Если ядер не хватает, агенты выстраиваются в очередь, и общая пропускная способность падает. С другой стороны, гнаться за экстремальными 128-ядерными монстрами без оглядки на тактовую частоту — верный способ получить вялую однопоточку. Оптимальный баланс лежит в диапазоне 48-64 высокопроизводительных ядер: этого хватает для обслуживания десятков агентов и сопутствующих служб без потери отзывчивости.
Тактовая частота
Агентная логика, написанная на Python или JavaScript, критична к однопоточной производительности. Каждый вызов функции, сериализация данных или обработка HTTP — это операции, которые практически не распараллеливаются. Процессор с кучей ядер, но низкой частотой будет “заикаться” на таких задачах, создавая микро-задержки. Именно поэтому лучшими CPU для ИИ считаются модели с максимальной частотой в своем классе. Серии вроде EPYC 9005F (префикс Frequency Optimized) спроектированы именно под такие сценарии: много ядер и высокая частота одновременно.
64-ядерный CPU AMD EPYC 9575F с тактовой частотой до 5 ГГц станет отличным решением для построения ИИ-сервера.
Количество линий PCIe
Это первый аппаратный фильтр. Каждый современный GPU требует минимум 8 линий PCIe (а лучше 16), чтобы не стать узким горлом. Если планируется подключение четырех или восьми ускорителей, суммарная потребность легко переваливает за 100 линий. Десктопные платформы с их 20-28 линиями отпадают сразу — вы просто не воткнете больше двух карт. Серверные процессоры предлагают от 80 до 128 и более линий на сокет, что позволяет напрямую подключить до 8 GPU без промежуточных свичей. Поколение PCIe также важно: для высокоскоростных ускорителей уровня B200 или MI350P критично, чтобы шина не становилась бутылочным горлышком.
Подсистема памяти
Пропускная способность памяти — ахиллесова пята CPU по сравнению с GPU. Даже топовые серверные процессоры с 12 каналами DDR5 выдают порядка 460–500 ГБ/с, в то время как ускорители оперируют терабайтами. Однако для агентных нагрузок, RAG-систем и работы с большими контекстами важно, чтобы CPU мог быстро подавать данные агентам. Здесь ключевое правило — активировать все доступные каналы памяти и ставить максимальное количество модулей. Двухпроцессорные платформы с полной активацией каналов могут обеспечить суммарную полосу до 800–1000 ГБ/с, что хоть как-то сокращает разрыв.
В ИИ-серверах для агентного ИИ крайне важен большой объем быстрой оперативной памяти.
Поддерживаемые инструкции
Для ИИ-нагрузок критически важна поддержка векторных расширений. AVX-512, присутствующая в современных Xeon и EPYC, дает кратный прирост в матричных операциях — именно то, что нужно для CPU-инференса или обработки эмбеддингов. Процессор без AVX-512 просто не сможет эффективно конкурировать даже в нишевых задачах. Кроме того, чем новее архитектура, тем выше IPC и эффективнее предсказатели ветвлений — все это напрямую ускоряет интерпретируемый код, характерный для ИИ-пайплайнов.
Проблема двухсокетных ИИ-северов
Если посмотреть на топовые HGX-серверы от Supermicro или эталонные DGX-системы, вы увидите, что они поголовно имеют по 2 сокета. Такая конфигурация дает больше ядер, больше каналов памяти и вдвое больше линий PCIe, но знающий человек сразу начнет задаваться вопросом — а как быть с NUMA-задержками?
Между процессорами работает скоростная межсоединительная шина: UPI у Intel Xeon и Infinity Fabric у AMD EPYC. Оба процессора выступают корнями PCIe, и когда ускоритель подключен к одному CPU, а данные лежат в памяти другого, возникает необходимость передачи данных через межпроцессорную шину. В агентных сценариях, где модель постоянно гоняет данные туда-сюда, эти задержки могут стать заметными и просадить производительность, да и в обычных ИИ-сценариях эта проблема не менее актуальна, особенно когда сервер под завязку забит GPU, подключенных к двум процам.
Решение — либо тщательная NUMA-привязка процессов и пулов памяти к тому процессору, к которому физически подключен GPU, либо использование PCIe-свичей. Свичи позволяют построить топологию, где ускорители видят единое адресное пространство без переходов через межпроцессорную шину. Но это дополнительные затраты и усложнение архитектуры. Именно поэтому выбор между одно- и двухпроцессорной платформой должен быть продиктован реальной необходимостью в линиях PCIe, а не просто желанием “поставить два сокета”. Так что если вы собираетесь делать топовую GPU-сборку с двумя сокетами для ИИ-задач, обязательно обратите внимание на наличие свича, либо покупайте односокетные варианты и не ломайте голову.
Двухпроцессорный сервер на базе AMD EPYC для ИИ — возможный, но не самый лучший сценарий.
Intel vs AMD — чьи процессоры лучше подходят для ИИ
Серверный ландшафт на вторую половину 2020-х выглядит так: AMD уверенно доминирует в сегменте ИИ по соотношению производительности и энергоэффективности. EPYC 9005 серии с большим количеством ядер, высокой частотой и эффективной Infinity Fabric стали выбором по умолчанию для тех, кто строит ИИ-серверы. Intel с Xeon 6 (Granite Rapids) отстает: у него выше энергопотребление, а запутанная система нейминга не добавляет ясности. Хотя Xeon 6+ на подходе, пока EPYC воспринимается как стопроцентный вариант для ИИ.
Однако у Intel остается козырь — количество линий PCIe. У Intel линий больше, и они напрямую доступны для подключаемых устройств через UPI. У AMD буквально половина линий отводится под межчиплетный интерконнект Infinity Fabric, из-за чего их нельзя так же легко суммировать. Именно поэтому в системах уровня DGX B200 стоят Xeon: они позволяют набрать огромное количество линий (200+), не теряя половину на внутреннюю кухню. К тому же, NVIDIA не хочет кормить конкурента — зачем ставить процессоры AMD, если та сама производит ускорители Instinct? В итоге, если вам нужна максимальная плотность GPU на сокет и рекордное число линий PCIe, Intel еще держит позиции. Но для большинства же частных ИИ-серверов EPYC предпочтительнее: у него выше частота, лучше межпроцессорная связь и ниже энергопотребление.
Выбор между AMD EPYC и Intel Xeon для ИИ-сервера — вопрос того, какие возможности CPU для вас предпочтительнее.
ARM-процессоры для искусственного интеллекта
В облачной индустрии сформировался новый класс центральных процессоров, заточенных под агентные нагрузки, и почти все они строятся на архитектуре ARM. Выбор в пользу ARM объясняется не только энергоэффективностью, но и архитектурной гибкостью: лицензионная модель позволяет создавать кастомные ядра, а тесная интеграция с GPU через унифицированную память радикально снижает задержки при передаче данных между агентом и моделью. В x86 такая глубокая когерентность памяти пока достигается сложнее, да и тепловой пакет на ядро у традиционных серверных x86 выше, что ограничивает плотность развертывания. Именно поэтому гиперскейлеры и разработчики ИИ-фабрик все чаще заказывают специализированные ARM-процессоры, а не полагаются на универсальные x86-решения.
NVIDIA Grace — 72 ядра Arm Neoverse V2 (ARMv9), частота до 3,0 ГГц, техпроцесс 4 нм, унифицированная память LPDDR5X с пропускной способностью 500 ГБ/с, прямое соединение с GPU через NVLink-C2C. Применяется в суперчипах Grace Hopper и Grace Blackwell, где CPU и GPU видят единый пул памяти без копирования через PCIe.
NVIDIA Vera — 144 ядра Arm Neoverse V3 (ARMv9), частота до 3,6 ГГц, техпроцесс 3 нм, унифицированная память LPDDR6 с пропускной способностью 800 ГБ/с, прямое соединение с GPU через NVLink-C2C. Применяется в суперчипах Vera Rubin, где CPU и GPU видят единый пул памяти без копирования через PCIe.
AWS Graviton5 — 192 ядер Neoverse V3, частота до 3,0 ГГц, техпроцесс 3 нм, 12 каналов DDR5, пиковая пропускная способность 650 ГБ/с. Основной процессор для облачных инстансов Amazon, активно используется для инференса и легких агентных задач.
Microsoft Azure Cobalt 200 — 132 ядер Neoverse V3, частота до 3,2 ГГц, техпроцесс 3 нм, 8 каналов DDR5. Спроектирован специально под облачные сервисы Azure, включая AI-нагрузки типа инференса и оркестрации агентов.
ARM AGI — 136 ядра Neoverse V3 с встроенными тензорными ускорителями, частота до 3,7 ГГц, техпроцесс 3 нм, унифицированная память с пропускной способностью 1 ТБ/с. Ориентирован на самые тяжелые агентные сценарии и задачи, приближающиеся к AGI, с минимальной задержкой и максимальной плотностью вычислений.
Центральный процессор Nvidia Vera на архитектуре ARM для выполнения хост-функций в ИИ-сервере. Источник: .
ИИ-инференс на CPU
Существует категория пользователей, которые до сих пор инференсят модели прямо на центральном процессоре. Сегодня эта идея в массе обречена на провал — с учетом реалий дефицита оперативной памяти DDR это буквально сделает вас банкротом. Однако есть задачи, которые можно сгрузить на CPU, например RAG-конвейеры или легкие модели, где инференс — часть общего пайплайна. Для такого сценария нужно сконцентрировать максимальную вычислительную мощность на CPU: как можно больше ядер, а частота уже не так сильно влияет, при условии что вы активируете все каналы. Для хорошего инференса процессор обязан поддерживать AVX-инструкции, а каналов памяти должно быть как можно больше. У видеокарты память работает быстро, а у процессора нет — это его самое уязвимое место. Можно даже инференсить на двух процессорах одновременно, но это далеко не самая распространенная задача. В общем, если вы эрудированный энтузиаст и понимаете, как правильно организовать ИИ-нагрузки в сервере, лучше отложить идею инференса на CPU, в долгий ящик, во всяком случае, пока цены на RAM не придут в норму.
Для инференса ИИ на центральном процессоре важно выбирать чипы с максимальным количеством ядер, такие как AMD EPYC 9004 или EPYC 9005.
Выводы
Люди из разных сфер IT определяют процессор для ИИ по-разному. Один собирает ИИ-ПК и инференсит небольшие модели локально, другой строит сервер, где сила в PCIe-линках и восьми ИИ-ускорителях, третий разворачивает агентную платформу, где CPU должен молотить код 24/7. Но если обобщить весь этот сыр-бор, то вывод один: лучший процессор для ИИ сегодня — это лучший серверный процессор общего назначения с упором на высокую тактовую частоту, достаточное количество ядер и большое число линий PCIe. И никогда не недооценивайте значимость процессоров в ИИ-сервере: без правильного CPU самый мощный ускоритель упрется в тормозной хост, как спорткар в городские пробки. А если вы сомневаетесь в выборе подходящего CPU — просто обращайтесь в ServerFlow. Мы поможем собрать сбалансированный ИИ-сервер под ваши задачи, предложим лучшие комплектующие под сценарий использования платформы и проведем вас за руку от покупки системы до ее развертывания в продакшене.
Хорошо, что упомянули NUMA-задержки в двухсокетных конфигурациях. На практике без привязки процессов к конкретному процессору и его памяти теряется до 20% пропускной способности агентов.
Скидка 1 500 ₽ или бесплатная доставка - уже сейчас 🔥
Мы ценим обратную связь от клиентов. При оформлении заказа вы можете сообщить о своём намерении поделиться впечатлением о работе ServerFlow после получения товара.
* - скидка предоставляется при покупке от 30 000 рублей, в ином случае предусмотрена бесплатная доставка до ПВЗ СДЭК.
Продолжная использовать наш сайт, вы даете согласие на использование файлов Cookie, пользовательских данных (IP-адрес, вид операционной системы, тип браузера, сведения о местоположении, источник, откуда пришел на сайт пользователь, с какого сайта или по какой рекламе, какие страницы
открывает и на какие страницы нажимает пользователь) в целях функционирования сайта, проведения статистических исследований и обзоров. Если вы не хотите, чтобы ваши данные обрабатывались, покиньте сайт.
При оформлении заказа в ServerFlow вы можете сообщить о намерении оставить отзыв о нашей работе после получения товара.
Нам важно ваше честное мнение. Оно помогает развивать сервис и даёт другим клиентам представление о нашей работе.
Вы можете оставить отзыв на удобной для вас платформе:
Google Maps
2GIS
Яндекс Карты
Как работает акция
Применяя промокод, вы подтверждаете намерение поделиться впечатлением о работе ServerFlow после получения заказа. Мы применяем бонус уже к текущему заказу в знак благодарности за обратную связь.
Условия акции:
скидка 1 500 ₽ при заказе от 30 000 ₽
или бесплатная доставка* при заказе до 30 000 ₽
* Бесплатная доставка заказа осуществляется до ПВЗ СДЭК.