Top.Mail.Ru
Nvidia DGX Spark или AMD Ryzen AI Max+ 395: какой мини-ПК для локальных LLM выбрать? | Блог Serverflow Скачать
прайс-лист
Бесплатная
доставка по РФ
Бонус за
обратную связь
В связи с праздником в Китае 25 сентября срок уточнения цен, наличия и срок поставки будет увеличен. Благодарим за понимание!
Интернет-магазин
Серверного оборудования
8 (800) 222-70-01 Консультация IT-специалиста Сравнение

Nvidia DGX Spark или AMD Ryzen AI Max+ 395: какой мини-ПК для локальных LLM выбрать?

~ 15 мин
1793
Средний
Статьи
Nvidia DGX Spark или AMD Ryzen AI Max+ 395: какой мини-ПК для локальных LLM выбрать?

Введение

Локальный запуск искусственного интеллекта в современности перестал быть развлечением закаленных ИИ-гиков с GPU-серверами и мощными ИИ-ускорителями — на рынок вышли системы, которые умещаются буквально в углу рабочего стола, но способные тянуть модели на десятки или даже сотни миллиардов параметров. Эти устройства получили лаконичное название “ИИ-ПК”, на полную эксплуатирующие концепцию унифицированной памяти и эффективно миксующие мощности CPU, GPU, а иногда и NPU, в едином корпусе. Такую перспективную нишу сразу же заняли две акулы ИИ-бизнеса: Nvidia со своим “эталонным” DGX Spark GB10 и AMD с недавно выпущенной Ryzen AI Halo. И многие юзеры встали в ступор — а что же выбрать? С одной стороны, CUDA, FP4 и 128 ГБ памяти, но за раздутый прайс. С другой стороны — бюджетный ценник, отличная производительность и все те же 128 ГБ. Сложный вопрос, не правда ли? Вовсе нет, ведь в этой статье специалисты компании ServerFlow разберут по винтикам два топовых ИИ-ПК, расскажут об их плюсах и минусах, подробно опишут характеристики и, конечно же, расскажут о платформах-аналогах. 

Что такое Nvidia DGX Spark

Nvidia DGX Spark, анонсированный на GTC 2025, — это устройство, которое и породило сам термин компактных “ИИ-ПК”, и ставшее прямым развитием корпоративных DGX-систем, но в настольном формате. По сути, перед нами полноценная ИИ-фабрика в миниатюре, ведь в ней все спроектировано для достижения максимальной ИИ-производительности локального ИИ-инференса.

Компоненты ИИ-ПК Nvidia DGX Spark
Компоненты ИИ-ПК Nvidia DGX Spark. Источник: Nvidia.

Сердцем DGX Spark служит суперчип GB10, представляющий из себя связку ARM-CPU Grace с 20 ядрами Neoverse V2 и GPU на флагманской архитектуре Blackwell (аналог кристалла RTX 5070, но с большим количеством тензорных ядер), объединенные интерконнектом NVLink C2C. Этот чип способен выжать из себя до 500 TFLOPS в FP4 (без структурной разряженности). 

Nvidia GB10
Nvidia GB10. Источник: ComputerBase.

Чтобы эта лошадка тянула тяжелые локальные LLM, DGX Spark имеет пул из 128 ГБ унифицированной памяти LPDDR5X с пропускной способностью 273 ГБ/с — в такую память спокойно можно загружать нейронки объемом 120 миллиардов параметров, вроде GPT-OSS, а благодаря мощному суперчипу вы будете получать скорость инференса на уровне 50-70 токенов в секунду. Но главная фишка Spark — поддержка формата вычислений FP4, который позволяет запускать нейронки в формате весов NVFP4 с огромной скоростью. Тензорные ядра Blackwell 5-ого поколения оптимизированны эффективно работать с этим форматом, что позволяет в 2 раза поднять пропускную способность по сравнению с FP8 и запускать в 2 раза более крупные модели в том же объеме памяти.

Плата ИИ-ПК Nvidia DGX Spark
Плата ИИ-ПК Nvidia DGX Spark. На одной подложке с SoC-чипом GB10 расположены микросхемы LPDDR5X. Источник: ServeTheHome.

Конечно же, мы не могли не пройти мимо еще одного козыря Хуанга — поддержки программной экосистемы CUDA, которая всегда была и остается самой зрелой средой для ИИ-разработки. DGX Spark получает к ней полный доступ без каких-либо ограничений: PyTorch, TensorRT-LLM, кастомные CUDA-ядра — все это работает на “ИИ-коробке прямо из коробки”.

Но за ширмой обильных похвал, весьма легко можно разглядеть и ряд весьма внушительных недостатков DGX Spark, главным из которых, наверное, является его цена. За ИИ-бокс нужно отдать аж $4,699, и это может показаться вполне оправданным, пока не всплывают другие подводные камни. Дело в том, что действительно быстро на DGX Spark запускаются только модели в формате NVFP4, тогда как нейронки в более популярном формате FP8 запускаются с умеренными 35 токенов в секунду в случае с той же GPT-OSS-120b, так как ошеломительные 500 TFLOPS в NVFP4 превращаются в 250 TFLOPS при переходе на FP8.

Однако главный козырь Spark, который часто замалчивают — сетевые возможности. В то время как AMD в своем Ryzen AI Halo установила обычную 10-Гбит/с сетевую карту (и пытается компенсировать это программным RDMA, что создает лишнюю нагрузку на CPU), DGX Spark оснащается выделенным ConnectX-7 на 200 Гбит/с с аппаратной поддержкой GPUDirect RDMA. Это позволяет объединять до трех Spark-станций в бесшовный кластер с микросекундными задержками, без потери производительности на пересылку данных — то, о чем AMD может только мечтать. Именно за эту сетевую инфраструктуру, полноценную экосистему CUDA и уникальный FP4-движок Nvidia просит дополнительные $700: вы платите не просто за коробку, а за готовое решение для профессионального инференса, где сеть и память не становятся узким горлышком даже при работе с моделями под 200 млрд параметров.

Сетевые карты ConnectX-7 для объединения DGX Spark в кластеры
Сетевая карта ConnectX-7, интегрированная в Nvidi DGX Spark, позволяет бесшовно объединять до 3 ИИ-ПК без дополнительных программных утилит и настройки топологии. Источник: ServeTheHome.

Что такое AMD Ryzen AI Halo 

AMD Ryzen AI Halo — это принципиально другой зверь, запущенный на рынок в июне 2026 как противопоставление доминации DGX Spark на рынке ИИ-ПК. 

Компоненты AMD Ryzen AI Halo
Компоненты AMD Ryzen AI Halo. Источник: AMD.

Вместо специализированного ИИ-ускорителя AMD объединила на одном кристалле Strix Halo Ryzen AI Max+ 395 три компонента: 16 ядер Zen 5 (x86-64), графику RDNA 3.5 с 40 вычислительными блоками и выделенный нейросетевой движок XDNA 2, связка из которых обеспечивает 126 TOPS производительности — в два раза меньше, чем у Spark с его 250 TOPS без структурной разряженности. Все три работают с единым пулом унифицированной памяти LPDDR5X объемом до 128 ГБ и пропускной способностью около 273 ГБ/с. Форматов вычислений хватает на любой случай жизни: FP16, BF16, INT8 и INT4 поддерживаются на аппаратном уровне.

Плата ИИ-ПК AMD Ryzen AI Halo
Плата ИИ-ПК AMD Ryzen AI Halo на базе чипа Ryzen AI Max+ 395. Источник: StorageReview.

Главное преимущество Ryzen AI Halo перед специализированными ИИ-станциями — это универсальность. В отличие от ARM-решений, которые требуют эмуляции для совместимости с проприетарным софтом, в решении AMD стоит полноценный x86-процессор, на котором спокойно работает абсолютно любой софт. Утром можно генерировать токены на Qwen-3.6-27B через Ollama, днем монтировать видео в Premiere Pro, а вечером работать в CAD-системе — все на одной машине.

Что касается чисто ИИ-софта, Strix Halo использует ПО-стек ROCm под Linux, который уже достаточно созрел для запуска PyTorch, ONNX Runtime и vLLM. Windows-пользователи могут положиться на DirectML или Vulkan-бэкенды, которые поддерживаются в llama.cpp, Ollama и LM Studio. Количество токенов здесь ниже, чем у Blackwell с его аппаратным FP4 но в иных форматах они идут на равных, а универсальность и совместимость с корпоративным окружением перевешивают плюсы DGX Spark. А цена на ИИ-бокс AMD — всего $3999, аж на 700 баксов дешевле решения Nvidia. В комплекте также есть и возможность кластеризации до 4 узлов, и это еще один камень в огород Nvidia.

AMD Ryzen AI Halo
AMD Ryzen AI Halo. Источник: StorageReview.

А теперь ознакомимся с небольшой табличкой, чтобы наглядно сравнить характеристики двух компактных ИИ-ПК:

Характеристика

AMD Halo Box

NVIDIA DGX Spark

Процессор (CPU)

AMD Ryzen AI Max+ PRO 395, 16 ядер/32 потока, Zen 5

NVIDIA GB10 Grace Blackwell Superchip

20-ядерный ARM (10x Cortex-X925 + 10x Cortex-A725)

GPU

Radeon 8060S (RDNA 3.5), 40 вычислительных блоков

Blackwell, 6144 ядер CUDA, 384 тензорных ядер 5-го поколения

NPU

XDNA 2 NPU до 50 TOPS

-

Основная память

128 ГБ LPDDR5X-8000, 256 ГБ/с

128 ГБ LPDDR5X-8533, 273 ГБ/с

Сеть

1x 2.5GbE RJ-45

1x 10GbE RJ-45, 2x 200GbE QSFP28 ConnectX-7 Smart NIC

Хранилище

2x M.2 2280 PCIe 5.0 (макс. 8 ТБ)

1x M.2 2242 PCIe 5.0 NVMe (макс. 4 ТБ)

Производительность FP8

126 TOPS

500 TOPS (со структурной разряженностью)

Производительность FP4

-

1000 TOPS (со структурной разряженностью)

Цена

$3 999

$4 699


CUDA против ROCm

Производительность ИИ-системы никогда не определяется только терафлопсами. Вопрос в том, запустится ли нужный фреймворк без плясок с бубном. Давайте вспомним, чем же отличаются CUDA и ROCm и как это влияет на инференсе с помощью DGX Spark и Ryzen AI Halo.
  • CUDA остается золотым стандартом. Подавляющее большинство инструментов, таких как PyTorch, TensorFlow, TensorRT, vLLM, оптимизированы именно под Nvidia. Любой разработчик, скачавший свежую библиотеку, знает: на DGX Spark она заработает. Десятилетие доминирования CUDA в ИИ-разработке создало инерцию, которую трудно переломить, поэтому даже ИИ-экзотика запускается на CUDA без компромиссов.
Экосистема NVIDIA CUDA
Экосистема NVIDIA. Источник: NVIDIA. 
  • ROCm активно развивается. Под Linux экосистема AMD уже достаточно созрела: PyTorch, ONNX Runtime, vLLM работают с RDNA 3.5 без проблем. Однако пользователи Windows сталкиваются с ограничениями — официальной поддержки ROCm там нет, приходится использовать Vulkan-бэкенды. Инструменты вроде llama.cpp и Ollama умеют работать с AMD через ROCm или Vulkan. Open WebUI, будучи веб-оберткой, от железа их запуск не зависит вообще. Но экзотические фреймворки или тонкая оптимизация — это почти всегда прерогатива CUDA.
Экосистема AMD ROCm
Экосистема AMD ROCm. Источник: AMD ROCm Documentation. 

Какие модели и движки можно запускать локально

Обе системы справляются с современными открытыми моделями, но нюансы есть. DGX Spark с его поддержкой FP4 позволяет загрузить Qwen3.6-72B в чистом 4-битном формате — такая модель занимает около 35 ГБ. Оставшиеся 90+ ГБ можно отдать под KV-кэш, получая контекст в десятки тысяч токенов без деградации скорости. Более того, FP4 и TensorRT-LLM открывают дорогу к запуску сверхтяжелых MoE-архитектур уровня DeepSeek V4 с мощной квантизацией. Активная часть модели помещается в памяти целиком, а эксперты подкачиваются из NVMe-диска.

Ryzen AI Max+ 395 также берет 72-миллиардные модели, но использует именно GGUF-квантование Q4_K_M. Такая модель весит около 40 ГБ, и со 128 ГБ на борту остается примерно 80 ГБ под контекст и системные нужды. Пиковая скорость генерации токенов здесь ниже, чем на Blackwell, так как производительность Ryzen AI Max+ 395 в два раза отстает от Spark, зато через Ollama можно одновременно держать загруженными две-три модели поменьше, например Qwen-3.6-32B или Gemma 4 27b, и переключаться между ними без перезагрузки. Модели до 30 миллиардов параметров летают на обеих платформах без каких-либо проблем. Монстры в FP16 уровня DeepSeek-V4 Pro (1,6T) или Qwen-3.6-397B-A17B (397B, 17B) пока не по зубам ни одной из этих систем, даже если объединять их в кластеры.

Но важно понимать, что в отличие от универсального “швейцарского ножа” AMD, DGX Spark — это узкоспециализированный ИИ-акселератор, и его сила раскрывается именно в работе с большими языковыми моделями. Да, на Spark без проблем запускается и llama.cpp с любыми квантованиями (вплоть до INT8 и INT4), и даже популярный формат Q4_K_M физически поддерживается, но использовать его здесь попросту бессмысленно: аппаратные тензорные ядра Blackwell пятого поколения оптимизированы под собственный формат NVFP4, который дает вдвое большую пропускную способность (500 TFLOPS против 250 в FP8) и, что критичнее, значительно более широкий динамический диапазон, чем у классических INT4-квантований. Это означает, что модель в NVFP4 выдает качество, близкое к FP16, при тех же затратах памяти и скорости, что и INT4, тогда как Q4_K_M на Spark будет работать медленнее и с худшим качеством, просто потому что железо заточено под другой стандарт. 

Аналоги DGX Spark и AI Halo

Рынок не ограничивается дуэтом Nvidia и AMD. Apple, Intel и Qualcomm также поставляют свои процессоры для выпуска компактных ИИ-ПК, которые предлагают неплохие ИИ-возможности за более бюджетный или эквивалентный прайс. 
  • Apple Mac Studio (M3 Ultra) — профессиональная рабочая станция в компактном корпусе, которая делает ставку на огромный объем унифицированной памяти и рекордную пропускную способность, что критично для инференса больших языковых моделей. Чип M3 Ultra включает 28‑ядерный CPU, 60‑ядерный GPU и 32‑ядерный Neural Engine, поддерживает до 128 ГБ унифицированной памяти. Базовая конфигурация (96 ГБ памяти + 1 ТБ SSD) стартует от $3,999.
Apple Mac Studio
Apple Mac Studio на базе чипов M3 Ultra. Источник: Ebay.
  • GMKtec EVO‑T2 — компактный мини‑ПК на базе новейших процессоров Intel Core Ultra серии 3 (Panther Lake, техпроцесс Intel 18A). Флагманские чипы Core Ultra X7 358H / X9 388H предлагают 16 ядер, встроенную графику Intel Arc B390 (производительность на уровне RTX 4050 Laptop GPU), а общая производительность достигает 180 TOPS. Устройство поддерживает 64 ГБ общей памяти LPDDR5X‑8533 и до 16 ТБ хранилища. Стартовая цена составляет $1,899.
GMKtec EVO‑T2
GMKtec EVO‑T2 на базе Intel Core Ultra 3. Источник: GMKtec.
  • ASUS Ascent QN10 — первый в мире мини‑ПК с NPU мощностью 80 TOPS, построенный на Snapdragon X2 Elite. Чип содержит 18‑ядерный Qualcomm Oryon CPU, интегрированный Adreno X2 GPU и Hexagon NPU с производительностью 80 TOPS. Устройство поддерживает до 32 ГБ LPDDR5x 9600 МГц. Цена и дата выхода официально не объявлены.
ASUS Ascent QN10
ASUS Ascent QN10 на базе Snapdragon X2 Elite. Источник: ComputerBase.

Выводы

Универсального победителя здесь нет, и выбор сводится к простому вопросу: что для вас важнее — максимальная ИИ-производительность и возможности CUDA или универсальность и более бюджетный прайс. Если вы ИИ-энтузиаст, который только и делает, что работает с нейронками — DGX Spark ваш инструмент. Если же вам нужна одна машина для всего — и для нейросетей, и для монтажа видео, и для CAD — Ryzen AI Halo будет сбалансированнее. А если вы совсем отважный, то можете попробовать обзавестись альтернативными вариантами на базе Intel и Qualcomm. В любом случае, рынок персональных ИИ-ПК очень молод и все еще не сформировался окончательно, и не исключено, что скоро совершенно новый игрок выйдет в этот сегмент со своим решением, которое растопчет и AMD, и Nvidia. А пока пусть красные и зеленые продолжают свою здоровую конкуренцию, внося новые инновации в индустрию потребительского ИИ-инференса.
Автор: Serverflow Serverflow
Поделиться

Комментарии 2

Написать комментарий
Вячеслав
В статье написано, что NVFP4 даёт качество близкое к FP16 при тех же затратах, что и INT4. Если это так, то GGUF Q4_K_M на Spark действительно теряет смысл. Но где можно проверить сравнительные метрики перплексии для этих форматов на одной модели?
Serverflow
У нас пока нет независимых тестов перплексии NVFP4. Nvidia заявляет такое качество, но без публичных бенчмарков от сообщества полагаться на это пока рано.
Пётр
AMD даёт x86 и 128 ГБ за $3999, а Nvidia за те же деньги упирается в ARM. Что будет, если запустить старую x86-утилиту или драйвер, которых нет под ARM64? Я не про софт для ИИ, а про обычный рабочий софт.
Serverflow
Мы рассматриваем DGX Spark именно как ИИ-акселератор, а не замену ПК. Для обычных x86-задач понадобится второй компьютер, это усложняет сетап.
Написать отзыв
До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Написать комментарий

Комментарий появится на сайте после предварительной модерации

До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Мы свяжемся с вами утром

График работы: Пн-Пт 10:00-18:30 (по МСК)

Обработаем вашу заявку
в ближайший рабочий день

График работы: Пн-Пт 10:00-18:30 (по МСК)