Top.Mail.Ru
Moonshot AI представила Kimi K3 — ИИ-модель с 2,8 триллионов параметров и производительностью на уровне Claude Fable 5 | Блог Serverflow Скачать
прайс-лист
Бесплатная
доставка по РФ
Бонус за
обратную связь
Интернет-магазин
Серверного оборудования
8 (800) 222-70-01 Консультация IT-специалиста Сравнение

Moonshot AI представила Kimi K3 — ИИ-модель с 2,8 триллионов параметров и производительностью на уровне Claude Fable 5

~ 2 мин
146
Простой
Новости
Moonshot AI представила Kimi K3 — ИИ-модель с 2,8 триллионов параметров и производительностью на уровне Claude Fable 5

Введение

Компания Moonshot AI официально представила свою новую флагманскую модель Kimi K3 с общим объемом в 2,8 триллиона, которая уже 27 июля выйдет в open-source.
В отличие от предыдущего поколения ИИ-моделей Kimi K2, новая модель построена на архитектуре Mixture-of-Experts с 896 экспертами, из которых на каждый токен активируется лишь 16, поддерживает полную мультимодальность и поддерживает квантование MXFP4 для весов и MXFP8 для активаций, благодаря чему финальный размер модели составляет примерно 1,4 ТБ — в четыре раза меньше, чем потребовалось бы в стандартном FP16.

Подробнее о Kimi K3

В отличие от своих предшественников, ИИ-модель Kimi K3 получила несколько ключевых архитектурных инноваций, главной из которых является Kimi Delta Attention — гибридный линейный механизм внимания, который заменяет квадратичное внимание в части слоев модели. Это дает ощутимую экономию вычислительных ресурсов при работе с длинными последовательностями в 1 млн токенов, при этом ключевые слои нейросети все еще базируются на квадратичном механизме внимания, чтобы обеспечить высочайшую точность вывода. Второй важный компонент — механизм Attention Residuals, благодаря которому каждый слой модели может целенаправленно обращаться к выводам любых предыдущих слоев. Для MoE-архитектур, где разные эксперты включаются на разных глубинах, такое решение позволяет значительно увеличить производительность. Третий ключевой компонент — система Stable LatentMoE, которая управляет всей логикой работы с 896 экспертами. Она выполняет маршрутизацию запросов в латентном пространстве, следит за квантильной балансировкой нагрузки между экспертами и применяет механизм мягкого сброса для тех токенов, которые создают избыточную нагрузку на отдельных экспертов.

Архитектура ИИ-модели Kimi K3
Архитектура ИИ-модели Kimi K3. Источник: X.

Кроме того, в модели используются несколько дополнительных технических элементов, которые в совокупности доводят архитектуру до ума. Это Muon-оптимизатор, который настраивает скорость обучения индивидуально для каждого блока внимания, функция активации SiTU, пришедшая на смену привычным GeLU и SwiGLU, а также механизм Gated MLA, отвечающий за более эффективное управление кэшем ключей и значений. Все вместе это дает примерно 2,5-кратное улучшение эффективности масштабирования по сравнению с предыдущей моделью K2.

Kimi K3 использует подход, при котором квантование закладывается прямо в процесс обучения на этапе тонкой настройки. Веса модели хранятся в формате MXFP4 — формат, который поддерживается на аппаратном уровне новыми графическими процессорами NVIDIA Blackwell и AMD MI400, что сильно упрощает развертывание модели в корпоративной среде. Для промежуточных активаций используется формат MXFP8 — он дает больше точности там, где это критично для градиентного потока во время обучения и для числовой стабильности при инференсе.

Благодаря такому подходу общий вес модели составляет всего 1,4 ТБ, тогда как в формате FP16 он бы занял около 5,6 ТБ. Это четырехкратная экономия, и это позволяет выполнять локальное развертывание Kimi K3 на 10 ИИ-ускорителях Nvidia H200 или на 5 ИИ-ускорителях B200, но и их объема VRAM хватит толко на параметры — для  KV-кэша и активаций нейросети требуется как минимум 5,12 ТБ VRAM.

По результатам тестирования модель показывает внушительную производительность. В тесте общего интеллекта GDPval-AA v2 Kimi K3 набирает 1687 баллов, уступая Fable 5 Max с его 1815 баллами и GPT-5.6 Sol Max с 1747,8 баллами, но опережая Opus 4.8, у которого 1600 баллов. В специализированных бенчмарках результаты выглядят так: GPQA-Diamond — 93,5%, MMMU-Pro — 81,6%, MathVision — 94,3%. По задачам программирования модель показывает 67,5% на DeepSWE, 81,2% на FrontierSWE, 88,3% на Terminal-Bench 2.1, уступая GPT-5.6 Sol всего полпроцента. На Program Bench Kimi K3 становится лучшей с 77,8%, и на SWE Marathon тоже лучшая с 42%. В агентных сценариях: BrowseComp — 91,2%, DeepSearchQA по метрике F1 — 95%, Automation Bench — 30,8%.

ИИ-производительность модели Kimi K3 в кодинге
ИИ-производительность модели Kimi K3 в кодинге. Источник: X.

Выводы

27 июля, когда Kimi K3 станет доступна в open-source, открытое ИИ-сообщество получит возможность проверить все заявленные характеристики на практике, воспроизвести бенчмарки и попробовать адаптировать передовую открытую модель под свои задачи. Kimi K3 — это первый случай, когда модель с 2,8 триллионами параметров появляется в открытом доступе, что станет новой вехе в сегменте открытого исходного кода. А ее потрясающая ИИ-производительность, практически не уступающая ИИ-моделям GPT-5.6 Sol и Fable 5, может вновь пошатнуть авторитет проприетарных нейросетей, задав совершенно новую планку для разработчиков LLM с открытым исходным кодом.
Автор: Serverflow Serverflow
Поделиться

Комментарии 0

Написать комментарий
Сейчас тут ничего нет. Ваш комментарий может стать первым.
Написать отзыв
До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Написать комментарий

Комментарий появится на сайте после предварительной модерации

До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Мы свяжемся с вами утром

График работы: Пн-Пт 10:00-18:30 (по МСК)

Обработаем вашу заявку
в ближайший рабочий день

График работы: Пн-Пт 10:00-18:30 (по МСК)