Компания Moonshot AI официально представила свою новую флагманскую модель Kimi K3 с общим объемом в 2,8 триллиона, которая уже 27 июля выйдет в open-source.
В отличие от предыдущего поколения ИИ-моделей Kimi K2, новая модель построена на архитектуре Mixture-of-Experts с 896 экспертами, из которых на каждый токен активируется лишь 16, поддерживает полную мультимодальность и поддерживает квантование MXFP4 для весов и MXFP8 для активаций, благодаря чему финальный размер модели составляет примерно 1,4 ТБ — в четыре раза меньше, чем потребовалось бы в стандартном FP16.
Подробнее о Kimi K3
В отличие от своих предшественников, ИИ-модель Kimi K3 получила несколько ключевых архитектурных инноваций, главной из которых является Kimi Delta Attention — гибридный линейный механизм внимания, который заменяет квадратичное внимание в части слоев модели. Это дает ощутимую экономию вычислительных ресурсов при работе с длинными последовательностями в 1 млн токенов, при этом ключевые слои нейросети все еще базируются на квадратичном механизме внимания, чтобы обеспечить высочайшую точность вывода. Второй важный компонент — механизм Attention Residuals, благодаря которому каждый слой модели может целенаправленно обращаться к выводам любых предыдущих слоев. Для MoE-архитектур, где разные эксперты включаются на разных глубинах, такое решение позволяет значительно увеличить производительность. Третий ключевой компонент — система Stable LatentMoE, которая управляет всей логикой работы с 896 экспертами. Она выполняет маршрутизацию запросов в латентном пространстве, следит за квантильной балансировкой нагрузки между экспертами и применяет механизм мягкого сброса для тех токенов, которые создают избыточную нагрузку на отдельных экспертов.
Кроме того, в модели используются несколько дополнительных технических элементов, которые в совокупности доводят архитектуру до ума. Это Muon-оптимизатор, который настраивает скорость обучения индивидуально для каждого блока внимания, функция активации SiTU, пришедшая на смену привычным GeLU и SwiGLU, а также механизм Gated MLA, отвечающий за более эффективное управление кэшем ключей и значений. Все вместе это дает примерно 2,5-кратное улучшение эффективности масштабирования по сравнению с предыдущей моделью K2.
Kimi K3 использует подход, при котором квантование закладывается прямо в процесс обучения на этапе тонкой настройки. Веса модели хранятся в формате MXFP4 — формат, который поддерживается на аппаратном уровне новыми графическими процессорами NVIDIA Blackwell и AMD MI400, что сильно упрощает развертывание модели в корпоративной среде. Для промежуточных активаций используется формат MXFP8 — он дает больше точности там, где это критично для градиентного потока во время обучения и для числовой стабильности при инференсе.
Благодаря такому подходу общий вес модели составляет всего 1,4 ТБ, тогда как в формате FP16 он бы занял около 5,6 ТБ. Это четырехкратная экономия, и это позволяет выполнять локальное развертывание Kimi K3 на 10 ИИ-ускорителях Nvidia H200 или на 5 ИИ-ускорителях B200, но и их объема VRAM хватит толко на параметры — для KV-кэша и активаций нейросети требуется как минимум 5,12 ТБ VRAM.
По результатам тестирования модель показывает внушительную производительность. В тесте общего интеллекта GDPval-AA v2 Kimi K3 набирает 1687 баллов, уступая Fable 5 Max с его 1815 баллами и GPT-5.6 Sol Max с 1747,8 баллами, но опережая Opus 4.8, у которого 1600 баллов. В специализированных бенчмарках результаты выглядят так: GPQA-Diamond — 93,5%, MMMU-Pro — 81,6%, MathVision — 94,3%. По задачам программирования модель показывает 67,5% на DeepSWE, 81,2% на FrontierSWE, 88,3% на Terminal-Bench 2.1, уступая GPT-5.6 Sol всего полпроцента. На Program Bench Kimi K3 становится лучшей с 77,8%, и на SWE Marathon тоже лучшая с 42%. В агентных сценариях: BrowseComp — 91,2%, DeepSearchQA по метрике F1 — 95%, Automation Bench — 30,8%.
ИИ-производительность модели Kimi K3 в кодинге. Источник: X.
Выводы
27 июля, когда Kimi K3 станет доступна в open-source, открытое ИИ-сообщество получит возможность проверить все заявленные характеристики на практике, воспроизвести бенчмарки и попробовать адаптировать передовую открытую модель под свои задачи. Kimi K3 — это первый случай, когда модель с 2,8 триллионами параметров появляется в открытом доступе, что станет новой вехе в сегменте открытого исходного кода. А ее потрясающая ИИ-производительность, практически не уступающая ИИ-моделям GPT-5.6 Sol и Fable 5, может вновь пошатнуть авторитет проприетарных нейросетей, задав совершенно новую планку для разработчиков LLM с открытым исходным кодом.
Сейчас тут ничего нет. Ваш комментарий может стать первым.
Скидка 1 500 ₽ или бесплатная доставка - уже сейчас 🔥
Мы ценим обратную связь от клиентов. При оформлении заказа вы можете сообщить о своём намерении поделиться впечатлением о работе ServerFlow после получения товара.
* - скидка предоставляется при покупке от 30 000 рублей, в ином случае предусмотрена бесплатная доставка до ПВЗ СДЭК.
Продолжная использовать наш сайт, вы даете согласие на использование файлов Cookie, пользовательских данных (IP-адрес, вид операционной системы, тип браузера, сведения о местоположении, источник, откуда пришел на сайт пользователь, с какого сайта или по какой рекламе, какие страницы
открывает и на какие страницы нажимает пользователь) в целях функционирования сайта, проведения статистических исследований и обзоров. Если вы не хотите, чтобы ваши данные обрабатывались, покиньте сайт.
При оформлении заказа в ServerFlow вы можете сообщить о намерении оставить отзыв о нашей работе после получения товара.
Нам важно ваше честное мнение. Оно помогает развивать сервис и даёт другим клиентам представление о нашей работе.
Вы можете оставить отзыв на удобной для вас платформе:
Google Maps
2GIS
Яндекс Карты
Как работает акция
Применяя промокод, вы подтверждаете намерение поделиться впечатлением о работе ServerFlow после получения заказа. Мы применяем бонус уже к текущему заказу в знак благодарности за обратную связь.
Условия акции:
скидка 1 500 ₽ при заказе от 30 000 ₽
или бесплатная доставка* при заказе до 30 000 ₽
* Бесплатная доставка заказа осуществляется до ПВЗ СДЭК.