Китайская ИИ-лаборатория Moonshot AI спустя 11 дней после релиза своей флагманской нейросети наконец-то выложила веса Kimi K3 в открытый доступ на под собственной открытой лицензией Kimi. Передовая нейросеть с 2,8 триллионами общих и 104 миллиардами активных параметров, полной мультимодальностью и контекстным окном в 1 миллион токенов базируется на архитектуре MoE с 896 экспертами, из которых на каждый токен активируется лишь 16, при этом весовые коэффициенты квантованы в режиме MXFP4, активаций Kimi K3 квантованы в режиме MXFP8, что снижает требования к локальному развертыванию LLM до 1,4 ТБ VRAM. По результатом внутренних тестов, Kimi K3 уступает только моделям GPT-5.6 Sol и Fable 5, а в некоторых сценариях даже обходит флагманские LLM OpenAI и Anthropic.
Подробнее о Kimi K3
Moonshot AI позиционирует Kimi K3 как модель класса 3T для программирования, агентной разработки и анализа больших объемов данных, способную выдерживать многочасовые сессии автономной работы и обрабатывать экстремально большие объемы контекста. В этом ей способствует два ключевых архитектурных механизма — Kimi Delta Attention (KDA) и Attention Residuals (AttnRes). Гибридный механизм Kimi Delta Attention (64 слоя) заменяет квадратичное внимание на линейное в части слоев, экономя вычислительные ресурсы при обработке последовательностей до 1 млн токенов, тогда как критически важные слои сохраняют точное квадратичное внимание Gated MLA (24 слоя). Механизм Attention Residuals дает каждому слою прямой доступ к выходам любых предыдущих слоев, что особенно эффективно для MoE-архитектур с разной глубиной включения экспертов. Помимо этого, в архитектуре модели применяется система LatentMoE, которая управляет маршрутизацией запросов в латентном пространстве, выполняет балансировку нагрузки между экспертами и применяет мягкий сброс токенов, создающих избыточную нагрузку на отдельных экспертов.
Kimi K3 полностью мультимодальна, что обеспечивается интеграцией визуального декодировщика MoonViT-V2 объемом 401 миллион параметров. Это позволяет добавлять к текстовым запросам визуальный контент (как изображения, так и видео), упрощая работу с моделью и открывая большие возможности для автономных агентных циклов. В Moonshot AI также отмечают, что Kimi K3 поддерживает экстремально длинные сессии программирования, ориентируется в огромных кодовых репозиториях и может управлять инструментами прямо в терминале, выполняя задачи вне зависимости от их сложности — от оптимизации ядра GPU и программирования компиляторов до разработки САПР или проектирования микросхем.
Производительность Kimi K3 выходит на один уровень с топовыми проприетарными LLM, таким как GPT-5.6 Sol и Claude Fable 5. На научном бенчмарке GPQA Diamond модель набирает 93.5, практически сравниваясь с GPT-5.6 Sol (94.1) и опережая Claude Opus 4.8 (91.0). В задачах кодирования DeepSWE показывает 67.5, а Terminal-Bench 2.1 — 88.3, обходя Fable 5 (88.0) и почти не уступая GPT-5.6 Sol (88.8). Агентные способности — главная сила Kimi K3: BrowseComp 91.2 (Fable 5 — 88.0), MCPMark-Verified 94.5 (лучший результат), GDPval-AA v2 Elo 1686 (второе место после Fable 5). В понимании документов OmniDocBench достигает 91.1, опережая и Fable 5, и GPT-5.6 Sol. Эти результаты ставят Kimi K3 в один ряд с самыми мощными коммерческими моделями, особенно в агентных и кодовых сценариях.
Одной из ключевых технических особенностей Kimi K3 является нативное квантование на стадии тонкой настройки. Веса модели хранятся в формате MXFP4, активации — в MXFP8. Это сокращает объем памяти, необходимый для инференса, примерно в 4 раза по сравнению с FP16 (до 1,4 ТБ VRAM), позволяя запускать модель на 10 ИИ-ускорителях Nvidia H200. Однако для полноценного запуска LLM с учетом веса KV-кэша требуется дополнительный объем памяти, поэтому без нескольких GPU-серверов тут явно не обойтись.
Kimi K3 доступна для локального развертывания через движки vLLM, SGLang и TokenSpeed. Модель всегда работает в режиме размышления, глубину которого можно настраивать: доступны режимы "low", "high" или "max" (по умолчанию). Для агентных сценариев Moonshot AI рекомендует использовать интерфейс Kimi Code CLI.
Помимо весов самой Kimi K3, Moonsot AI также выпустила в open-source большую часть ПО-стэка, который использовался при разработке передовой нейросети. Например, компания открыла исходный код MoonEP, высокопроизводительной библиотеки для распределенных задач машинного обучения, и AgentENV, распределенной системы для масштабного запуска агентских сред.
Выводы
Kimi K3 — это не очередная китайская открытая LLM, и даже не “бесплатная Claude Fable 5”, а главный показатель того, что китайские ИИ-лаборатории теперь отстают от западных решений не на полгода, а всего на несколько дней. Несмотря на то, что для развертывания модели Kimi K3 с 2,8 триллионами параметров требуется монструозный объем VRAM, нативная поддержка форматов MXFP4 и MXFP8 развязывает руки энтузиастам, которые уже в ближайшие несколько дней еще больше оптимизируют передовую LLM и выпустят собственные, дистиллированные модели на базе Kimi K3, объем которых будет по силам для развертывания большинству юзеров и не будут радикально отличаться по производительности от флагмана Moonshot AI. Также не исключено, что сама Moonshot осознает огромные размеры Kimi K3 и уже готовит более легковесные LLM, но правда это или нет — узнаем в ближайшее время.
Сейчас тут ничего нет. Ваш комментарий может стать первым.
Скидка 1 500 ₽ или бесплатная доставка - уже сейчас 🔥
Мы ценим обратную связь от клиентов. При оформлении заказа вы можете сообщить о своём намерении поделиться впечатлением о работе ServerFlow после получения товара.
* - скидка предоставляется при покупке от 30 000 рублей, в ином случае предусмотрена бесплатная доставка до ПВЗ СДЭК.
Продолжная использовать наш сайт, вы даете согласие на использование файлов Cookie, пользовательских данных (IP-адрес, вид операционной системы, тип браузера, сведения о местоположении, источник, откуда пришел на сайт пользователь, с какого сайта или по какой рекламе, какие страницы
открывает и на какие страницы нажимает пользователь) в целях функционирования сайта, проведения статистических исследований и обзоров. Если вы не хотите, чтобы ваши данные обрабатывались, покиньте сайт.
При оформлении заказа в ServerFlow вы можете сообщить о намерении оставить отзыв о нашей работе после получения товара.
Нам важно ваше честное мнение. Оно помогает развивать сервис и даёт другим клиентам представление о нашей работе.
Вы можете оставить отзыв на удобной для вас платформе:
Google Maps
2GIS
Яндекс Карты
Как работает акция
Применяя промокод, вы подтверждаете намерение поделиться впечатлением о работе ServerFlow после получения заказа. Мы применяем бонус уже к текущему заказу в знак благодарности за обратную связь.
Условия акции:
скидка 1 500 ₽ при заказе от 30 000 ₽
или бесплатная доставка* при заказе до 30 000 ₽
* Бесплатная доставка заказа осуществляется до ПВЗ СДЭК.