Z.ai выпустила в открытый доступ на Hugging Face модель GLM-4.7-Flash — облегченную версию на 30 миллиардов общих и 3 миллиарда активных параметров, что снижает вычислительные требования к локальному развертыванию. При этом модель ориентирована тяжелые LLM задачи, напрямую заявляя о конкуренции с более крупными моделями.
Подробнее о GLM-4.7-Flash
Нейросеть GLM-4.7-Flash от Z-ai в бенчмарке SWE-bench Verified достигает 59,2%, тогда как другая китайская модель Qwen3-30B-A3B-Thinking от Alibaba показывает производительность лишь 22%, а GPT-OSS-20b обеспечивает 34%. В задачах использования инструментов на τ²-Bench разрыв сохраняется: 79,5% у GLM-4.7-Flash против 49% у конкурента от Alibaba и 47,7% у конкурента от OpenAI. Аналогичная картина наблюдается и в BrowseComp, где модель Z.ai показывает 42,8% против 22,9% и 28,3%, подтверждая более устойчивые навыки в задачах агентской навигации и анализа.
В математике GLM-4.7-Flash также демонстрирует выдающиеся результаты: 91,6% на AIME 2025 выводят ее практически в один ряд с GPT-OSS-20B с результатом в 91.7%, несмотря на заметно меньшую активную часть параметров. Пользователи, уже успевшие протестировать GLM-4.7-Flash на локальном железе, сообщают о скорости более 80 токенов в секунду на M3 Ultra при 4-битной квантизации и 40-50 токенов в секунду на ноутбучных чипах M5. Модель уже интегрирована в MLX, vLLM и SGLang, а также доступна через API: бесплатно с одним параллельным запросом, $0,60 за 1 млн входных токенов и $2,20 за 1 млн выходных токенов при платном вызове модели. Есть также кэширование входа по $0,11 за 1 млн токенов.
GLM-4.7-Flash — это не просто еще одна облегченная версия более мощной модели, а демонстрация смещения акцента в сторону эффективности и архитектурной оптимизации. Модель уверенно обходит решения того же класса и приближается к более крупным системам, оставаясь при этом пригодной для запуска на обычном потребительском железе. Для Z.ai этот релиз стал показательной вехой после январского IPO в Гонконге и подтверждением того, что компания продолжает системно развивать открытые модели, способные конкурировать с ведущими западными разработками.
Два ценика: $0,60 за миллион входных токенов и $2,20 за выходные: сравнимо с GPT-4o mini? Вопрос скорее не к цифрам, а к экономической модели: кэширование входа за $0,11 означает, что при повторных запросах с тем же контекстом цена резко снижается, а для постоянных API-пользователей это почти бесплатно.
Serverflow
Да, кэш входа: значимое преимущество для типовых сценариев. На длинной дистанции это может дать двукратную экономию по сравнению с моделями без кэширования.
Борис
24.01.2026
Судя по цифрам, 3 миллиарда активных параметров против 30 миллиардов общих: это соотношение 1 к 10. Но в математике модель почти вровень с GPT-OSS-20B, где все 20 миллиардов, кажется, активны. Не совсем понимаю, за счет чего такой выигрыш: архитектура MoE или что-то другое?
Serverflow
Да, основная причина: смешанная экспертная архитектура с малым числом активных параметров на токен, что позволяет резко снизить вычисления без потери качества на конкретной задаче.
Егор
23.01.2026
Модель выдаёт 42,8% на BrowseComp, а у Qwen3-30B-A3B: 22,9%. Разрыв в 20 пунктов говорит о том, что для задач навигации и анализа контента такая лайт-модель может заменить тяжёлую, если не требуется генерация большого объёма текста.
Serverflow
Согласны, для агентских сценариев с внешними инструментами компактность и скорость действительно могут быть решающими.
Леонид
20.01.2026
На τ²-Bench упомянуты результаты 79,5% против 49% и 47,7%. Конкуренты от Alibaba и OpenAI: это ведь не их текущие флагманские модели? Неясно, как GLM-4.7-Flash сопоставима с современными агентскими решениями этих компаний.
Serverflow
В статье действительно приведены сравнения с конкретными версиями на Hugging Face, но не указано, насколько они актуальны на сегодня. Мы рассматриваем возможность дополнительных бенчмарков с более свежими моделями.
Скидка 1 500 ₽ или бесплатная доставка - уже сейчас 🔥
Мы ценим обратную связь от клиентов. При оформлении заказа вы можете сообщить о своём намерении поделиться впечатлением о работе ServerFlow после получения товара.
* - скидка предоставляется при покупке от 30 000 рублей, в ином случае предусмотрена бесплатная доставка до ПВЗ СДЭК.
Продолжная использовать наш сайт, вы даете согласие на использование файлов Cookie, пользовательских данных (IP-адрес, вид операционной системы, тип браузера, сведения о местоположении, источник, откуда пришел на сайт пользователь, с какого сайта или по какой рекламе, какие страницы
открывает и на какие страницы нажимает пользователь) в целях функционирования сайта, проведения статистических исследований и обзоров. Если вы не хотите, чтобы ваши данные обрабатывались, покиньте сайт.
При оформлении заказа в ServerFlow вы можете сообщить о намерении оставить отзыв о нашей работе после получения товара.
Нам важно ваше честное мнение. Оно помогает развивать сервис и даёт другим клиентам представление о нашей работе.
Вы можете оставить отзыв на удобной для вас платформе:
Google Maps
2GIS
Яндекс Карты
Как работает акция
Применяя промокод, вы подтверждаете намерение поделиться впечатлением о работе ServerFlow после получения заказа. Мы применяем бонус уже к текущему заказу в знак благодарности за обратную связь.
Условия акции:
скидка 1 500 ₽ при заказе от 30 000 ₽
или бесплатная доставка* при заказе до 30 000 ₽
* Бесплатная доставка заказа осуществляется до ПВЗ СДЭК.