DeepSeek опубликовала веса DeepSeek-V4.1-Flash — новой мультимодальной модели на архитектуре MoE с октрытым исходным кодом под лицензией MIT на Hugging Face. Это первая открытая модель из семейства DeepSeek Flash с таким объемом параметров — размер весов вырос почти вдвое относительно V4-Flash, с 284 до 552 миллиардов. Модель поддерживает контекст до 1 млн токенов, нативно обрабатывает изображения и текст, а главным техническим достижением стало сжатие KV-кэша до 890 байт на токен, что в 4 раза меньше, чем у V4-Flash, и в 437 раз меньше, чем у первого поколения моделей компании. Для агентных сценариев, где модель многократно пересылает одни и те же инструкции и код, это означает кратное снижение требований к памяти при инференсе.
Подробнее о DeepSeek V4.1 Flash
Новая архитектура Causal Encoder-Decoder делит 40-слойный трансформер DeepSeek-V4.1-Flash на 20-слойный энкодер и 20-слойный декодер. Глобальный KV-кэш декодера обрабатывается только из финальных скрытых состояний энкодера, а не из каждого слоя отдельно. Благодаря этому активируются всего 8 млрд параметров на токен при чтении входных токенов и 16 млрд при генерации новых токенов — это рекордно низкий показатель для модели такого размера. Кроме того, механизм SWA Bounded Replay восстанавливает недостающие состояния контекстного окна, воспроизводя лишь последние токены, что уменьшает постоянный кэш примерно в 8 раз.
Еще один ключевой компонент DeepSeek-V4.1-Flash — Compressed Sparse Attention 2. Каждый слой внимания получает режим Full, Reindex или Reuse, что позволяет переиспользовать индексы и KV-кэш между слоями. Дополнительно используются Engram conditional memory на 196 млрд параметров и спекулятивное декодирование DSpark, что еще больше ускоряет инференс и снижает требования к развертыванию.
На Terminal-Bench 4.0 модель DeepSeek-V4.1-Flash набирает аж 31,2% против 7% у DeepSeek V4-Flash. На DeepSWE v1.1 у DeepSeek-V4.1-Flash — 74,2% против 54,4%. До лидеров еще, конечно, очень далеко: у GPT-6 Astra 57,9% на Terminal-Bench, у Claude Fable 5.1 — 55,8%. Зато в CyberGym у DeepSeek-V4.1-Flash аж 88,1%, что выше GPT-5.6 Sol (84,5%) и GLM-5.3 (84,5%). В Agent's Last Exam — 31,8% против 28,6% у Opus-5.0. В Codeforces рейтинг 3471 — выше, чем у DeepSeek V4-Pro (3348). В AutomationBench — 54,8% против 50,3% у Opus-5.0. Среди базовых моделей V4.1-Flash-Base показывает 74,1% на MMLU-Pro, 79,4% на HumanEval и 93,0% на GSM8K. В мультимодальных тестах DocVQA — 95,6%, MMMU-Pro — 56,5%, CVBench — 77,9%. Другими словами, модель DeepSeek-V4.1-Flash во многих сценариях практически приблизилась к лидирующим проприетарным LLM в агентных и кодинговых сценариях, но уступила в общих бенчмарках.
Результаты тестирования DeepSeek V4.1 Flash. Источник: .
Выводы
DeepSeek V4.1 Flash — это модель, которая меняет экономику агентных нагрузок. Сжатие кэша в 437 раз относительно первого поколения моделей DeepSeek является огромным рывком для индустрии open-source LLM и приоритетом компании, что несомненно сказалось на результатах бенчмарков: в агентных задачах и кибербезопасности модель обходит GPT-5.6 Sol, а в DeepSWE почти вплотную подходит к закрытым моделям, хотя по общим знаниям заметно уступает старшей V4-Pro. Тем не менее, прирост заметен, а с учетом открытых весов с лицензией MIT и многочисленных оптимизационных механизмов, передовая китайская нейросеть может занять приоритетную позицию для энтузиастов и компаний, предпочитающих локальный вывод LLM при развертывании агентных систем.
Сжатие KV-кэша до 890 байт на токен: это в 4 раза меньше V4-Flash. Получается, при развертывании агентных пайплайнов с длинными повторяющимися инструкциями можно заметно сэкономить на VRAM без потери контекста?
Serverflow
Да, именно так: основная выгода как раз в агентных сценариях с многократной передачей одних и тех же данных: кэш занимает меньше места, что снижает требования к памяти при инференсе.
Скидка 1 500 ₽ или бесплатная доставка - уже сейчас 🔥
Мы ценим обратную связь от клиентов. При оформлении заказа вы можете сообщить о своём намерении поделиться впечатлением о работе ServerFlow после получения товара.
* - скидка предоставляется при покупке от 30 000 рублей, в ином случае предусмотрена бесплатная доставка до ПВЗ СДЭК.
Продолжная использовать наш сайт, вы даете согласие на использование файлов Cookie, пользовательских данных (IP-адрес, вид операционной системы, тип браузера, сведения о местоположении, источник, откуда пришел на сайт пользователь, с какого сайта или по какой рекламе, какие страницы
открывает и на какие страницы нажимает пользователь) в целях функционирования сайта, проведения статистических исследований и обзоров. Если вы не хотите, чтобы ваши данные обрабатывались, покиньте сайт.
При оформлении заказа в ServerFlow вы можете сообщить о намерении оставить отзыв о нашей работе после получения товара.
Нам важно ваше честное мнение. Оно помогает развивать сервис и даёт другим клиентам представление о нашей работе.
Вы можете оставить отзыв на удобной для вас платформе:
Google Maps
2GIS
Яндекс Карты
Как работает акция
Применяя промокод, вы подтверждаете намерение поделиться впечатлением о работе ServerFlow после получения заказа. Мы применяем бонус уже к текущему заказу в знак благодарности за обратную связь.
Условия акции:
скидка 1 500 ₽ при заказе от 30 000 ₽
или бесплатная доставка* при заказе до 30 000 ₽
* Бесплатная доставка заказа осуществляется до ПВЗ СДЭК.