Top.Mail.Ru
DeepSeek V4.1 Flash — 552 млрд параметров, нативная мультимодальность и рывок в агентном кодинге | Блог Serverflow Скачать
прайс-лист
Бесплатная
доставка по РФ
Бонус за
обратную связь
Интернет-магазин
Серверного оборудования
8 (800) 222-70-01 Консультация IT-специалиста Сравнение

DeepSeek V4.1 Flash — 552 млрд параметров, нативная мультимодальность и рывок в агентном кодинге

~ 2 мин
62
Простой
Новости
DeepSeek V4.1 Flash — 552 млрд параметров, нативная мультимодальность и рывок в агентном кодинге

Введение

DeepSeek опубликовала веса DeepSeek-V4.1-Flash — новой мультимодальной модели на архитектуре MoE с октрытым исходным кодом под лицензией MIT на Hugging Face. Это первая открытая модель из семейства DeepSeek Flash с таким объемом параметров — размер весов вырос почти вдвое относительно V4-Flash, с 284 до 552 миллиардов. Модель поддерживает контекст до 1 млн токенов, нативно обрабатывает изображения и текст, а главным техническим достижением стало сжатие KV-кэша до 890 байт на токен, что в 4 раза меньше, чем у V4-Flash, и в 437 раз меньше, чем у первого поколения моделей компании. Для агентных сценариев, где модель многократно пересылает одни и те же инструкции и код, это означает кратное снижение требований к памяти при инференсе.

Подробнее о DeepSeek V4.1 Flash

Новая архитектура Causal Encoder-Decoder делит 40-слойный трансформер DeepSeek-V4.1-Flash на 20-слойный энкодер и 20-слойный декодер. Глобальный KV-кэш декодера обрабатывается только из финальных скрытых состояний энкодера, а не из каждого слоя отдельно. Благодаря этому активируются всего 8 млрд параметров на токен при чтении входных токенов и 16 млрд при генерации новых токенов — это рекордно низкий показатель для модели такого размера. Кроме того, механизм SWA Bounded Replay восстанавливает недостающие состояния контекстного окна, воспроизводя лишь последние токены, что уменьшает постоянный кэш примерно в 8 раз.

Еще один ключевой компонент DeepSeek-V4.1-Flash — Compressed Sparse Attention 2. Каждый слой внимания получает режим Full, Reindex или Reuse, что позволяет переиспользовать индексы и KV-кэш между слоями. Дополнительно используются Engram conditional memory на 196 млрд параметров и спекулятивное декодирование DSpark, что еще больше ускоряет инференс и снижает требования к развертыванию.

На Terminal-Bench 4.0 модель DeepSeek-V4.1-Flash набирает аж 31,2% против 7% у DeepSeek V4-Flash. На DeepSWE v1.1 у DeepSeek-V4.1-Flash — 74,2% против 54,4%. До лидеров еще, конечно, очень далеко: у GPT-6 Astra 57,9% на Terminal-Bench, у Claude Fable 5.1 — 55,8%. Зато в CyberGym у DeepSeek-V4.1-Flash аж 88,1%, что выше GPT-5.6 Sol (84,5%) и GLM-5.3 (84,5%). В Agent's Last Exam — 31,8% против 28,6% у Opus-5.0. В Codeforces рейтинг 3471 — выше, чем у DeepSeek V4-Pro (3348). В AutomationBench — 54,8% против 50,3% у Opus-5.0. Среди базовых моделей V4.1-Flash-Base показывает 74,1% на MMLU-Pro, 79,4% на HumanEval и 93,0% на GSM8K. В мультимодальных тестах DocVQA — 95,6%, MMMU-Pro — 56,5%, CVBench — 77,9%. Другими словами, модель DeepSeek-V4.1-Flash во многих сценариях практически приблизилась к лидирующим проприетарным LLM в агентных и кодинговых сценариях, но уступила в общих бенчмарках.

Результаты тестирования DeepSeek-V4.1-Flash
Результаты тестирования DeepSeek V4.1 Flash. Источник: Hugging Face.

Выводы

DeepSeek V4.1 Flash — это модель, которая меняет экономику агентных нагрузок. Сжатие кэша в 437 раз относительно первого поколения моделей DeepSeek является огромным рывком для индустрии open-source LLM и приоритетом компании, что несомненно сказалось на результатах бенчмарков: в агентных задачах и кибербезопасности модель обходит GPT-5.6 Sol, а в DeepSWE почти вплотную подходит к закрытым моделям, хотя по общим знаниям заметно уступает старшей V4-Pro. Тем не менее, прирост заметен, а с учетом открытых весов с лицензией MIT и многочисленных оптимизационных механизмов, передовая китайская нейросеть может занять приоритетную позицию для энтузиастов и компаний, предпочитающих локальный вывод LLM при развертывании агентных систем.
Автор: Serverflow Serverflow
Поделиться

Комментарии 1

Написать комментарий
Леонид
Сжатие KV-кэша до 890 байт на токен: это в 4 раза меньше V4-Flash. Получается, при развертывании агентных пайплайнов с длинными повторяющимися инструкциями можно заметно сэкономить на VRAM без потери контекста?
Serverflow
Да, именно так: основная выгода как раз в агентных сценариях с многократной передачей одних и тех же данных: кэш занимает меньше места, что снижает требования к памяти при инференсе.
Написать отзыв
До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Написать комментарий

Комментарий появится на сайте после предварительной модерации

До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Мы свяжемся с вами утром

График работы: Пн-Пт 10:00-18:30 (по МСК)

Обработаем вашу заявку
в ближайший рабочий день

График работы: Пн-Пт 10:00-18:30 (по МСК)