Top.Mail.Ru
DeepSeek V4 Flash и V4 Pro — релиз open-source LLM с контекстом 1M токенов | Новость ServerFlow Скачать
прайс-лист
Бесплатная
доставка по РФ
Бонус за
обратную связь
Интернет-магазин
Серверного оборудования
8 (800) 222-70-01 Консультация IT-специалиста Сравнение

DeepSeek V4 Flash и DeepSeek V4 Pro — официальный релиз долгожданных китайских LLM в open-source

~ 2 мин
2678
Простой
Новости
DeepSeek V4 Flash и DeepSeek V4 Pro — официальный релиз долгожданных китайских LLM в open-source

Введение

Китайская лаборатория DeepSeek представила долгожданное семейство своих передовых ИИ-моделей DeepSeek-V4 — флагманскую DeepSeek-V4 Pro и облегченную DeepSeek-V4-Flash. Обе модели базируются на архитектуре MoE и имеют огромное контекстное окно в 1 миллион токенов. Веса передовых нейронок опубликованы на Hugging Face под лицензией MIT, также DeepSeek-V4 добавили в веб-чат и мобильное приложение компании, где они доступны абсолютно бесплатно, а для разработчиков DeepSeek-V4 работают через API. 

Подробнее о DeepSeek V4

Флагманская модель DeepSeek-V4-Pro насчитывает 1,6 триллиона общих параметров, из которых на каждый токен активируется 49 миллиардов, что делает новую китайскую LLM самой большой open-source моделью в индустрии. DeepSeek-V4-Flash заметно компактнее: 284 миллиарда общих параметров при 13 миллиардах активных. Обе модели обучены на корпусе объемом более 32 триллионов токенов, а затем прошли двухэтапное пост-обучение: сначала эксперты развивались независимо в своих доменах с помощью supervised fine-tuning и обучения с подкреплением по алгоритму GRPO, после чего навыки объединялись в единую модель через дистилляцию на основе политик.

Главная особенность моделей DeepSeek V4 — радикальная экономия памяти и вычислений при работе с длинным контекстом. Разработчики внедрили гибридный механизм внимания, сочетающий сжатое разреженное внимание и сильно сжатое внимание. В результате при обработке одного миллиона токенов DeepSeek-V4-Pro тратит лишь 27% вычислений на новый токен и хранит всего 10% объема KV-кеша по сравнению с предыдущей версией DeepSeek-V3.2. Это принципиально снижает стоимость эксплуатации модели на сверхдлинных запросах — проблема, которая остро стоит перед всеми разработчиками агентных систем. Дополнительно улучшена стабильность обучения за счет гиперсвязей с ограничениями на многообразии и оптимизатора Muon.

Режим максимальной эффективности размышления DeepSeek-V4-Pro-Max, по собственной оценке компании, уверенно занимает позицию лучшей открытой модели на сегодняшний день. В задачах на кодирование она демонстрирует высочайшую производительность и существенно сокращает отставание от ведущих закрытых моделей. Впрочем, по сравнению со свежими Claude Opus 4.7 и вышедшей днем ранее GPT-5.5 новинка все же уступает: она скорее приближается к моделям предыдущего поколения, таким как Opus 4.6 и GPT-5.4. Облегченная версия Flash-Max при достаточном бюджете на размышление показывает результаты, сопоставимые с Pro, но немного отстает в задачах, требующих исключительно глубоких знаний, и в самых сложных агентных сценариях. На Codeforces, оценивающем соревновательное программирование, модель DeepSeek V4 Pro набирает рейтинг 3206, опережая GPT-5.4 с 3168 баллами и Gemini 3.1 Pro с 3052. Это соответствует 23-й строчке среди людей-участников платформы. На LiveCodeBench достигнут показатель 93,5% — самый высокий среди всех участников сравнения: Gemini 3.1 Pro набирает 91,7%, а Claude Opus 4.6 — 88,8%. В тесте SWE-bench Verified, симулирующем решение реальных задач на GitHub, модель достигла 80,6%, практически вплотную приблизившись к Claude Opus 4.6 с его 80,8%. По математическому тесту HMMT результат составил 95,2%, а в задачах на общие знания GPQA Diamond — 90,1%, что является рекордом среди открытых моделей. Впрочем, по SimpleQA модель набирает 57,9%, заметно уступая Gemini 3.1 Pro и подтверждая, что в области мировых знаний разрыв с закрытыми флагманами пока сохраняется.

ИИ-производительность DeepSeek V4 Pro и DeepSeek V4 Flash в режиме Max
ИИ-производительность DeepSeek V4 Pro и DeepSeek V4 Flash в режиме Max. Источник: DeepSeek.

Обе модели поддерживают вызовы инструментов и структурированный вывод в формате JSON, а максимальная длина генерации в API составляет 384 тысячи токенов. В документации DeepSeek отдельно описывает схему подключения V4 к Claude Code через совместимый с Anthropic эндпоинт: V4-Pro предлагается использовать на уровне моделей Opus или Sonnet, а V4-Flash — как более быстрый и дешевый аналог Haiku. Полноценной нативной поддержки Claude Code со стороны Anthropic здесь нет, но направление очевидно: DeepSeek хочет, чтобы ее модели оказались в инструменте, которым уже пользуются профессиональные разработчики, а массовому пользователю предлагается бесплатный чат. Также DeepSeek добавила поддержку новых ИИ-моделей в популярном агентном интерфейсе OpenClaw.

Выводы

Выход DeepSeek V4 ожидался всем ИИ-сообществом, и судя по ряду значительных нововведений, энтузиасты предвкушали DeepSeek V4 совсем не зря. Несмотря на то, что новинка не обходит флагманы OpenAI и Anthropic, но и не пытается этого делать: она предлагает прагматичный баланс между ценой, длиной контекста и качеством, который в условиях растущих требований к памяти многих агентных сценариев может оказаться востребованным. И важно понимать, что обе нейронки DeepSeek V4 Flash и DeepSeek V4 Pro обучались исключительно на китайских ИИ-ускорителях Huawei Ascend 950PR, что наглядно демонстрирует всему миру, как индустрия производства чипов Поднебесной практически сравнялась с зарубежными решениями Nvidia.
Автор: Serverflow Serverflow
Поделиться

Комментарии 5

Написать комментарий
Pavel
Flash с 13B активных параметров приближается к Pro. Это делает её реальной альтернативой для продакшна, где цена вывода критична.
Serverflow
Да, Flash-Max при достаточном числе шагов размышления даёт почти тот же результат, но с меньшими затратами на железо.
Олег
Обучение на Huawei Ascend 950PR: это важнее бенчмарков. Показывает, что Китай может выпускать конкурентные модели без Nvidia.
Serverflow
Согласны. DeepSeek V4: первый крупный open-source проект, полностью обученный на китайских чипах, что снижает зависимость от экспортных ограничений.
oldschool_it
DeepSeek V4 Pro обходит GPT-5.4 на Codeforces, но уступает по SimpleQA. Значит, инженерная задача решена лучше, чем фактологическая точность.
Serverflow
Да, кодинг и математика стали сильной стороной, а общие знания: зона роста. Это логично при фокусе на агентные сценарии.
Евгений
Гибридное внимание даёт 10% KV-кэша от V3.2, но это всё равно гигабайты на миллион токенов. Для рядового разработчика без A100 цифра остаётся абстрактной.
Serverflow
В V4 Pro на 1M токенов KV-кэш занимает около 2-3 ГБ вместо 20-30 ГБ у V3.2. Это уже реально разместить на одной consumer-карте.
Даниил
Почему в статье не сказано, на каких именно датасетах проходила дистилляция на основе политик? Это ключевой этап для переносимости навыков между экспертами.
Serverflow
Точные датасеты не раскрываются, но DeepSeek пишет, что использовали сгенерированные траектории от самой модели.
Написать отзыв
До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Написать комментарий

Комментарий появится на сайте после предварительной модерации

До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Мы свяжемся с вами утром

График работы: Пн-Пт 10:00-18:30 (по МСК)

Обработаем вашу заявку
в ближайший рабочий день

График работы: Пн-Пт 10:00-18:30 (по МСК)