Top.Mail.Ru
DeepSeek-V4-Flash-Vision-Exp вышла в open-source — мультимодальная модель с 305B параметров и контекстом 1M токенов | Блог Serverflow Скачать
прайс-лист
Бесплатная
доставка по РФ
Бонус за
обратную связь
Интернет-магазин
Серверного оборудования
8 (800) 222-70-01 Консультация IT-специалиста Сравнение

DeepSeek-V4-Flash-Vision-Exp вышла в open-source — мультимодальная модель с 305B параметров и контекстом 1M токенов

~ 2 мин
21
Простой
Новости
DeepSeek-V4-Flash-Vision-Exp вышла в open-source — мультимодальная модель с 305B параметров и контекстом 1M токенов

Введение

DeepSeek представила открытый исходный код DeepSeek-V4-Flash-Vision-Exp — первую экспериментальную мультимодальную модель в линейке V4. Новинка построена на базе текстовой архитектуры DeepSeek-V4-Flash, к которой добавлены визуальные модули и проведено дообучение для понимания изображений. Веса модели уже лежат на Hugging Face и ModelScope.

Подробнее о DeepSeek-V4-Flash-Vision-Exp

Архитектурно модель повторяет DeepSeek-V4-Flash, но дополнена визуальными модулями и прошла дополнительное обучение. Это позволило включить в нее способность анализировать изображения на вход (фотографии, PDF-файлы, презентации, видео и т.д.) без ухудшения производительности LLM-части модели. Общий объем модели составляет 305 миллиардов параметров, из которых 284 миллиардов являются общими (языковая + визуальная часть), а 13 миллиардов параметров активируются при инференсе за счет MoE-архитектуры, что сохраняет высокую эффективность модели на относительно легком железе. Контекстное окно достигает 1 048 576 токенов, позволяя работать с очень длинными входными последовательностями. По сравнению с текстовой версией DeepSeek-V4-Flash-0731 модель демонстрирует существенный прирост в мультимодальных агентных задачах, сохраняя сопоставимые показатели в текстовых сценариях.

В агентных задачах разница с DeepSeek-V4-Flash-0731 минимальна: Terminal Bench 2.1 — 83.9 против 82.7, DeepSWE — 59.3 против 54.4, Toolathlon-Verified — 75.9 против 70.3, AutomationBench — 25.7 против 25.1. В то же время в мультимодальных сценариях прогресс заметен: ApexBench Pass@1 вырос с 26.2 до 36.5, Agents' Last Exam — с 25.2 до 27.3. В бенчмарке Chartography, который отсутствует в текстовой версии, модель набирает 64.3, лишь немного уступая Claude Opus 4.8 (65.0). На ZeroBench Pass5 результат 35.0 против 34.0 у Opus 4.8. Сравнение с Claude Opus 4.8 показывает, что DeepSeek-V4-Flash-Vision-Exp приближается к закрытому флагману по ключевым показателям: Terminal Bench 2.1 — 83.9 против 85.0, Cybergym — 75.3 против 78.3, Toolathlon-Verified — 75.9 против 76.2, Agents' Last Exam — 27.3 против 25.7. Отставание остается в NL2Repo (57.7 против 69.7) и DSBench-Hard (63.6 против 71.7), но в целом модель уверенно конкурирует с более крупными проприетарными аналогами.

Выводы

DeepSeek-V4-Flash-Vision-Exp — это важный шаг к полноценной мультимодальной агентной экосистеме на базе открытых моделей. Эффективность в 13 млрд активных параметров при 305 млрд общих позволяет обслуживать зрительные задачи без значительного роста вычислительных затрат. Модель уже сейчас конкурирует с Claude Opus 4.8 в нескольких ключевых бенчмарках, особенно в агентных сценариях с визуальным вводом. Для разработчиков, работающих с длинным контекстом и изображениями, появление такой модели открывает доступ к продвинутым агентным возможностям без привязки к закрытым API.
Автор: Serverflow Serverflow
Поделиться

Комментарии 0

Написать комментарий
Сейчас тут ничего нет. Ваш комментарий может стать первым.
Написать отзыв
До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Написать комментарий

Комментарий появится на сайте после предварительной модерации

До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Мы свяжемся с вами утром

График работы: Пн-Пт 10:00-18:30 (по МСК)

Обработаем вашу заявку
в ближайший рабочий день

График работы: Пн-Пт 10:00-18:30 (по МСК)