Top.Mail.Ru
Сбер представил GigaEmbeddings — три новые открытые модели от 480M до 10B-A1.8B для векторного поиска | Блог Serverflow Скачать
прайс-лист
Бесплатная
доставка по РФ
Бонус за
обратную связь
Интернет-магазин
Серверного оборудования
8 (800) 222-70-01 Консультация IT-специалиста Сравнение

Сбер представил GigaEmbeddings — три новые открытые модели от 480M до 10B-A1.8B для векторного поиска

~ 2 мин
150
Простой
Новости
Сбер представил GigaEmbeddings — три новые открытые модели от 480M до 10B-A1.8B для векторного поиска

Введение

Сбер представил новое поколение ИИ-моделей GigaEmbeddings, нацеленных на задачи векторного поиска, семантического сравнения, классификации, кластеризации и других задач, связанных со структуризацией данных. В открытый доступ выложены сразу 3 модели разного масштаба: компактная 480M, универсальная 3B и новый MoE-флагман 10B-A1.8B с 10 миллиардами общих и 1,8 миллиарда активных параметров. Все модели совместимы с vLLM и SGLang, что упрощает их интеграцию в существующие продакшен-инфраструктуры. Ключевые улучшения по сравнению с предыдущим релизом касаются английского языка и задач с кодом, а флагманская модель заняла первое место в рейтинге ruMTEB, набрав 74,99 балла.

Подробнее о моделях GigaEmbeddings

Линейка построена на базе архитектур Qwen3, DeepSeek-V3 и GigaChat3, адаптированных под двунаправленное (encoder-style) внимание и дообученных под задачи обработки данных. Получение эмбеддингов выполняется через mean pooling по токенам с последующей L2-нормализацией, что позволяет более эффективно сравнивать векторы. Все всех веса хранятся в формате BF16.

Флагманская модель GigaEmbeddings 10B-A1.8B основана на архитектуре DeepSeek-V3 и имеет 26 слоев, 32 головы внимания и использует систему Multi-head Latent Attention. Слой Mixture-of-Experts включает 64 маршрутизируемых эксперта и 1 общий, с активацией четырех экспертов на токен. На vLLM эта модель работает в 1,5 раза быстрее, чем Qwen3 Embedding 4B. Модель GigaEmbeddings 3B построена на собственной предобученной архитектуре Qwen3 и имеет 36 слоев, 16 голов внимания и 8 KV-голов. Она показала особенно заметный прогресс в задачах с кодом: результат вырос с 62,37 у предыдущего релиза до 76,93, а в рейтинге engMTEB заняла второе место среди моделей своего размера и меньше. Это делает ее сильным универсальным решением для мультиязычных сценариев. Компактная GigaEmbeddings 480M использует ту же базовую архитектуру Qwen3, но с 28 слоями. Модель дополнительно обучена методом дистилляции от более сильных моделей, что позволило сохранить высокое качество результатов при минимальном размере. Она ориентирована на высоконагруженный поиск и сценарии, где критичны скорость и стоимость инференса.

Выводы

Сбер продолжает активно развивать свою линейку открытых эмбеддинг-моделей, предлагая полный спектр решений — от сверхлегкой 480M до 10B MoE-флагмана, который обходит по скорости более мелкие аналоги и при этом лидирует в русскоязычном рейтинге. Для бизнеса, работающего с большими базами знаний, документами и клиентской поддержкой, появление таких моделей в открытом доступе означает возможность строить высокоточный семантический поиск без привязки к облачным API и с полным контролем над данными. Все модели уже доступны на Hugging Face.
Автор: Serverflow Serverflow
Поделиться

Комментарии 2

Написать комментарий
ironbyte
Почему для флагманской модели выбрана архитектура DeepSeek-V3, а не собственная Qwen3, как для 3B и 480M? Чем это решение обосновано?
Serverflow
Выбор продиктован компромиссом между качеством и скоростью: MoE-архитектура DeepSeek-V3 позволила добиться рекордных 74,99 балла в ruMTEB при меньшем числе активных параметров.
Максим
Если я правильно понял, для модели 480M использована дистилляция от более сильных моделей. Это значит, что на практике она может давать surprisingly хорошие результаты для своего размера, или всё же есть заметное падение качества на специфичных задачах, например на редких доменных терминах?
Serverflow
Да, дистилляция позволяет модели 480M хорошо обобщать на большинство задач, но на узкопредметных запросах с редкой лексикой разрыв с флагманом может быть заметен. Рекомендуем сверять на своих данных.
Написать отзыв
До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Написать комментарий

Комментарий появится на сайте после предварительной модерации

До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Мы свяжемся с вами утром

График работы: Пн-Пт 10:00-18:30 (по МСК)

Обработаем вашу заявку
в ближайший рабочий день

График работы: Пн-Пт 10:00-18:30 (по МСК)