Дочерняя компания Сбер Kandinsky Lab представила Kandinsky 6.0 Video — новое семейство открытых диффузионных моделей, которые генерируют видео сразу с синхронизированным звуком. Команда выкладывает в открытый доступ сразу восемь моделей: шесть TI2VA-моделей для генерации видео со звуком по тексту и изображению и две модели для видео-апскейла (Video Super Resolution). Размер моделей — от 1 до 29 миллиардов параметров, поэтому запустить их можно как на серверных GPU, так и на потребительских видеокартах. Веса, код и интеграция с Diffusers распространяются под лицензией MIT на Hugging Face, а в этом году Kandinsky 6.0 также станет доступен в FastVideo, SGLang и vLLM-Omni.
Подробнее о Kandinsky 6.0 Video
Главное отличие Kandinsky 6.0 от предыдущего поколения Kandinsky 5.0 — нативная генерация звука. Обе базовые версии, Lite на 3 млрд параметров и Pro на 29 млрд параметров, создают 5-секундные ролики с синхронизированным аудио 44 кГц, включая липсинк. Модели работают в двух режимах: генерация видео со звуком по текстовому описанию (T2AV) и по изображению с текстом (TI2AV), где картинка задает первый кадр ролика. При необходимости звук можно отключить и генерировать только видео.
Для каждой версии доступны три чекпоинта: pretrain — модель после предобучения, полезная для исследований и дообучения; основная модель после SFT и RL-дообучения, которая генерирует за 50 шагов; distill — дистиллированная версия, которой достаточно 10 шагов, что многократно ускоряет генерацию. Полный список TI2VA-моделей:
Kandinsky-6.0-Pro-5s-Diffusers — 29 млрд параметров (58 ГБ)
Kandinsky-6.0-Pro-distill-5s-Diffusers — 29 млрд параметров (58 ГБ)
Kandinsky-6.0-Pro-pretrain-5s-Diffusers — 29 млрд параметров (58 ГБ)
Kandinsky-6.0-Lite-5s-Diffusers — 3 млрд параметров (6 ГБ)
Kandinsky-6.0-Lite-distill-5s-Diffusers — 3 млрд параметров (6 ГБ)
Kandinsky-6.0-Lite-pretrain-5s-Diffusers — 3 млрд параметров (6 ГБ)
Две VSR-модели на 1 млрд параметров (2 ГБ) поднимают разрешение сгенерированных роликов до Full HD (1920×1080): Kandinsky-6.0-VSR-5s-Diffusers работает за 4 шага на тайл, а дистиллированная Kandinsky-6.0-VSR-distilled2steps-5s-Diffusers — всего за 2 шага.
В основе Kandinsky 6.0 лежит двухпотоковая архитектура CrossDiT: видеопоток унаследован от Kandinsky 5.0, а аудиопоток обучен с нуля, и оба связаны двунаправленным кросс-вниманием для синхронизации звука и картинки по времени и смыслу. Сначала команда обучила аудиопоток на большом корпусе аудиоданных, затем оба потока совместно на парных видео со звуком, после чего провела SFT, дообучение с подкреплением и дистилляцию. По данным разработчиков, RL-этап снизил ошибку распознавания речи (WER) у Pro-версии на 47%.
На бенчмарке VABench Kandinsky 6.0 Pro показывает лучшие результаты в сравнении с LTX 2.5 и Kandinsky 6.0 Lite по качеству речи, эстетике звука, согласованности аудио и видео, липсинку и визуальному реализму. В слепом сравнении с участием людей Pro-версия уверенно обходит Kandinsky 5.0 Video Pro, а также выигрывает у LTX 2.5 по качеству и реалистичности движения, следованию промпту и количеству артефактов. По качеству речи преимущество над LTX 2.5 статистически значимо.
Модели уже поддерживаются в Diffusers и ComfyUI, а в течение года появятся в FastVideo, SGLang и vLLM-Omni.
Выводы
Kandinsky 6.0 переходит от генерации немого видео к полноценным роликам со звуком, речью и липсинком — именно в этом направлении сейчас движутся ведущие видеомодели индустрии ИИ. Выпуск сразу восьми моделей от 1 до 29 млрд параметров закрывает почти все сценарии: Lite подойдет для домашних видеокарт и быстрых экспериментов, Pro — для максимального качества, distill-версии — для продакшена, где важна скорость, а pretrain-чекпоинты — для исследователей и дообучения под свои задачи. Открытая лицензия MIT и грядущая поддержка FastVideo, SGLang и vLLM-Omni делают Kandinsky 6.0 одним из самых доступных open-source решений для генерации видео со звуком, которое легко встроить как в любительские пайплайны, так и в корпоративные сервисы.
Сейчас тут ничего нет. Ваш комментарий может стать первым.
Скидка 1 500 ₽ или бесплатная доставка - уже сейчас 🔥
Мы ценим обратную связь от клиентов. При оформлении заказа вы можете сообщить о своём намерении поделиться впечатлением о работе ServerFlow после получения товара.
* - скидка предоставляется при покупке от 30 000 рублей, в ином случае предусмотрена бесплатная доставка до ПВЗ СДЭК.
Продолжная использовать наш сайт, вы даете согласие на использование файлов Cookie, пользовательских данных (IP-адрес, вид операционной системы, тип браузера, сведения о местоположении, источник, откуда пришел на сайт пользователь, с какого сайта или по какой рекламе, какие страницы
открывает и на какие страницы нажимает пользователь) в целях функционирования сайта, проведения статистических исследований и обзоров. Если вы не хотите, чтобы ваши данные обрабатывались, покиньте сайт.
При оформлении заказа в ServerFlow вы можете сообщить о намерении оставить отзыв о нашей работе после получения товара.
Нам важно ваше честное мнение. Оно помогает развивать сервис и даёт другим клиентам представление о нашей работе.
Вы можете оставить отзыв на удобной для вас платформе:
Google Maps
2GIS
Яндекс Карты
Как работает акция
Применяя промокод, вы подтверждаете намерение поделиться впечатлением о работе ServerFlow после получения заказа. Мы применяем бонус уже к текущему заказу в знак благодарности за обратную связь.
Условия акции:
скидка 1 500 ₽ при заказе от 30 000 ₽
или бесплатная доставка* при заказе до 30 000 ₽
* Бесплатная доставка заказа осуществляется до ПВЗ СДЭК.