Top.Mail.Ru
MiniMax H3 вышла в open-source — первая генеративная модель MiniMax с 33 млрд параметров и развертыванием на 21 ГБ VRAM | Блог Serverflow Скачать
прайс-лист
Бесплатная
доставка по РФ
Бонус за
обратную связь
Интернет-магазин
Серверного оборудования
8 (800) 222-70-01 Консультация IT-специалиста Сравнение

MiniMax H3 вышла в open-source — первая генеративная модель MiniMax с 33 млрд параметров и развертыванием на 21 ГБ VRAM

~ 2 мин
245
Простой
Новости
MiniMax H3 вышла в open-source — первая генеративная модель MiniMax с 33 млрд параметров и развертыванием на 21 ГБ VRAM

Введение

Всего через несколько дней после облачного запуска MiniMax опубликовала на Hugging Face и ModelScope открытые веса MiniMax H3 — первой генеративной мультимодальной ИИ-модели компании. MiniMax принимает на вход текст, изображения, видео и аудио, создавая высококачественные видео до 15 секунд в разрешении до 2К со стереозвуком 32 кГц. Модель поддерживает 11 языков, включая русский, и способна работать в системах всего с 12-21 ГБ VRAM (минимальное/комфортное развертывание), что делает MiniMax H3 одной из самых доступных генеративных моделей такого класса.

Подробнее о MiniMax H3

Архитектура MiniMax H3 состоит из трех отдельных модулей, каждый из которых решает свою задачу в конвейере генерации.
  • MiniMax H3-Context-IR — принимает мультимодальные входные данные произвольной формы и интерпретирует взаимосвязи между текстом, изображениями, аудио и видео, а также то, как эти материалы соотносятся с предполагаемым результатом генерации. Использует синтаксический анализ инструкций, кросс-модальную ассоциацию, понимание временных связей и сложные логические рассуждения, выдавая структурированное промежуточное представление контекста, которое затем передается в генеративный движок.
  • MiniMax H3-Base — генеративное ядро, получающее промежуточное представление контекста и создающее видео разрешением 768p с синхронным стереозвуком. В его основе лежит Omni-Transformer с 33 млрд параметров, из которых около 13 млрд используются для слоев AdaLN. Поскольку выходные данные модуляции AdaLN можно вычислить заранее и закэшировать, эти параметры не нужно загружать при инференсе, что существенно снижает требования к памяти и объясняет возможность запуска на 21 ГБ VRAM.
  • MiniMax H3-Regenerate-2K — увеличивает разрешение с 768p до 2K. Использует MiniMax H3-Base для повторной генерации видео в контексте исходного мультимодального ввода. Такой подход позволяет максимально задействовать генеративные способности MiniMax H3-Base и восстанавливать информацию, которая была бы потеряна при обычном масштабировании — мелкий текст, тонкие детали и текстуры. Этот модуль пока также не открыт, но доступен через API.
Архитектура MiniMax H3
Архитектура модели MiniMax H3. Источник: Hugging Face.

Помимо основных модулей MiniMax H3, архитектура модели также включает дополнительные компоненты, оптимизирующие возможности флагманской нейросети.

Текст обрабатывается кодировщиком MiniMax H3-Encoder, который использует полностью обученные веса Qwen3-VL-32B и передает скрытые состояния в Omni-Transformer. Визуальные данные проходят через MiniMax H3-VisualVAE — видеоавтокодировщик с функцией размышления. Аудио обрабатывается H3-AudioVAE, который сжимает звук частотой 32 кГц в последовательность латентных токенов с временной частотой 40 Гц.

В open source выложены две контрольные точки MiniMax H3-Base, каждая из которых содержит модель Omni-Transformer, а также все необходимые компоненты: токенизатор, текстовый энкодер, Visual VAE и Audio VAE и т.д.
  • MiniMax H3-Base-FL2VA поддерживает преобразование текста в аудио-видео и режим работы с первым и/или последним кадром. Модель может принимать ноль, одно или два изображения: без изображений — классический текст-в-видео, одно изображение — генерация видео с заданным первым или последним кадром, два изображения — видео, начинающееся и заканчивающееся указанными кадрами.
  • MiniMax H3-Base-Ref2VA — более гибкий вариант, поддерживающий до девяти изображений, трёх видеоклипов или трёх аудиоклипов в качестве референсов. Видео и аудиоклипы должны длиться от 2 до 15 секунд, общая продолжительность всех клипов не превышает 15 секунд. Аудио не может быть единственным вводом и должно сопровождаться изображением или видео.
MiniMax H3 генерирует видео длительностью от 4 до 15 секунд с частотой 24 кадра в секунду. Поддерживается широкий диапазон соотношений сторон: от 21:9 до 9:16, включая стандартные 16:9, 4:3 и 1:1. По умолчанию короткая сторона имеет размер 768 пикселей, а при использовании H3-Regenerate-2K выходное разрешение повышается до 2K. Аудиовыход — стерео 32 кГц.

MiniMax подготовила интеграции с основными фреймворками для инференса. Пользователям доступны движки SGLang и vLLM, а также шаблоны для ComfyUI — отдельно для режимов T2V (текст-в-видео) и R2V (референс-в-видео). Все контрольные точки хранятся в точности BF16. Требование к оптимальному развертыванию в 21 ГБ VRAM и минимальному развертыванию в 12 ГБ VRAM делает модель доступной для запуска на потребительских видеокартах уровня RTX 4090 и RTX 3060 соответственно.

Выводы

С момента выхода FLUX 2 и Wan 2.2 рынок открытых генеративных моделей находился в застое: всё внимание сообщества было приковано к большим языковым моделям, а диффузионные архитектуры отошли на второй план. MiniMax H3 ломает эту паузу, возвращая генеративные модели в актуальную open‑source‑повестку, причём сразу с набором характеристик, которые ещё недавно казались несовместимыми в одном решении. Модель генерирует 2K‑видео длительностью до 15 секунд, принимает на вход текст, изображения, видео и аудио, выдаёт результат со стереозвуком 32 кГц — и всё это укладывается в 21 ГБ видеопамяти, то есть запускается на одной потребительской карте. Ни FLUX 2, ни Wan 2.2 не предлагали ничего близкого по сочетанию длительности, разрешения, мультимодальности и системных требований. Фактически H3 задаёт новую планку доступности для генеративного видео, доказывая, что диффузионные и гибридные архитектуры не исчерпали себя и способны давать качественный скачок даже на фоне тотального доминирования LLM. 
Автор: Serverflow Serverflow
Поделиться

Комментарии 0

Написать комментарий
Сейчас тут ничего нет. Ваш комментарий может стать первым.
Написать отзыв
До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Написать комментарий

Комментарий появится на сайте после предварительной модерации

До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Мы свяжемся с вами утром

График работы: Пн-Пт 10:00-18:30 (по МСК)

Обработаем вашу заявку
в ближайший рабочий день

График работы: Пн-Пт 10:00-18:30 (по МСК)