03.08.2026
Китайская MiniMax опубликовала веса 33-миллиардной мультимодальной модели H3, которая на момент релиза заняла первое место в категории Video Editing рейтинга Artificial Analysis. Локально модель генерирует ролики длительностью до 15 секунд в разрешении 768p со стереозвуком, тогда как компоненты для подготовки контекста и вывода в 2K остались закрытыми.
Китайская компания MiniMax, разработчик генеративных моделей, опубликовала веса MiniMax H3. По данным Artificial Analysis, на момент публикации H3 занимала первое место в категории Video Editing, второе — в Text-to-Video и третье — в Image-to-Video. Это первая модель с открытыми весами, возглавившая один из видеорейтингов сервиса.
H3 представляет собой мультимодальную систему с 33-миллиардным трансформером, совместно обрабатывающую текст, изображения, видео и звук. Один запрос может включать до девяти изображений, трёх видеороликов и трёх аудиозаписей. Модель создаёт видео длительностью от 4 до 15 секунд с частотой 24 кадра в секунду и стереозвуком 32 кГц.
В открытый релиз вошли контрольные точки H3-Base для генерации по тексту, начальным и конечным кадрам, а также мультимодальным референсам. При локальном запуске вывод ограничен разрешением 768p. Система подготовки запросов H3-Context-IR и модуль повторной генерации H3-Regenerate-2K не опубликованы и доступны через API MiniMax. Для развёртывания заявлена поддержка SGLang, vLLM, Diffusers и ComfyUI; веса разрешено дообучать.
Лицензия MiniMax H3 содержит существенные ограничения. Она не действует в США, Евросоюзе, Великобритании и Южной Корее — организациям из этих регионов необходимо получать отдельное разрешение. Письменная авторизация MiniMax также требуется для коммерческих продуктов и сервисов с годовой выручкой свыше 20 млн долларов.
Источник: huggingface.co