Мы уже тестируем H3 - новую видеомодель MiniMax в GPTunneL.
Первые тесты дают главное ощущение: H3 ориентирована на управляемое видео, а не только на красивый кадр. Для AI-видео это как раз то, что важно не в деморолике, а в реальной работе.
MiniMax H3 выйдет в начале августа и будет конкурировать с Seedance 2.0 от ByteDance. При этом H3 должна быть заметно дешевле, что может быстро сделать модель заметной для команд, которые регулярно генерируют видео.
Что такое MiniMax H3
MiniMax H3 - это мультимодальная модель для генерации видео. В материалах MiniMax она обозначена как H3 Multimodal Video Generation Model, а API-модель указана как MiniMax-H3.
Главная идея - один API для нескольких сценариев: генерация видео по тексту, управление ключевыми кадрами, работа с мультимодальными референсами и продолжение видео или аудио.
Отдельный акцент MiniMax делает на нативно синхронизированном аудио. То есть звук должен быть не отдельной надстройкой после генерации, а частью самого результата.
Первый взгляд
Первое впечатление хорошее: H3 ощущается более управляемой, чем многие видеомодели первого контакта. Она реже теряет смысл запроса и лучше удерживает сцену в рамках заданной идеи.
Это особенно заметно в задачах, где видео должно быть не просто красивым, а понятным. Например, когда персонаж должен сделать конкретное действие, объект должен остаться узнаваемым, а сцена должна развиваться без резких смысловых провалов.
Пока это именно первый взгляд, а не финальный вердикт. Но уже сейчас H3 выглядит как модель, за которой стоит следить.
Что умеет H3
У H3 заявлены четыре ключевых режима:
- Text to Video: один промпт генерирует динамический клип с синхронизированным звуком длительностью 5-15 секунд;
- Keyframe Control: можно загрузить первый и последний кадр, чтобы зафиксировать начало и конец сцены, а движение между ними модель достроила естественно;
- Multimodal Reference: модель поддерживает до 9 изображений, 3 видео и 3 аудио-референсов, чтобы сохранять объект или персонажа между сценами;
- A/V Continuation: можно продолжить загруженное видео или аудио, а результат должен бесшовно сшиваться с исходным материалом; заявленная длительность - до 20 секунд.
Это делает H3 интересной не только для генерации роликов с нуля. Модель должна подойти и для более управляемой работы: с референсами, начальным и финальным кадром, продолжением уже готового материала и синхронным звуком.
Почему сравнение с Seedance 2.0 важно
Seedance 2.0 сейчас остается одним из главных ориентиров в AI-видео. Ее часто обсуждают в контексте динамичных сцен, физики движения, стабильности персонажей и качества коротких коммерческих роликов.
Поэтому сравнение H3 именно с Seedance 2.0 хорошо показывает, куда целится MiniMax. Это не просто еще одна видеомодель для экспериментов, а заявка на рабочий инструмент для креативных и production-задач.
Цена здесь важна почти так же сильно, как качество. В AI-видео один удачный ролик часто получается после нескольких попыток, поэтому стоимость каждой генерации напрямую влияет на то, можно ли использовать модель регулярно.
Для H3 это важный контекст: если качество подтвердится на практике, более доступная стоимость может стать не второстепенной деталью, а одним из главных аргументов модели.
Где H3 может быть полезна
H3 выглядит особенно интересной для креативного производства:
- короткие рекламные ролики;
- social video для TikTok, Reels, Shorts и похожих форматов;
- визуальные концепты для брендов и продуктов;
- сториборды и превизуализация;
- генерация сцен по текстовому описанию;
- работа с изображениями, видео и аудио-референсами;
- продолжение уже готовых видео или аудио;
- ролики, где важна синхронизация изображения и звука;
- быстрые тесты разных визуальных направлений.
Отдельно стоит смотреть на физику движения, человеческие действия и связность объектов внутри сцены. Именно эти вещи часто отделяют красивое демо от модели, которой можно пользоваться каждый день.
Что это значит для рынка
H3 интересна не только как еще одна модель для генерации видео. MiniMax сразу выводит ее в зону, где сейчас сильна Seedance 2.0: короткие динамичные ролики, управление сценой, работа с референсами и попытка сделать звук частью результата.
Если H3 подтвердит первые впечатления и сохранит более доступную стоимость, конкуренция в AI-видео станет заметно практичнее. Для команд это вопрос не только качества кадра, но и цены каждой итерации: чем дешевле пробовать разные варианты, тем легче использовать видеогенерацию в регулярной работе.
Для пользователей GPTunneL это будет удобный способ проверить H3 рядом с другими видеомоделями и быстрее понять, где она действительно выигрывает.



