MiniMax H3 Max: видео быстрее реального времени

MiniMax H3 Max: видео быстрее реального времени

MiniMax H3 Max появилась в GPTunneL. Это версия открытой MiniMax H3, которую команда fal дообучила на новых данных и ускорила вместе с собственным инференс-стеком. Главная цифра релиза: пятисекундное видео в 768p генерируется менее чем за три секунды. То есть модель выдаёт готовый ролик быстрее, чем он проигрывается.

Для меня здесь важен не рекорд сам по себе. Если время генерации действительно укладывается в несколько секунд, работа с AI-видео перестаёт быть очередью из долгих попыток и становится коротким циклом: поменял промпт, сразу увидел результат, поправил сцену, запустил следующий вариант.

Сразу разделю источники. Скорость в три секунды и лидерство во внутренних сравнениях - данные fal, а не наш собственный тест. Отдельно есть независимый рейтинг Artificial Analysis. Он подтверждает сильное качество H3 Max, но не даёт права назвать модель абсолютным лидером во всех режимах.

Чем MiniMax H3 Max отличается от обычной H3

Базовая MiniMax H3 - открытая мультимодальная видеомодель с text-to-video, image-to-video и нативно синхронизированным звуком. H3 Max не новое поколение MiniMax, а дообученная и специально ускоренная версия этой модели.

По описанию fal, команда добавила значительный объём новых данных во время post-training и отдельно работала над двумя вещами: точностью следования промпту и визуальным качеством. Параллельно инженеры оптимизировали инференс. Ускорение оставляли только в том случае, если оно не ухудшало результаты во внутренних preference-тестах.

Это важное отличие от обычного подхода, когда уже готовую модель пытаются ускорить отдельно от её обучения. В H3 Max модель и серверный контур настраивали вместе. Поэтому заявленная скорость относится не только к весам, а ко всей связке из модели, оптимизированного движка и оборудования fal.

Модель и инференс-система H3 Max оптимизируются вместе, сохраняя скорость и качество видеопотока

В GPTunneL доступны два основных сценария H3 Max: генерация видео по тексту и оживление исходного изображения. Нативный звук сохранился от H3 и создаётся вместе с видеорядом.

Официальный пример text-to-video показывает, как модель собирает сцену с персонажем, окружением, движением камеры и звуковой атмосферой из одного подробного промпта:

Что значит быстрее реального времени

fal заявляет, что H3 Max создаёт пятисекундный ролик в 768p менее чем за три секунды. По их расчёту, это примерно в 35 раз больше throughput, чем у официального эндпоинта MiniMax H3, и в среднем в 15 раз быстрее моделей сопоставимого качества из внутреннего сравнения fal.

Throughput и пользовательское ожидание - не одно и то же. К времени работы модели могут добавиться очередь, загрузка исходного изображения, передача готового файла и обработка в интерфейсе. Поэтому фразу "три секунды" стоит читать как время инференса в инфраструктуре fal, а не как гарантию полного ответа с точностью до миллисекунды для каждого запроса.

Но даже с этой оговоркой порядок величины меняет продуктовый опыт. Раньше на одну идею можно было потратить несколько минут, а потом обнаружить, что персонаж сделал не то движение. Теперь за сопоставимое время можно проверить несколько формулировок промпта, ракурсов или вариантов сцены.

Быстрый цикл итераций H3 Max: одна сцена превращается в несколько вариантов видео

Вот официальное image-to-video демо, в котором модель сама проговаривает ключевую идею релиза:

Это ещё не потоковое видео и не генерация бесконечной сцены в реальном времени. H3 Max по-прежнему создаёт отдельный готовый клип. Зато цикл между решением и результатом становится достаточно коротким для почти интерактивной работы.

Что известно о качестве

У fal есть собственное сравнение с двенадцатью ведущими видеомоделями. Люди вслепую выбирали лучший результат по общему впечатлению, пониманию промпта и эстетике. В этом внутреннем тесте H3 Max заняла первое место во всех трёх категориях и обошла исходную H3.

Относиться к этому нужно как к результату вендора. Методика описана, но набор промптов, выбор моделей и инфраструктура принадлежат самой fal.

Независимая картина тоже сильная, но точнее:

  • в рейтинге Artificial Analysis для image-to-video со звуком H3 Max на момент публикации занимает первое место с Elo около 1200, выше Seedance 2.0, исходной H3 и Gemini Omni Flash;
  • в рейтинге text-to-video со звуком модель идёт третьей с Elo около 1240. Её доверительный интервал пересекается с лидерами, поэтому статистически это одна верхняя группа, а не убедительная победа H3 Max;
  • Seedance 2.5 в этих независимых таблицах пока нет. Сравнивать H3 Max с ней по Artificial Analysis сейчас нельзя.

То есть корректный вывод такой: H3 Max уже находится среди лучших видеомоделей со звуком, а в image-to-video сейчас лидирует. Формулировка "лучшая видеомодель вообще" была бы сильнее данных.

Ещё один официальный пример проверяет быстрое движение, инерцию ткани и взаимодействие рук с небольшим объектом. Это как раз тип сцены, где ускоренные модели часто начинают терять физику:

Сколько стоит H3 Max в GPTunneL

Мы продаём H3 Max по нашей обычной модели оплаты за использование, без подписки:

  • 10 ₽ за секунду готового видео в 480p;
  • 16 ₽ за секунду в 768p.

Пятисекундный ролик стоит 50 ₽ в 480p или 80 ₽ в 768p. Для итераций я бы начинал с 480p: так дешевле проверить композицию, действие и промпт. Когда сцена уже работает, финальный вариант можно сделать в 768p.

Это цены GPTunneL, а не пересчёт тарифа fal. Актуальный расчёт под нужную длительность всегда можно проверить на странице цен.

Что пока остаётся ограничением

Скорость H3 Max зависит от серверной оптимизации. Даже если fal опубликует веса, результат быстрее реального времени не перенесётся автоматически на домашнюю видеокарту. В обсуждении на Reddit сейчас ссылаются на заявление CTO fal о планах выпустить веса, но на момент публикации их ещё нет и даты релиза тоже нет. Открытой остаётся базовая H3, не H3 Max.

Вторая граница - короткий формат. Быстрая пятисекундная генерация отлично подходит для рекламных кадров, анимации продукта, social video, сторибордов и перебора визуальных направлений. Она не заменяет монтаж длинной истории и не гарантирует, что сложная сцена с несколькими персонажами получится с первой попытки.

Наконец, лидерборд измеряет среднее предпочтение на своём наборе запросов. Твоя задача может требовать точного диалога, определённой физики, сохранения персонажа или длинного непрерывного действия. Для выбора модели всё равно полезнее сравнить один и тот же рабочий промпт, чем смотреть только на место в таблице.

Кому я бы рекомендовал H3 Max

H3 Max стоит выбирать, когда важны короткие ролики со звуком и много быстрых итераций: рекламные концепты, движение из исходного изображения, варианты кадра для соцсетей, превизуализация и проверка промптов. Главный выигрыш здесь не в том, что один ролик появился на минуту раньше, а в том, что за одну рабочую сессию можно проверить гораздо больше гипотез.

Открой MiniMax H3 Max в лаборатории GPTunneL. Модель работает без VPN, пополнить баланс можно российской картой в рублях, обязательной подписки нет.