MiniMax H3 Max доступна в GPTunneL с первого дня релиза — 28 августа. Не «через неделю после хайпа», а в день анонса fal: модель сразу открыта и в Креатив.Лабе, и отдельным блоком в Воркфлоу, и через CreativeLab API. Это версия открытой MiniMax H3, которую команда fal дообучила на новых данных и ускорила вместе с собственным инференс-стеком. Главная цифра релиза: пятисекундное видео в 768p генерируется менее чем за три секунды — быстрее, чем ролик проигрывается.
Для меня здесь важен не рекорд сам по себе. Если время генерации действительно укладывается в несколько секунд, работа с AI-видео перестаёт быть очередью из долгих попыток и становится коротким циклом: поменял промпт, сразу увидел результат, поправил сцену, запустил следующий вариант.
Сразу разделю источники. Скорость в три секунды и лидерство во внутренних сравнениях — данные fal, а не наш собственный тест. Параметры, цены и режимы работы ниже — наши, из живого каталога платформы. Отдельно есть независимый рейтинг Artificial Analysis: он подтверждает сильное качество H3 Max, но не даёт права назвать модель абсолютным лидером во всех режимах.
Чем MiniMax H3 Max отличается от обычной H3
Базовая MiniMax H3 — открытая мультимодальная видеомодель с text-to-video, image-to-video и нативно синхронизированным звуком. H3 Max не новое поколение MiniMax, а дообученная и специально ускоренная версия этой модели.
По описанию fal, команда добавила значительный объём новых данных во время post-training и отдельно работала над двумя вещами: точностью следования промпту и визуальным качеством. Параллельно инженеры оптимизировали инференс — модель обучали и обслуживают на системах NVIDIA GB200 NVL72. Ускорение оставляли только в том случае, если оно не ухудшало результаты во внутренних preference-тестах.
Это важное отличие от обычного подхода, когда уже готовую модель пытаются ускорить отдельно от её обучения. В H3 Max модель и серверный контур настраивали вместе. Поэтому заявленная скорость относится не только к весам, а ко всей связке из модели, оптимизированного движка и оборудования fal.

Официальный пример text-to-video показывает, как модель собирает сцену с персонажем, окружением, движением камеры и звуковой атмосферой из одного подробного промпта:
Что значит быстрее реального времени
fal заявляет, что H3 Max создаёт пятисекундный ролик в 768p менее чем за три секунды. По их расчёту, это примерно в 35 раз больше throughput, чем у официального эндпоинта MiniMax H3, и в среднем в 15 раз быстрее моделей сопоставимого качества из внутреннего сравнения fal. Независимый Design Arena, на который ссылается fal, ставит H3 Max на первое место и оценивает разрыв с исходной H3 в 50 раз по скорости.
Throughput и пользовательское ожидание — не одно и то же. К времени работы модели могут добавиться очередь, загрузка исходного изображения, передача готового файла и обработка в интерфейсе. Поэтому фразу «три секунды» стоит читать как время инференса в инфраструктуре fal, а не как гарантию полного ответа с точностью до миллисекунды для каждого запроса.
Но даже с этой оговоркой порядок величины меняет продуктовый опыт. Раньше на одну идею можно было потратить несколько минут, а потом обнаружить, что персонаж сделал не то движение. Теперь за сопоставимое время можно проверить несколько формулировок промпта, ракурсов или вариантов сцены.

Вот официальное image-to-video демо, в котором модель сама проговаривает ключевую идею релиза:
Это ещё не потоковое видео и не генерация бесконечной сцены в реальном времени. H3 Max по-прежнему создаёт отдельный готовый клип. Зато цикл между решением и результатом становится достаточно коротким для почти интерактивной работы.
Что известно о качестве
У fal есть собственное сравнение с двенадцатью ведущими видеомоделями — среди названных Veo 3.1, Kling 3, Seedance 2.5, Wan 3.0, Gemini Omni Flash и исходная H3. Люди вслепую выбирали лучший результат по трём измерениям: общее впечатление, понимание промпта и эстетика. Результаты считали байесовским Elo с 95-процентными доверительными интервалами. В этом внутреннем тесте H3 Max заняла первое место во всех трёх категориях и выиграла большинство прямых сравнений.
Относиться к этому нужно как к результату вендора. Методика описана, но набор промптов, выбор моделей и инфраструктура принадлежат самой fal.
Независимая картина тоже сильная, но точнее:
- в рейтинге Artificial Analysis для image-to-video со звуком H3 Max на момент публикации занимает первое место с Elo около 1200, выше Seedance 2.0, исходной H3 и Gemini Omni Flash;
- в рейтинге text-to-video со звуком модель идёт третьей с Elo около 1240. Её доверительный интервал пересекается с лидерами, поэтому статистически это одна верхняя группа, а не убедительная победа H3 Max;
- Seedance 2.5 в этих независимых таблицах пока нет. Сравнивать H3 Max с ней по Artificial Analysis сейчас нельзя.
То есть корректный вывод такой: H3 Max уже находится среди лучших видеомоделей со звуком, а в image-to-video сейчас лидирует. Формулировка «лучшая видеомодель вообще» была бы сильнее данных.
Практическое следствие для нас важнее места в таблице. Почти весь список, с которым сравнивалась fal, лежит в нашем же каталоге: Veo 3.1, Kling 3, Seedance 2.5, Wan 3.0, Gemini Omni и исходная H3. Поэтому лидерборд можно не принимать на веру: прогони один и тот же рабочий промпт по четырём моделям с одного баланса и посмотри, что выигрывает именно на твоём материале. Это единственное сравнение, которое действительно про твою задачу.
Ещё один официальный пример проверяет быстрое движение, инерцию ткани и взаимодействие рук с небольшим объектом. Это как раз тип сцены, где ускоренные модели часто начинают терять физику:
Что H3 Max умеет в GPTunneL
Мы открыли модель не урезанной — в Креатив.Лабе и в Воркфлоу доступен полный набор параметров:
| Параметр | Значения |
|---|---|
| Разрешение | 480p, 768p (по умолчанию 768p) |
| Длительность | от 5 до 15 секунд |
| Соотношение сторон | авто, 1:1, 3:4, 4:3, 9:16, 16:9, 21:9 |
| Вход | текст, первый кадр, последний кадр |
| Промпт | до 7000 символов, с улучшайзером в Лабе |
| Картинка на вход | JPEG, PNG, WebP до 30 МБ, 256-5760 px |
Два уточнения, которые экономят время. Первое: режимов не два, а три. Кроме text-to-video и оживления картинки есть первый и последний кадр одновременно — модель достраивает переход между двумя изображениями. Это самый управляемый способ получить нужное движение, если конечное состояние сцены важно не меньше начального.
Второе: как только ты загружаешь первый кадр, соотношение сторон переключается в «авто» и берётся из самого изображения. Это не баг интерфейса, а требование модели — кадрируй исходник заранее, если нужен конкретный формат.
Нативный звук сохранился от H3 и создаётся вместе с видеорядом. В Воркфлоу H3 Max встаёт обычным блоком: на вход можно подать картинку из предыдущего шага — скажем, кадр, сгенерированный Grom Art или Seedream, — а на выходе передать ролик дальше в липсинк или апскейл. При такой сборке скорость модели перестаёт быть просто приятной цифрой: она сокращает время всего конвейера, а не одного шага.
Сколько стоит H3 Max в GPTunneL
Мы продаём H3 Max по нашей обычной модели оплаты за использование, без подписки:
- 10 ₽ за секунду готового видео в 480p;
- 16 ₽ за секунду в 768p.
Пятисекундный ролик стоит 50 ₽ в 480p или 80 ₽ в 768p, максимальные 15 секунд — 150 ₽ и 240 ₽ соответственно. Для итераций я бы начинал с 480p: так дешевле проверить композицию, действие и промпт. Когда сцена уже работает, финальный вариант можно сделать в 768p.
Отдельный вопрос — когда брать H3 Max, а когда обычную H3. H3 стоит 13 ₽ за секунду, но выдаёт 2K. То есть H3 Max дороже за секунду и ниже по разрешению: платишь ты не за картинку, а за скорость итераций. Логика выбора простая — перебор идей и черновики на H3 Max, финальный кадр под большой экран на H3 или другой 1080p-модели.
Это цены GPTunneL, а не пересчёт тарифа fal. Актуальный расчёт под нужную длительность всегда можно проверить на странице цен.
Что пока остаётся ограничением
Скорость H3 Max зависит от серверной оптимизации. Даже если fal опубликует веса, результат быстрее реального времени не перенесётся автоматически на домашнюю видеокарту. В обсуждении на Reddit сейчас ссылаются на заявление CTO fal о планах выпустить веса, но на момент публикации их ещё нет и даты релиза тоже нет. Открытой остаётся базовая H3, не H3 Max.
Вторая граница — разрешение и длина. Потолок 768p и 15 секунд отлично закрывает рекламные кадры, анимацию продукта, social video, сториборды и перебор визуальных направлений. Он не заменяет монтаж длинной истории и не гарантирует, что сложная сцена с несколькими персонажами получится с первой попытки.
Наконец, лидерборд измеряет среднее предпочтение на своём наборе запросов. Твоя задача может требовать точного диалога, определённой физики, сохранения персонажа или длинного непрерывного действия. Для выбора модели всё равно полезнее сравнить один и тот же рабочий промпт, чем смотреть только на место в таблице.
Что мы делаем со своей моделью
H3 Max задала планку, и мы её приняли для Grom TV — нашей видеомодели на собственных мощностях. Работаем над тремя вещами сразу: разгоняем генерацию до сопоставимого с H3 Max времени ответа, поднимаем качество картинки и отдельно занимаемся следованием промпту — самой болезненной частью, где разница между моделями видна раньше, чем в эстетике.
Сроков не называю, пока не будет чего показать на честном сравнении. Смысл в другом: своя модель нужна не для того, чтобы заменить чужие, а чтобы у части сценариев — длинные ролики со звуком, липсинк, свой голос на входе — была опора, не зависящая от чужого прайса и чужой очереди.
Кому я бы рекомендовал H3 Max
H3 Max стоит выбирать, когда важны короткие ролики со звуком и много быстрых итераций: рекламные концепты, движение из исходного изображения, переход между двумя кадрами, варианты кадра для соцсетей, превизуализация и проверка промптов. Главный выигрыш здесь не в том, что один ролик появился на минуту раньше, а в том, что за одну рабочую сессию можно проверить гораздо больше гипотез.
Открой MiniMax H3 Max в Креатив.Лабе или собери с ней сценарий в Воркфлоу. Модель работает без VPN, пополнить баланс можно российской картой в рублях, обязательной подписки нет.



