/
Flux 3 - всё о новой мультимодальной модели

Flux 3 - всё о новой мультимодальной модели

Cofounder, Editor in Chief
Илья Трикоз
Jul 24, 2026
Время чтения: 3 минуты
Flux 3: новая мультимодальная модель BFL

Black Forest Labs официально представила Flux 3. Компания, которая стала заметной благодаря сильным image-моделям FLUX.1 и FLUX.2, теперь замахнулась на видео, аудио и даже action prediction для робототехники.

FLUX 3 пытается объединить вещи, которые раньше часто жили отдельно: картинку, движение, звук, референсы, текст на изображениях и физическую причинность. На данный момент это ранний доступ, а не полноценный общедоступный запуск. Давайте вместе разберемся, чего нам стоит ждать от новой модели. 

Что такое Flux 3

Flux 3 - новая мультимодальная модель Black Forest Labs для визуального контента. В официальном релизе BFL пишет, что модель совместно обучается на изображениях, видео и аудио, потому что ни одна модальность по отдельности не описывает мир полностью.

Идея простая, но технически сильная:

  • Изображение фиксирует структуру сцены в один момент времени.
  • Видео добавляет динамику, движение, контакт объектов и причинно-следственные связи.
  • Аудио помогает понять, какие события происходят в кадре: удар, шаг, речь, шум механизма, атмосферу пространства.
  • Язык связывает все это с задачей пользователя.

Вместо набора отдельных моделей Black Forest Labs делает ставку на единый backbone, который должен выучить более цельное представление мира. Именно поэтому FLUX 3 позиционируется не только как creative model, но и как основа для physical AI.

Self-Flow: техническая база Flux 3

FLUX 3 построена на подходе Self-Flow. Это расширение flow matching, где генеративное обучение совмещается с обучением полезных внутренних представлений.

В обычных diffusion/flow-моделях задача часто сводится к локальному восстановлению зашумленных данных. Это хорошо работает для генерации, но не всегда заставляет модель строить сильную глобальную семантику. Поэтому многие подходы использовали внешние encoder-модели, например DINO, чтобы "подсказать" генератору более богатые признаки.

Self-Flow пытается убрать эту зависимость. Его ключевой механизм - Dual-Timestep Scheduling: разные токены получают разные уровни шума. Часть входа остается относительно более чистой, часть сильнее повреждается, и модель вынуждена восстанавливать недостающую информацию по контексту. Так появляется информационная асимметрия, которая подталкивает модель учить не только пиксели, но и структуру сцены.

Для FLUX 3 это важно потому, что одна и та же архитектура должна работать с разными модальностями. Если внутренние представления становятся лучше, это помогает не только генерации изображения или видео, но и downstream-задачам вроде action prediction.

Что умеет Flux 3 Video

Самая громкая часть релиза - FLUX 3 Video. По данным Black Forest Labs, модель умеет генерировать видео с нативным аудио длительностью до 20 секунд за один проход.

Заявленные возможности:

  • text-to-video: генерация ролика по текстовому запросу;
  • image-to-video: анимация стартового кадра или использование изображения как визуального референса;
  • video-to-video: перенос ключевых элементов исходного ролика, например персонажа, в новый контекст;
  • video/audio continuation: продолжение входного видео и аудио;
  • keyframe-to-video: генерация перехода между заданными ключевыми кадрами;
  • multilingual dialogue: многоязычная речь;
  • разные стили и aspect ratios, не только "кинематографичный" look;
  • agentic chaining: связывание отдельных клипов в более длинные multi-shot sequences;
  • typography generation и animated designs.

Самое важное здесь - звук не добавляется отдельной постобработкой. BFL говорит о native audio generation: модель генерирует видео и аудио совместно, поэтому звук должен лучше совпадать с физическими событиями в кадре.

Что с изображениями

Хотя релиз громче всего обсуждают как видеоновость, FLUX 3 остается важной и для изображений. Black Forest Labs заявляет, что модель сможет синтезировать и редактировать изображения в разных стилях, aspect ratios и разрешениях.

По ранним midtraining-оценкам BFL, FLUX 3 лучше предыдущих версий справляется со сложными промптами и генерацией текста. Отдельно упоминается более точный multilingual text rendering. Это важно для рекламы, постеров, интерфейсов, инфографики и любых задач, где изображение должно быть не просто красивым, а рабочим.

Однако FLUX 3 Image пока не открыт широко. Black Forest Labs обещает запустить early access для image-сценариев в ближайшие недели после релиза.

Action prediction и FLUX-mimic

Самый необычный блок релиза - связь FLUX 3 с робототехникой. Black Forest Labs и mimic robotics представили FLUX-mimic - video-action model, построенную на базе FLUX 3.

Логика такая: чтобы хорошо предсказывать видео, модель должна понимать, как объекты двигаются, сталкиваются, деформируются и влияют друг на друга. Это не полноценная физика в академическом смысле, но полезное приближение мира. Если модель уже выучила такую динамику, ее внутренние представления можно использовать для предсказания действий робота.

В технической статье BFL x mimic есть несколько интересных деталей. Компания пишет, что video prediction занимает более 95% compute costs при обучении FLUX 3, а аудио в 720p video with audio составляет менее 0.5% токенов. То есть в их картине мира видео - самая тяжелая модальность, а аудио и robot actions становятся дополнительными проекциями одной физической реальности.

mimic robotics утверждает, что FLUX-mimic уже тестируется с Audi на реальных производственных задачах: kitting, вставка электронных компонентов, сборка, работа с мягкими и гибкими деталями вроде уплотнителей и кабелей. В preview-бенчмарке soft body kitting mimic заявляет 95% success rate против 55% у адаптированной pi0.5 и 70% у flow matching baseline policy.

Это звучит сильно, но пока это партнерские данные. Для окончательного вывода нужны независимые проверки, описание тестовых условий, baseline-систем и статистика по реальным линиям.

Ранние оценки качества

Black Forest Labs опубликовала preliminary preference-оценки для видео. В тестах компания генерировала 10-секундные ролики в 720p с аудио и сравнивала FLUX 3 с другими видеомоделями.

По данным BFL, FLUX 3 предпочитали:

  • Grok Imagine Video - до 69%;
  • Kling v3 Pro - 60%;
  • Happy Horse v1 - 59%;
  • Happy Horse 1.1 - 57%;
  • Seedance 2.0 и Gemini Omni Flash - 52%;
  • Runway Gen-4.5 - 77%;
  • Luma Ray 3.2 - 93%.

Эти цифры стоит читать аккуратно. Preference test показывает, какой результат чаще понравился оценщикам в парном сравнении, но это не универсальный benchmark. Пока BFL не раскрыла полный протокол, набор промптов, число сравнений, cost per generation и failure cases, такие проценты лучше считать ранним сигналом, а не финальным доказательством лидерства.

Что уже доступно

Релиз идет поэтапно:

  • FLUX 3 Video: ранний доступ через заявку, video + optional native audio;
  • FLUX 3 Action / FLUX-mimic: доступ через выбранных исследовательских и коммерческих партнеров;
  • FLUX 3 Image: early access обещан в ближайшие недели;
  • FLUX 3 Dev: open-weight мультимодальный backbone обещан позднее в 2026 году.

Публичной цены на FLUX 3 на момент написания нет. Страница pricing у Black Forest Labs пока показывает FLUX.2 и отдельные Flux Tools, а не отдельные SKU для FLUX 3 Video или FLUX 3 Image. В документации BFL также пока основной акцент на FLUX.2, FLUX.1 Kontext и инструментах редактирования.

Главные преимущества Flux 3

Первое преимущество - единая мультимодальная архитектура. Если видео, изображение и звук обучаются вместе, модель потенциально лучше связывает движение, внешний вид и акустику. Для пользователя это может означать меньше ручной сборки пайплайна: не нужно отдельно генерировать картинку, отдельно оживлять ее, отдельно синтезировать звук и потом ловить синхронизацию.

Второе - native audio. Для AI-видео звук часто остается слабым местом: его добавляют после генерации, и он не всегда совпадает с действием. FLUX 3 делает ставку на совместную генерацию, включая речь, ambient sound и эффекты физических событий.

Третье - работа с референсами и multi-shot логикой. Image-to-video, video-to-video, keyframes и chaining клипов важны для реального production. Командам редко нужен один случайный красивый ролик; чаще нужен персонаж, продукт, стиль или сцена, которые сохраняются между вариантами.

Четвертое - типографика и дизайн. Black Forest Labs отдельно выделяет typography generation и animated designs. Если это подтвердится на практике, FLUX 3 может быть полезна не только для "cinematic shots", но и для рекламных креативов, заставок, презентационных роликов и интерфейсной графики.

Пятое - open-weight Dev в планах. Для сообщества FLUX это критично. Предыдущие FLUX Dev-модели стали важны именно потому, что их можно было запускать, адаптировать и встраивать локально. Но по FLUX 3 Dev пока неизвестны лицензия, размер, требования к железу и уровень качества относительно закрытой версии.

Что говорят те, кто уже посмотрел и попробовал

Сторонняя реакция пока смешанная: много интереса, но и много осторожности.

Decrypt называет FLUX 3 первым видеомодельным шагом BFL и акцентирует внимание на связке с робототехникой. При этом издание справедливо напоминает: опубликованные проценты BFL - это preference test, а не строгая независимая метрика.

Magica делает более скептичный разбор. Главная мысль: FLUX 3 пока gated early access, а робототехническая часть выглядит многообещающе, но требует доказательств. Для видео нужны воспроизводимые оценки: точная версия модели, test set, rater protocol, resolution, стоимость генерации и надежность multi-shot workflows.

Novoads формулирует полезную мысль для рекламных команд: FLUX 3 announced, not launched. То есть модель уже представлена, но еще не стала обычным инструментом, который можно включить в production-процесс с понятной ценой и SLA.

Aireiter пишет, что ранние тестеры в день запуска публиковали ролики и называли практические параметры вроде 20 секунд, до 10 reference media и aspect ratio до 21:9. Но BFL не закрепляла эти детали как формальные спецификации, поэтому их нужно считать user reports, а не гарантией.

В r/StableDiffusion реакция более живая и практичная. Пользователи хвалят отдельные примеры, ждут open weights и одновременно спрашивают главное: сколько понадобится VRAM/RAM, будет ли Dev-версия полноценной, как проверить происхождение опубликованных роликов и насколько FLUX 3 действительно обходит Seedance 2.0 в сложных сценах.

AI-newsletters вроде The Rundown и Latent Space встретили релиз заметно оптимистичнее. Для них главный сюжет - не отдельный ролик, а то, что Black Forest Labs наконец расширяет FLUX в audio-video и physical AI, а будущий open-weight Dev может сделать эту архитектуру доступной для исследователей и разработчиков.

Что это значит для рынка

FLUX 3 выходит в момент, когда AI-видео быстро взрослеет. Уже недостаточно просто сделать красивый короткий клип. Пользователям нужны референсы, сохранение персонажа, точные действия, звук, диалоги, разные форматы, управляемость, повторяемость и понятная цена.

Если FLUX 3 подтвердит заявленные качества, она может стать одним из главных конкурентов Seedance, Kling, Runway, Luma, Veo и Sora-подобных моделей. Особенно там, где нужен не один "вау-ролик", а pipeline для регулярной генерации: реклама, e-commerce, social video, product motion, превиз, motion design и прототипирование сцен.

Для пользователей GPTunneL главный практический вывод такой: за FLUX 3 стоит следить не только как за новым генератором видео, но и как за возможным новым классом мультимодальных моделей, где изображение, звук и движение рождаются из одной архитектуры.

Итог

Flux 3 - важный релиз для Black Forest Labs. Компания явно хочет перейти от статичных изображений к более широкому visual intelligence stack: видео с нативным звуком, изображения, редактирование, длинные последовательности, физическая динамика и action prediction.

Самые интересные моменты - Self-Flow, native audio, multi-shot workflows, заявленная сильная типографика и связка с FLUX-mimic. Самые слабые места на сегодня - ранний доступ, отсутствие цен, отсутствие полной методологии бенчмарков и неизвестные требования к open-weight Dev.

Поэтому FLUX 3 лучше воспринимать не как финальный продукт, который уже все доказал, а как сильную заявку. Если Black Forest Labs откроет доступ, опубликует методологию и выпустит действительно пригодную Dev-версию, Flux 3 может стать одним из ключевых релизов 2026 года в генерации видео, изображений и мультимодального AI.

Последние публикации
Попробовать в GPTunneL