Black Forest Labs официально представила Flux 3. Компания, которая стала заметной благодаря сильным image-моделям FLUX.1 и FLUX.2, теперь замахнулась на видео, аудио и даже action prediction для робототехники.
FLUX 3 пытается объединить вещи, которые раньше часто жили отдельно: картинку, движение, звук, референсы, текст на изображениях и физическую причинность. На данный момент это ранний доступ, а не полноценный общедоступный запуск. Давайте вместе разберемся, чего нам стоит ждать от новой модели.
Что такое Flux 3
Flux 3 - новая мультимодальная модель Black Forest Labs для визуального контента. В официальном релизе BFL пишет, что модель совместно обучается на изображениях, видео и аудио, потому что ни одна модальность по отдельности не описывает мир полностью.
Идея простая, но технически сильная:
- Изображение фиксирует структуру сцены в один момент времени.
- Видео добавляет динамику, движение, контакт объектов и причинно-следственные связи.
- Аудио помогает понять, какие события происходят в кадре: удар, шаг, речь, шум механизма, атмосферу пространства.
- Язык связывает все это с задачей пользователя.
Вместо набора отдельных моделей Black Forest Labs делает ставку на единый backbone, который должен выучить более цельное представление мира. Именно поэтому FLUX 3 позиционируется не только как creative model, но и как основа для physical AI.
Self-Flow: техническая база Flux 3
FLUX 3 построена на подходе Self-Flow. Это расширение flow matching, где генеративное обучение совмещается с обучением полезных внутренних представлений.
В обычных diffusion/flow-моделях задача часто сводится к локальному восстановлению зашумленных данных. Это хорошо работает для генерации, но не всегда заставляет модель строить сильную глобальную семантику. Поэтому многие подходы использовали внешние encoder-модели, например DINO, чтобы "подсказать" генератору более богатые признаки.
Self-Flow пытается убрать эту зависимость. Его ключевой механизм - Dual-Timestep Scheduling: разные токены получают разные уровни шума. Часть входа остается относительно более чистой, часть сильнее повреждается, и модель вынуждена восстанавливать недостающую информацию по контексту. Так появляется информационная асимметрия, которая подталкивает модель учить не только пиксели, но и структуру сцены.
Для FLUX 3 это важно потому, что одна и та же архитектура должна работать с разными модальностями. Если внутренние представления становятся лучше, это помогает не только генерации изображения или видео, но и downstream-задачам вроде action prediction.
Что умеет Flux 3 Video
Самая громкая часть релиза - FLUX 3 Video. По данным Black Forest Labs, модель умеет генерировать видео с нативным аудио длительностью до 20 секунд за один проход.
Заявленные возможности:
- text-to-video: генерация ролика по текстовому запросу;
- image-to-video: анимация стартового кадра или использование изображения как визуального референса;
- video-to-video: перенос ключевых элементов исходного ролика, например персонажа, в новый контекст;
- video/audio continuation: продолжение входного видео и аудио;
- keyframe-to-video: генерация перехода между заданными ключевыми кадрами;
- multilingual dialogue: многоязычная речь;
- разные стили и aspect ratios, не только "кинематографичный" look;
- agentic chaining: связывание отдельных клипов в более длинные multi-shot sequences;
- typography generation и animated designs.
Самое важное здесь - звук не добавляется отдельной постобработкой. BFL говорит о native audio generation: модель генерирует видео и аудио совместно, поэтому звук должен лучше совпадать с физическими событиями в кадре.
Что с изображениями
Хотя релиз громче всего обсуждают как видеоновость, FLUX 3 остается важной и для изображений. Black Forest Labs заявляет, что модель сможет синтезировать и редактировать изображения в разных стилях, aspect ratios и разрешениях.
По ранним midtraining-оценкам BFL, FLUX 3 лучше предыдущих версий справляется со сложными промптами и генерацией текста. Отдельно упоминается более точный multilingual text rendering. Это важно для рекламы, постеров, интерфейсов, инфографики и любых задач, где изображение должно быть не просто красивым, а рабочим.
Однако FLUX 3 Image пока не открыт широко. Black Forest Labs обещает запустить early access для image-сценариев в ближайшие недели после релиза.
Action prediction и FLUX-mimic
Самый необычный блок релиза - связь FLUX 3 с робототехникой. Black Forest Labs и mimic robotics представили FLUX-mimic - video-action model, построенную на базе FLUX 3.
Логика такая: чтобы хорошо предсказывать видео, модель должна понимать, как объекты двигаются, сталкиваются, деформируются и влияют друг на друга. Это не полноценная физика в академическом смысле, но полезное приближение мира. Если модель уже выучила такую динамику, ее внутренние представления можно использовать для предсказания действий робота.
В технической статье BFL x mimic есть несколько интересных деталей. Компания пишет, что video prediction занимает более 95% compute costs при обучении FLUX 3, а аудио в 720p video with audio составляет менее 0.5% токенов. То есть в их картине мира видео - самая тяжелая модальность, а аудио и robot actions становятся дополнительными проекциями одной физической реальности.
mimic robotics утверждает, что FLUX-mimic уже тестируется с Audi на реальных производственных задачах: kitting, вставка электронных компонентов, сборка, работа с мягкими и гибкими деталями вроде уплотнителей и кабелей. В preview-бенчмарке soft body kitting mimic заявляет 95% success rate против 55% у адаптированной pi0.5 и 70% у flow matching baseline policy.
Это звучит сильно, но пока это партнерские данные. Для окончательного вывода нужны независимые проверки, описание тестовых условий, baseline-систем и статистика по реальным линиям.
Ранние оценки качества
Black Forest Labs опубликовала preliminary preference-оценки для видео. В тестах компания генерировала 10-секундные ролики в 720p с аудио и сравнивала FLUX 3 с другими видеомоделями.
По данным BFL, FLUX 3 предпочитали:
- Grok Imagine Video - до 69%;
- Kling v3 Pro - 60%;
- Happy Horse v1 - 59%;
- Happy Horse 1.1 - 57%;
- Seedance 2.0 и Gemini Omni Flash - 52%;
- Runway Gen-4.5 - 77%;
- Luma Ray 3.2 - 93%.
Эти цифры стоит читать аккуратно. Preference test показывает, какой результат чаще понравился оценщикам в парном сравнении, но это не универсальный benchmark. Пока BFL не раскрыла полный протокол, набор промптов, число сравнений, cost per generation и failure cases, такие проценты лучше считать ранним сигналом, а не финальным доказательством лидерства.
Что уже доступно
Релиз идет поэтапно:
- FLUX 3 Video: ранний доступ через заявку, video + optional native audio;
- FLUX 3 Action / FLUX-mimic: доступ через выбранных исследовательских и коммерческих партнеров;
- FLUX 3 Image: early access обещан в ближайшие недели;
- FLUX 3 Dev: open-weight мультимодальный backbone обещан позднее в 2026 году.
Публичной цены на FLUX 3 на момент написания нет. Страница pricing у Black Forest Labs пока показывает FLUX.2 и отдельные Flux Tools, а не отдельные SKU для FLUX 3 Video или FLUX 3 Image. В документации BFL также пока основной акцент на FLUX.2, FLUX.1 Kontext и инструментах редактирования.
Главные преимущества Flux 3
Первое преимущество - единая мультимодальная архитектура. Если видео, изображение и звук обучаются вместе, модель потенциально лучше связывает движение, внешний вид и акустику. Для пользователя это может означать меньше ручной сборки пайплайна: не нужно отдельно генерировать картинку, отдельно оживлять ее, отдельно синтезировать звук и потом ловить синхронизацию.
Второе - native audio. Для AI-видео звук часто остается слабым местом: его добавляют после генерации, и он не всегда совпадает с действием. FLUX 3 делает ставку на совместную генерацию, включая речь, ambient sound и эффекты физических событий.
Третье - работа с референсами и multi-shot логикой. Image-to-video, video-to-video, keyframes и chaining клипов важны для реального production. Командам редко нужен один случайный красивый ролик; чаще нужен персонаж, продукт, стиль или сцена, которые сохраняются между вариантами.
Четвертое - типографика и дизайн. Black Forest Labs отдельно выделяет typography generation и animated designs. Если это подтвердится на практике, FLUX 3 может быть полезна не только для "cinematic shots", но и для рекламных креативов, заставок, презентационных роликов и интерфейсной графики.
Пятое - open-weight Dev в планах. Для сообщества FLUX это критично. Предыдущие FLUX Dev-модели стали важны именно потому, что их можно было запускать, адаптировать и встраивать локально. Но по FLUX 3 Dev пока неизвестны лицензия, размер, требования к железу и уровень качества относительно закрытой версии.
Что говорят те, кто уже посмотрел и попробовал
Сторонняя реакция пока смешанная: много интереса, но и много осторожности.
Decrypt называет FLUX 3 первым видеомодельным шагом BFL и акцентирует внимание на связке с робототехникой. При этом издание справедливо напоминает: опубликованные проценты BFL - это preference test, а не строгая независимая метрика.
Magica делает более скептичный разбор. Главная мысль: FLUX 3 пока gated early access, а робототехническая часть выглядит многообещающе, но требует доказательств. Для видео нужны воспроизводимые оценки: точная версия модели, test set, rater protocol, resolution, стоимость генерации и надежность multi-shot workflows.
Novoads формулирует полезную мысль для рекламных команд: FLUX 3 announced, not launched. То есть модель уже представлена, но еще не стала обычным инструментом, который можно включить в production-процесс с понятной ценой и SLA.
Aireiter пишет, что ранние тестеры в день запуска публиковали ролики и называли практические параметры вроде 20 секунд, до 10 reference media и aspect ratio до 21:9. Но BFL не закрепляла эти детали как формальные спецификации, поэтому их нужно считать user reports, а не гарантией.
В r/StableDiffusion реакция более живая и практичная. Пользователи хвалят отдельные примеры, ждут open weights и одновременно спрашивают главное: сколько понадобится VRAM/RAM, будет ли Dev-версия полноценной, как проверить происхождение опубликованных роликов и насколько FLUX 3 действительно обходит Seedance 2.0 в сложных сценах.
AI-newsletters вроде The Rundown и Latent Space встретили релиз заметно оптимистичнее. Для них главный сюжет - не отдельный ролик, а то, что Black Forest Labs наконец расширяет FLUX в audio-video и physical AI, а будущий open-weight Dev может сделать эту архитектуру доступной для исследователей и разработчиков.
Что это значит для рынка
FLUX 3 выходит в момент, когда AI-видео быстро взрослеет. Уже недостаточно просто сделать красивый короткий клип. Пользователям нужны референсы, сохранение персонажа, точные действия, звук, диалоги, разные форматы, управляемость, повторяемость и понятная цена.
Если FLUX 3 подтвердит заявленные качества, она может стать одним из главных конкурентов Seedance, Kling, Runway, Luma, Veo и Sora-подобных моделей. Особенно там, где нужен не один "вау-ролик", а pipeline для регулярной генерации: реклама, e-commerce, social video, product motion, превиз, motion design и прототипирование сцен.
Для пользователей GPTunneL главный практический вывод такой: за FLUX 3 стоит следить не только как за новым генератором видео, но и как за возможным новым классом мультимодальных моделей, где изображение, звук и движение рождаются из одной архитектуры.
Итог
Flux 3 - важный релиз для Black Forest Labs. Компания явно хочет перейти от статичных изображений к более широкому visual intelligence stack: видео с нативным звуком, изображения, редактирование, длинные последовательности, физическая динамика и action prediction.
Самые интересные моменты - Self-Flow, native audio, multi-shot workflows, заявленная сильная типографика и связка с FLUX-mimic. Самые слабые места на сегодня - ранний доступ, отсутствие цен, отсутствие полной методологии бенчмарков и неизвестные требования к open-weight Dev.
Поэтому FLUX 3 лучше воспринимать не как финальный продукт, который уже все доказал, а как сильную заявку. Если Black Forest Labs откроет доступ, опубликует методологию и выпустит действительно пригодную Dev-версию, Flux 3 может стать одним из ключевых релизов 2026 года в генерации видео, изображений и мультимодального AI.



