Black Forest Labs компаниясы ресми түрде Flux 3 моделін таныстырды. Күшті FLUX.1 және FLUX.2 сурет модельдерінің арқасында танымал болған компания енді видео, аудио және тіпті робототехникаға арналған action prediction бағытында қадам жасады.
FLUX 3 бұрын бөлек өмір сүретін нәрселерді біріктіруге тырысады: сурет, қозғалыс, дыбыс, референстер, суреттегі мәтін және физикалық себеп-салдарлылық. Қазіргі кезде бұл толыққанды жалпыға қолжетімді іске қосу емес, алғашқы қолжетімділік. Жаңа модельден нені күту керегін бірге қарастырайық.
Flux 3 деген не
Flux 3 — Black Forest Labs компаниясының визуалды контентке арналған жаңа мультимодальды моделі. Ресми релизде BFL модель сурет, видео және аудио бойынша бірлесіп оқытылатынын жазады, себебі бірде-бір модальділік жеке алғанда әлемді толық сипаттай алмайды.
Идея қарапайым, бірақ техникалық жағынан күшті:
- Сурет сахна құрылымын белгілі бір уақыт сәтінде бекітеді.
- Видео динамиканы, қозғалысты, объектілердің жанасуын және себеп-салдарлық байланыстарды қосады.
- Аудио кадрда қандай оқиғалар болып жатқанын түсінуге көмектеседі: соққы, қадам, сөйлеу, механизм шуы, кеңістіктің атмосферасы.
- Тіл осының бәрін пайдаланушының тапсырмасымен байланыстырады.
Бөлек модельдер жиынтығының орнына Black Forest Labs әлемнің тұтастау бейнесін үйренуге тиіс бірыңғай backbone-ге бас тігеді. Дәл осы себепті FLUX 3 тек creative model ретінде ғана емес, physical AI үшін негіз ретінде де позицияланады.
Self-Flow: Flux 3-тің техникалық негізі
FLUX 3 Self-Flow тәсіліне негізделген. Бұл flow matching тәсілінің кеңеюі, мұнда генеративті оқыту пайдалы ішкі репрезентацияларды үйретумен ұштасады.
Әдеттегі diffusion/flow модельдерінде тапсырма көбіне шуы бар деректерді локальді қалпына келтіруге саяды. Бұл генерация үшін жақсы жұмыс істейді, бірақ модельді әрдайым күшті ғаламдық семантика құруға мәжбүрлей бермейді. Сондықтан көптеген тәсілдер генераторға бай белгілерді "ұсыну" үшін DINO сияқты сыртқы encoder-модельдерді пайдаланды.
Self-Flow осы тәуелділікті жоюға тырысады. Оның негізгі механизмі — Dual-Timestep Scheduling: әртүрлі токендер әртүрлі шу деңгейлерін алады. Кірістің бір бөлігі салыстырмалы түрде тазалау қалады, бір бөлігі күштірек бүлінеді, сол себепті модель жетіспейтін ақпаратты контекст бойынша қалпына келтіруге мәжбүр болады. Осылайша модельді тек пикселдерді ғана емес, сахна құрылымын да үйренуге итермелейтін ақпараттық асимметрия пайда болады.
FLUX 3 үшін бұл маңызды, себебі бір архитектура әртүрлі модальділіктермен жұмыс істеуге тиіс. Ішкі репрезентациялар жақсарса, бұл тек сурет немесе видео генерациясына ғана емес, action prediction сияқты downstream-тапсырмаларға да пайдалы.
Flux 3 Video нені істей алады
Релиздің ең дауысты бөлігі — FLUX 3 Video. Black Forest Labs деректері бойынша, модель бір өту барысында ұзақтығы 20 секундқа дейінгі нативті аудиосы бар видео генерациялай алады.
Мәлімделген мүмкіндіктер:
- text-to-video: мәтіндік сұраныс бойынша роликті генерациялау;
- image-to-video: бастапқы кадрды анимациялау немесе суретті визуалды референс ретінде пайдалану;
- video-to-video: бастапқы роликтің негізгі элементтерін, мысалы кейіпкерді, жаңа контекстке ауыстыру;
- video/audio continuation: кіріс видео мен аудионы жалғастыру;
- keyframe-to-video: берілген негізгі кадрлар арасындағы өтуді генерациялау;
- multilingual dialogue: көптілді сөйлеу;
- тек "кинематографиялық" стиль ғана емес, әртүрлі стильдер мен aspect ratios;
- agentic chaining: жеке клиптерді ұзағырақ multi-shot тізбектерге байланыстыру;
- typography generation және animated designs.
Мұндағы ең маңыздысы — дыбыс бөлек постпродакшн ретінде қосылмайды. BFL native audio generation туралы айтады: модель видео мен аудионы бірге генерациялайды, сондықтан дыбыс кадрдағы физикалық оқиғаларға дәлірек сай келуге тиіс.
Суреттер қалай
Релиз ең көп видео жаңалығы ретінде талқыланғанымен, FLUX 3 суреттер үшін де маңызды болып қалады. Black Forest Labs модель әртүрлі стильдерде, aspect ratios және ажыратымдылықтарда суреттерді синтездей және өңдей алатынын мәлімдейді.
BFL-дің алғашқы midtraining бағалаулары бойынша, FLUX 3 күрделі промпттар мен мәтін генерациясымен алдыңғы нұсқаларға қарағанда жақсырақ жұмыс істейді. Дәлірек multilingual text rendering бөлек аталады. Бұл жарнама, постерлер, интерфейстер, инфографика және сурет тек әдемі емес, жұмыс істейтін болуы керек кез келген тапсырмалар үшін маңызды.
Дегенмен FLUX 3 Image әлі кеңінен ашылған жоқ. Black Forest Labs image-сценарийлер үшін early access-ті жақын апталарда іске қосамыз деп уәде береді.
Action prediction және FLUX-mimic
Релиздің ең ерекше бөлігі — FLUX 3-тің робототехникамен байланысы. Black Forest Labs пен mimic robotics FLUX 3 негізінде құрылған FLUX-mimic video-action моделін таныстырды.
Логикасы мынадай: видеоны жақсы болжау үшін модель объектілердің қалай қозғалатынын, соқтығысатынын, деформацияланатынын және бір-біріне қалай әсер ететінін түсінуге тиіс. Бұл академиялық мағынадағы толыққанды физика емес, бірақ әлемнің пайдалы жуықтауы. Модель мұндай динамиканы үйреніп қойған болса, оның ішкі репрезентацияларын робот әрекеттерін болжау үшін пайдалануға болады.
BFL x mimic техникалық мақаласында бірнеше қызықты деталь бар. Компания FLUX 3-ті оқыту кезінде video prediction есептеу шығындарының 95%-дан астамын алатынын, ал 720p video with audio-дағы аудио токендердің 0,5%-дан азын құрайтынын жазады. Яғни олардың дүниетанымында видео — ең ауыр модальділік, ал аудио мен robot actions бір физикалық шындықтың қосымша проекцияларына айналады.
mimic robotics FLUX-mimic-тің Audi-мен нақты өндірістік тапсырмаларда, соның ішінде kitting, электрондық компоненттерді орнату, жинақтау, тығыздағыштар мен кабельдер сияқты жұмсақ және икемді бөлшектермен жұмыс істеу бойынша сыналып жатқанын мәлімдейді. Preview soft body kitting бенчмаркінде mimic 95% success rate мәлімдейді, бейімделген pi0.5-те бұл — 55%, ал flow matching baseline policy-де — 70%.
Бұл әсерлі көрінеді, бірақ бұл әзірге серіктестік деректер. Түпкілікті қорытынды үшін тәуелсіз тексерулер, тест жағдайларының сипаттамасы, baseline жүйелер және нақты өндірістік желілер бойынша статистика қажет.
Алғашқы сапа бағалаулары
Black Forest Labs видео үшін preliminary preference-бағалауларды жариялады. Тестерде компания аудиосы бар 720p форматындағы 10 секундтық роликтер генерациялап, FLUX 3-ті басқа видео модельдерімен салыстырды.
BFL деректері бойынша, FLUX 3-ке артықшылық берілді:
- Grok Imagine Video — 69%-ға дейін;
- Kling v3 Pro — 60%;
- Happy Horse v1 — 59%;
- Happy Horse 1.1 — 57%;
- Seedance 2.0 және Gemini Omni Flash — 52%;
- Runway Gen-4.5 — 77%;
- Luma Ray 3.2 — 93%.
Бұл сандарды мұқият қабылдау керек. Preference test жұп салыстыруда бағалаушыларға қай нәтиже жиірек ұнағанын көрсетеді, бірақ бұл әмбебап benchmark емес. BFL толық хаттаманы, промпттар жинағын, салыстырулар санын, cost per generation мен failure cases-ты ашпайынша, мұндай пайыздарды көшбасшылықтың түпкілікті дәлелі емес, алғашқы сигнал ретінде қабылдаған жөн.
Қазір нелер қолжетімді
Релиз кезең-кезеңмен жүруде:
- FLUX 3 Video: өтінім арқылы алғашқы қолжетімділік, video + опциональды native audio;
- FLUX 3 Action / FLUX-mimic: таңдаулы зерттеу және коммерциялық серіктестер арқылы қолжетімділік;
- FLUX 3 Image: early access жақын апталарда уәде етілген;
- FLUX 3 Dev: open-weight мультимодальды backbone 2026 жылдың соңында уәде етілген.
Осы мақала жазылған сәтте FLUX 3 үшін жария баға жоқ. Black Forest Labs-тың pricing бетінде әзірге FLUX.2 мен жеке Flux Tools көрсетілген, FLUX 3 Video немесе FLUX 3 Image үшін жеке SKU жоқ. BFL құжаттамасында да негізгі назар әзірге FLUX.2, FLUX.1 Kontext және өңдеу құралдарына бағытталған.
Flux 3-тің басты артықшылықтары
Бірінші артықшылық — бірыңғай мультимодальды архитектура. Видео, сурет және дыбыс бірге оқытылса, модель қозғалысты, сыртқы көріністі және акустиканы әлеуетті түрде жақсырақ байланыстырады. Пайдаланушы үшін бұл пайплайнды қолмен жинаудың азаюын білдіруі мүмкін: суретті бөлек генерациялап, оны бөлек анимациялап, дыбысты бөлек синтездеп, кейін синхрондауды қуалаудың қажеті жоқ.
Екінші — native audio. AI-видео үшін дыбыс жиі әлсіз тұс болып қалады: ол генерациядан кейін қосылады және іс-әрекетке әрдайым сай келе бермейді. FLUX 3 сөйлеуді, ambient sound-ты және физикалық оқиғалар эффектілерін қоса алғанда, бірлескен генерацияға бас тігеді.
Үшінші — референстермен және multi-shot логикасымен жұмыс. Image-to-video, video-to-video, keyframes және клиптерді chaining ету нақты production үшін маңызды. Командаларға сирек кездейсоқ бір әдемі ролик керек болады; көбіне нұсқалар арасында сақталатын кейіпкер, өнім, стиль немесе сахна керек.
Төртінші — типография мен дизайн. Black Forest Labs typography generation мен animated designs-ты бөлек атап көрсетеді. Бұл тәжірибеде расталса, FLUX 3 тек "cinematic shots" үшін ғана емес, жарнамалық креативтер, интро, презентациялық роликтер мен интерфейс графикасы үшін де пайдалы болуы мүмкін.
Бесінші — жоспардағы open-weight Dev нұсқасы. FLUX қоғамдастығы үшін бұл өте маңызды. Алдыңғы FLUX Dev модельдері дәл сол себепті маңызды болды — оларды локальді іске қосуға, бейімдеуге және ендіруге болатын. Бірақ FLUX 3 Dev бойынша лицензия, көлем, жабдыққа қойылатын талаптар және жабық нұсқаға қатысты сапа деңгейі әлі белгісіз.
Оны көріп, сынап көргендер не дейді
Сыртқы реакция әзірге аралас: қызығушылық та, сақтық та көп.
Decrypt FLUX 3-ті BFL-дің видео модель саласындағы алғашқы қадамы деп атап, робототехникамен байланысқа назар аударады. Сонымен қатар басылым BFL жариялаған пайыздардың қатаң тәуелсіз метрика емес, preference test екенін әділ еске салады.
Magica анағұрлым скептикалық талдау жасайды. Негізгі ой: FLUX 3 әлі gated early access күйінде, ал робототехникалық бөлігі перспективалы көрінгенімен, дәлелдеуді қажет етеді. Видео үшін қайталанатын бағалаулар қажет: модельдің дәл нұсқасы, test set, rater protocol, resolution, генерация құны және multi-shot workflows-тың сенімділігі.
Novoads жарнама командалары үшін пайдалы ой тұжырымдайды: FLUX 3 announced, not launched. Яғни модель ұсынылды, бірақ ол әлі түсінікті баға мен SLA-мен production процесіне қосуға болатын әдеттегі құралға айналған жоқ.
Aireiter іске қосу күні алғашқы тестерлер роликтер жариялап, 20 секунд, 10-ға дейінгі reference media және 21:9-ге дейінгі aspect ratio сияқты практикалық параметрлерді атады деп жазады. Бірақ BFL бұл детальдарды формалды спецификация ретінде бекітпеген, сондықтан оларды кепілдік емес, user reports ретінде қабылдаған жөн.
r/StableDiffusion форумында реакция анағұрлым жанды және практикалық. Пайдаланушылар жекелеген мысалдарды мақтап, open weights-ті күтіп жатыр, әрі негізгі сұрақтарды қояды: қанша VRAM/RAM қажет болады, Dev нұсқасы толыққанды бола ма, жарияланған роликтердің шығу тегін қалай тексеруге болады және FLUX 3 күрделі сахналарда Seedance 2.0-ді шынымен қаншалықты басып озады.
The Rundown мен Latent Space сияқты AI-жаршылар релизді анағұрлым оптимистік қарсы алды. Олар үшін басты оқиға — жеке ролик емес, Black Forest Labs-тың FLUX-ты audio-video және physical AI бағытына кеңейтуі, ал болашақтағы open-weight Dev нұсқасы бұл архитектураны зерттеушілер мен әзірлеушілер үшін қолжетімді ете алады.
Бұл нарық үшін нені білдіреді
FLUX 3 AI-видео тез есейіп жатқан сәтте шығып отыр. Енді бір ғана әдемі қысқа ролик жасаудың өзі жеткіліксіз. Пайдаланушыларға референстер, кейіпкердің сақталуы, дәл әрекеттер, дыбыс, диалогтар, әртүрлі форматтар, басқарылатындық, қайталанатындық және түсінікті баға қажет.
FLUX 3 мәлімделген сапаны растаса, ол Seedance, Kling, Runway, Luma, Veo және Sora тәрізді модельдердің басты бәсекелестерінің біріне айналуы мүмкін. Әсіресе бір ғана "тамаша ролик" емес, тұрақты генерацияға арналған pipeline қажет болатын жерлерде: жарнама, e-commerce, social video, product motion, превиз, motion design және сахналарды прототиптеу.
GPTunneL пайдаланушылары үшін басты практикалық қорытынды мынадай: FLUX 3-ті тек жаңа видео генератор ретінде ғана емес, сурет, дыбыс және қозғалыс бір архитектурадан туындайтын мультимодальды модельдердің мүмкін жаңа класы ретінде де бақылаған жөн.
Қорытынды
Flux 3 — Black Forest Labs үшін маңызды релиз. Компания статикалық суреттерден кеңірек visual intelligence stack-қа өтуді айқын қалайды: нативті дыбысы бар видео, суреттер, өңдеу, ұзақ тізбектер, физикалық динамика және action prediction.
Ең қызықты тұстары — Self-Flow, native audio, multi-shot workflows, мәлімделген күшті типография және FLUX-mimic-пен байланыс. Бүгінгі күнгі ең әлсіз тұстары — алғашқы қолжетімділік, баға болмауы, бенчмарк әдіснамасының толық болмауы және open-weight Dev нұсқасына қойылатын талаптардың белгісіздігі.
Сондықтан FLUX 3-ті бәрін дәлелдеп үлгерген түпкілікті өнім ретінде емес, күшті ұсыныс ретінде қабылдаған дұрысырақ. Black Forest Labs қолжетімділікті ашып, әдіснамасын жариялап, шынымен пайдалануға жарамды Dev нұсқасын шығарса, Flux 3 видео, сурет және мультимодальды AI генерациясы саласындағы 2026 жылдың негізгі релиздерінің біріне айналуы мүмкін.
