3D-сцена в воркфлоу: превиз для AI-видео вместо десяти перегенераций

3D-сцена в воркфлоу: превиз для AI-видео вместо десяти перегенераций

4 сентября Higgsfield выпустил 3D Jutsu — браузерный 3D-редактор, где агент на GPT-6 Astra собирает сцену по описанию, а потом её же рендерит видеомодель. Мы решали ту же задачу параллельно, и в воркфлоу GPTunneL появилась нода «3D-сцена»: примитивы, камеры, ключи анимации, каты, чат с ассистентом и рендер в mp4 прямо в браузере. Отрендеренный превиз уходит в Seedance 2.5 или Hailuo H3 как референс, и модель повторяет движение камеры один в один.

Разбираю, зачем креатору кубики, как нода устроена, чем она отличается от 3D Jutsu и почему сцена за 10–100 ₽ экономит несколько тысяч на генерациях.

Почему видеомодели не слушаются камеру

Видеомодели научились делать красивую картинку, но плохо выполняют режиссёрские указания. «Камера поднимается из-под земли, ловит в фокус орла и пикирует за ним к полю» модель прочитает, а выполнит по-своему: орёл будет, поле будет, а пролёта не будет. Каждый дубль стоит денег и минут ожидания, а после пятого хочется просто показать модели, что имеется в виду.

В кино это решили давно: до съёмок сцену блокируют серыми примитивами, чтобы договориться о мизансцене и движении камеры. Называется превиз. Для генеративного видео он нужен ещё больше, потому что у модели нет режиссёра на площадке, ей нужен эталон.

Мультимодальные модели, в первую очередь Seedance 2.5 и MiniMax Hailuo H3, принимают видео-референс. Если правильно объяснить, что референс задаёт только камеру, тайминг и расположение объектов, а внешний вид надо брать из текста и картинок, модель воспроизводит операторскую работу точно: наезды, облёты, резкие переключения планов. Такой референс нода и делает.

Нода «3D-сцена» на холсте воркфлоу GPTunneL, выходы video и prompt подключены к ноде генерации видео Seedance 2.5

Пример: от муравья под землёй до трактора в поле

Сцена, на которой мы отлаживали ноду, задумана как один непрерывный пролёт на 15 секунд:

  • 0:00–0:03. Макроплан в земляном тоннеле: муравей шевелит усиками, малая глубина резкости, мягкий рассеянный свет.
  • 0:03–0:05. Камера резко идёт вверх сквозь грунт, на мгновение замедляется в норе крота: тот раздвигает почву лапами, с потолка осыпаются комочки.
  • 0:05–0:08. Выход сквозь траву в небо, кадр на секунду заливает солнце, впереди орёл с расправленными крыльями. Камера догоняет его и встаёт чуть позади и сбоку.
  • 0:08–0:11. Полёт над долиной: орёл делает один мощный взмах, вокруг скалистые горы, внизу поля и грунтовая дорога.
  • 0:11–0:15. Камера отворачивается от птицы, пикирует к полю, выходит из пике и пристраивается за трактором чуть выше колёс: пыль, борозды, ровные полосы обработанной земли.

Текстом это пять абзацев и четыре смены масштаба, от сантиметров до километров. Ни одна видеомодель не сделает такой пролёт с первого промпта, а с десятого может и не сделать. В ноде эта раскадровка целиком уходит в чат ассистенту (воркфлоу с орлом открывается как шаблон, связи и настройки можно разобрать по частям), и через полминуты на холсте стоит сцена из 120 объектов: тоннель, нора, склон, орёл из тела, крыльев и хвоста, долина с трактором, одна камера с ключами по всему пути и каты по таймкодам.

Редактор 3D-сцены: примитивы для муравья, крота, орла и трактора, траектория камеры и таймлайн с ключами анимации

Что ассистент понял не так, правится руками: подвинуть объект гизмо, переставить камеру, поставить ключ, проиграть. Дальше рендер, выходы ноды подключаются к Seedance 2.5, на вход добавляются референсные изображения орла и трактора, и запускается генерация.

Ракурс, тайминг и порядок планов в готовом ролике совпадают с превизом: там, где в сцене куб уходит вверх сквозь плоскость грунта, в ролике камера вырывается сквозь траву в небо.

Что внутри ноды

Сцена хранится в данных ноды как обычный документ: длительность, фон, объекты, камеры, свет и список катов. Объектов четыре типа: куб, сфера, пирамида и группа. Группа невидима, это пивот: у неё есть дети с локальными координатами, поэтому трактор из кузова, кабины и колёс едет как одно целое, а орёл из тела и крыльев не теряет крыло на вираже.

Анимация состоит из ключей по времени на позицию, поворот и масштаб, у камер ещё на точку взгляда и угол обзора, у света на яркость. Между ключами интерполяция с easing. Камер может быть несколько, каты на таймлайне переключают активную. Редактируется всё мышью: гизмо, дерево объектов с инспектором, таймлайн выбранного элемента, undo и redo.

Рендер идёт в браузере, сервер не участвует. Кадры рисует отдельный WebGL-рендерер детерминированно, кадр с номером i считается на времени i/fps, а через WebCodecs они уходят аппаратному H.264-кодировщику; ffmpeg.wasm только упаковывает поток в mp4, восемь секунд в 720p занимают несколько секунд. Состояние сцены в момент времени считает одна функция, ей же пользуются превью во вьюпорте и рендер, поэтому файл совпадает с тем, что видишь при проигрывании, по построению.

Как ассистент собирает сцену за 300 токенов

Первая версия ассистента работала очевидно: в промпт клали JSON-схему документа и текущую сцену, просили вернуть новый документ целиком. На тестовой задаче «человек входит в комнату и ложится на кровать» ответ занимал около 9 500 выходных токенов и полторы минуты, а «подвинь кровать левее» стоило столько же, сколько сцена с нуля. Длинный JSON с сотнями чисел модель регулярно ломала, а без иерархии голова отрывалась от тела при повороте.

Мы собрали стенд с набором задач, автоматической оценкой по геометрическим эвристикам и учётом токенов, и меняли формат ответа. Вместо JSON модель пишет одну строку на сущность, умолчания не пишутся, ключи анимации идут строками с отступом. Вместо документа целиком модель отвечает патчами: строка с известным идентификатором заменяет сущность, с новым добавляет, отдельная команда удаляет. И главное, типовые конструкции вынесены в макросы, которые разворачивает код: комната с дверью, человек с пивотом в ногах, «пройти по точкам», «лечь на кровать», «камера внутри комнаты с чистой линией взгляда». Модель хорошо выбирает, что сделать, и плохо считает геометрию, поэтому геометрию считает не она.

На той же задаче ответ ужался примерно до 300 токенов: в 30 раз меньше, в 12 раз дешевле и в 13 раз быстрее, а качество по эвристикам стенда выросло с «иногда» до 10 из 10. Остаток ошибок ловит линт после применения ответа: объект под полом, камера сквозь стену, путь через мебель. Замечания уходят модели одним коротким запросом, и одного повтора почти всегда хватает.

Ещё в несколько раз расход режет низкий уровень усилий на рассуждение: скрытые токены размышлений тоже оплачиваются, а для сборки сцены из макросов они не нужны. Из этой экономики и складывается цена: сцена через ассистента стоит от 10 до 100 ₽ в зависимости от сложности и количества правок. Рендер в mp4 бесплатный, он идёт на твоём компьютере.

Ответ применяется к сцене построчно по мере стриминга: видно, как сцена собирается, а не ждёшь финальной скобки. Если модель в итоге ошиблась, сцена откатывается, если всё хорошо, правка ложится в общую историю undo.

Промпт для видеомодели идёт в комплекте

Превиз выглядит как цветные кубики на ровном фоне. Если отдать его модели без объяснений, она сделает video-to-video: «улучшит» кубики, добавит текстуры и вернёт те же кубики. Поэтому у ноды два выхода: video и prompt. Во втором лежит готовая инструкция: из видео брать только камеру, планы, тайминг и расположение объектов, каждый примитив считать заглушкой для реального объекта из описания, цвет примитива не считать цветом объекта.

Формулировку подбирали на Seedance 2.5 и Hailuo H3: у обеих есть конвенция явно назначать роль референсного видео, без неё ролик трактуется как источник внешнего вида. Длинные списки запретов работали хуже короткой позитивной инструкции «операторскую работу бери из референса, объекты и атмосферу из описания». К ней дописываешь своё описание сцены и референсы персонажей.

Чем отличается от Higgsfield 3D Jutsu

Higgsfield решает ту же задачу и с тем же сценарием: агент блокирует сцену серыми примитивами, экспорт даёт референс-видео, персонажи и локации генерируются отдельно, потом всё собирается в чате и рендерится. Разница в том, где это живёт и сколько стоит.

Higgsfield 3D Jutsu3D-сцена в GPTunneL
Где живётотдельное приложение, файлы носишь между инструментаминода на холсте воркфлоу рядом с генерацией видео и монтажом
Кто собирает сценуагент на GPT-6 Astra; сообщения на Auto бесплатны, конкретная LLM списывает кредиты (GPT-6 Astra около 17 кредитов за сообщение)ассистент на компактном формате патчей и макросах, 10–100 ₽ за сцену
Ассетыимпорт GLB, персонажи Mixamo, экспорт GLB и mp4примитивы и группы, экспорт mp4
Рендер финалавидеомодели Higgsfield, оплата кредитами подпискиSeedance 2.5, Hailuo H3 и остальной каталог, оплата по факту
Подпискаот $19 за 270 кредитов в месяц, оплата зарубежной картойбез подписки, российские карты, рубли
Правкибез перегенерации: объекты двигаются руками и через чатбез перегенерации: гизмо, инспектор, чат, undo

У Higgsfield шире библиотека ассетов: готовые GLB-модели и анимированные персонажи Mixamo сразу дают сцене узнаваемые силуэты. У нас пока примитивы, зато сцена стоит на том же холсте, что и видеомодель, монтаж и извлечение кадров.

Сколько это экономит

Секунда Seedance 2.5 в 720p стоит 46,2 ₽, ролик на 15 секунд выходит около 700 ₽ за прогон без референса и около 830 ₽ с видео-референсом той же длины. Добиться сложного пролёта промптом с десяти попыток стоит 7 000 ₽ и пару часов ожидания, и это без гарантии. Сцена через ассистента обходится в 10–100 ₽, рендер бесплатный, а дальше один или два прогона видеомодели по референсу. Для Hailuo H3 пропорция та же: 768p стоит 12 ₽ за секунду, и пять лишних дублей всё равно дороже, чем сцена.

Ролик из примера сгенерирован в 480p с 15-секундным референсом, такой прогон стоит около 370 ₽. Точный расчёт под свою длительность и разрешение есть в калькуляторе на странице цен; тарифы видеомоделей меняются, актуальные цифры всегда в личном кабинете.

Ещё пример: погоня за 14 ₽

Второй воркфлоу короче, зато в нём видно весь путь целиком: сцену собирает ассистент, референсы задают внешний вид, видеомодель отдаёт кино. Сюжет — машина гонится за человеком по дороге, три ката: общий план, крупный план на бегущего, общий вид с отъездом. Сцена из 50 объектов через ассистента обошлась в 14 ₽.

Превиз, который ушёл в видеомодель, выглядит так: красный кузов на серой дороге, зелёные сферы вместо деревьев, камера за машиной.

К нему подключены референсные изображения человека и машины, и Seedance 2.5 вернула зимнюю дорогу в сумерках, битую «шестёрку» и снежную пыль из-под колёс. Каты и положение камеры из превиза сохранились.

Что это меняет

3D-сцена появилась не сама по себе, а как ещё одна нода в редакторе воркфлоу рядом с генерацией изображений и видео, LLM-нодами, извлечением кадров и видеоредактором с таймлайном. Раньше сцена собиралась в одном сервисе, референсы готовились в другом, ролик генерировался в третьем, монтаж делался в четвёртом. Теперь это один экран, и каждый шаг можно переиграть, не вынося файлы наружу.

Higgsfield и мы пришли к одному выводу почти одновременно: следующий шаг управления видеомоделями не в промптах, а в геометрии. Модель точнее повторяет то, что ей показали, чем то, что ей описали.

Где попробовать

Нода «3D-сцена» доступна в конструкторе воркфлоу всем пользователям GPTunneL: добавь её на холст, опиши сцену в чате или собери руками, подключи выходы к Seedance 2.5 или Hailuo H3. Быстрее всего начать с готового шаблона с орлом и трактором: открой его и подставь свою раскадровку. Без подписки, с оплатой по факту в рублях российскими картами и без VPN.

Вопросы

Нужно ли уметь работать в 3D-редакторах? Нет. Сцену собирает ассистент по текстовому описанию, руками остаётся подвинуть объект или переставить камеру. Гизмо и таймлайн устроены так же, как в любом 3D-пакете, но знать Blender не требуется.

Какие видеомодели понимают видео-референс? Промпт ноды подобран на Seedance 2.5 и MiniMax Hailuo H3, у обеих референсное видео можно явно назначить источником камеры. С другими моделями результат зависит от того, поддерживают ли они видео на входе.

Можно ли загрузить свою 3D-модель? Пока нет, сцена собирается из примитивов и групп. Внешний вид объектов задаётся референсными изображениями на входе видеомодели, а не геометрией.

Сколько стоит рендер превиза? Ничего. Рендер идёт в браузере через WebCodecs, платишь только за ассистента (10–100 ₽ за сцену) и за генерацию видеомоделью.

Это аналог Higgsfield 3D Jutsu? По задаче да: превиз из примитивов, который видеомодель использует как референс камеры. Отличия в том, что у нас сцена встроена в воркфлоу рядом с генерацией и монтажом, нет подписки и оплата в рублях.