4 сентября Higgsfield выпустил 3D Jutsu — браузерный 3D-редактор, где агент на GPT-6 Astra собирает сцену по описанию, а потом её же рендерит видеомодель. Мы решали ту же задачу параллельно, и в воркфлоу GPTunneL появилась нода «3D-сцена»: примитивы, камеры, ключи анимации, каты, чат с ассистентом и рендер в mp4 прямо в браузере. Отрендеренный превиз уходит в Seedance 2.5 или Hailuo H3 как референс, и модель повторяет движение камеры один в один.
Разбираю, зачем креатору кубики, как нода устроена, чем она отличается от 3D Jutsu и почему сцена за 10–100 ₽ экономит несколько тысяч на генерациях.
Почему видеомодели не слушаются камеру
Видеомодели научились делать красивую картинку, но плохо выполняют режиссёрские указания. «Камера поднимается из-под земли, ловит в фокус орла и пикирует за ним к полю» модель прочитает, а выполнит по-своему: орёл будет, поле будет, а пролёта не будет. Каждый дубль стоит денег и минут ожидания, а после пятого хочется просто показать модели, что имеется в виду.
В кино это решили давно: до съёмок сцену блокируют серыми примитивами, чтобы договориться о мизансцене и движении камеры. Называется превиз. Для генеративного видео он нужен ещё больше, потому что у модели нет режиссёра на площадке, ей нужен эталон.
Мультимодальные модели, в первую очередь Seedance 2.5 и MiniMax Hailuo H3, принимают видео-референс. Если правильно объяснить, что референс задаёт только камеру, тайминг и расположение объектов, а внешний вид надо брать из текста и картинок, модель воспроизводит операторскую работу точно: наезды, облёты, резкие переключения планов. Такой референс нода и делает.

Пример: от муравья под землёй до трактора в поле
Сцена, на которой мы отлаживали ноду, задумана как один непрерывный пролёт на 15 секунд:
- 0:00–0:03. Макроплан в земляном тоннеле: муравей шевелит усиками, малая глубина резкости, мягкий рассеянный свет.
- 0:03–0:05. Камера резко идёт вверх сквозь грунт, на мгновение замедляется в норе крота: тот раздвигает почву лапами, с потолка осыпаются комочки.
- 0:05–0:08. Выход сквозь траву в небо, кадр на секунду заливает солнце, впереди орёл с расправленными крыльями. Камера догоняет его и встаёт чуть позади и сбоку.
- 0:08–0:11. Полёт над долиной: орёл делает один мощный взмах, вокруг скалистые горы, внизу поля и грунтовая дорога.
- 0:11–0:15. Камера отворачивается от птицы, пикирует к полю, выходит из пике и пристраивается за трактором чуть выше колёс: пыль, борозды, ровные полосы обработанной земли.
Текстом это пять абзацев и четыре смены масштаба, от сантиметров до километров. Ни одна видеомодель не сделает такой пролёт с первого промпта, а с десятого может и не сделать. В ноде эта раскадровка целиком уходит в чат ассистенту (воркфлоу с орлом открывается как шаблон, связи и настройки можно разобрать по частям), и через полминуты на холсте стоит сцена из 120 объектов: тоннель, нора, склон, орёл из тела, крыльев и хвоста, долина с трактором, одна камера с ключами по всему пути и каты по таймкодам.

Что ассистент понял не так, правится руками: подвинуть объект гизмо, переставить камеру, поставить ключ, проиграть. Дальше рендер, выходы ноды подключаются к Seedance 2.5, на вход добавляются референсные изображения орла и трактора, и запускается генерация.
Ракурс, тайминг и порядок планов в готовом ролике совпадают с превизом: там, где в сцене куб уходит вверх сквозь плоскость грунта, в ролике камера вырывается сквозь траву в небо.
Что внутри ноды
Сцена хранится в данных ноды как обычный документ: длительность, фон, объекты, камеры, свет и список катов. Объектов четыре типа: куб, сфера, пирамида и группа. Группа невидима, это пивот: у неё есть дети с локальными координатами, поэтому трактор из кузова, кабины и колёс едет как одно целое, а орёл из тела и крыльев не теряет крыло на вираже.
Анимация состоит из ключей по времени на позицию, поворот и масштаб, у камер ещё на точку взгляда и угол обзора, у света на яркость. Между ключами интерполяция с easing. Камер может быть несколько, каты на таймлайне переключают активную. Редактируется всё мышью: гизмо, дерево объектов с инспектором, таймлайн выбранного элемента, undo и redo.
Рендер идёт в браузере, сервер не участвует. Кадры рисует отдельный WebGL-рендерер детерминированно, кадр с номером i считается на времени i/fps, а через WebCodecs они уходят аппаратному H.264-кодировщику; ffmpeg.wasm только упаковывает поток в mp4, восемь секунд в 720p занимают несколько секунд. Состояние сцены в момент времени считает одна функция, ей же пользуются превью во вьюпорте и рендер, поэтому файл совпадает с тем, что видишь при проигрывании, по построению.
Как ассистент собирает сцену за 300 токенов
Первая версия ассистента работала очевидно: в промпт клали JSON-схему документа и текущую сцену, просили вернуть новый документ целиком. На тестовой задаче «человек входит в комнату и ложится на кровать» ответ занимал около 9 500 выходных токенов и полторы минуты, а «подвинь кровать левее» стоило столько же, сколько сцена с нуля. Длинный JSON с сотнями чисел модель регулярно ломала, а без иерархии голова отрывалась от тела при повороте.
Мы собрали стенд с набором задач, автоматической оценкой по геометрическим эвристикам и учётом токенов, и меняли формат ответа. Вместо JSON модель пишет одну строку на сущность, умолчания не пишутся, ключи анимации идут строками с отступом. Вместо документа целиком модель отвечает патчами: строка с известным идентификатором заменяет сущность, с новым добавляет, отдельная команда удаляет. И главное, типовые конструкции вынесены в макросы, которые разворачивает код: комната с дверью, человек с пивотом в ногах, «пройти по точкам», «лечь на кровать», «камера внутри комнаты с чистой линией взгляда». Модель хорошо выбирает, что сделать, и плохо считает геометрию, поэтому геометрию считает не она.
На той же задаче ответ ужался примерно до 300 токенов: в 30 раз меньше, в 12 раз дешевле и в 13 раз быстрее, а качество по эвристикам стенда выросло с «иногда» до 10 из 10. Остаток ошибок ловит линт после применения ответа: объект под полом, камера сквозь стену, путь через мебель. Замечания уходят модели одним коротким запросом, и одного повтора почти всегда хватает.
Ещё в несколько раз расход режет низкий уровень усилий на рассуждение: скрытые токены размышлений тоже оплачиваются, а для сборки сцены из макросов они не нужны. Из этой экономики и складывается цена: сцена через ассистента стоит от 10 до 100 ₽ в зависимости от сложности и количества правок. Рендер в mp4 бесплатный, он идёт на твоём компьютере.
Ответ применяется к сцене построчно по мере стриминга: видно, как сцена собирается, а не ждёшь финальной скобки. Если модель в итоге ошиблась, сцена откатывается, если всё хорошо, правка ложится в общую историю undo.
Промпт для видеомодели идёт в комплекте
Превиз выглядит как цветные кубики на ровном фоне. Если отдать его модели без объяснений, она сделает video-to-video: «улучшит» кубики, добавит текстуры и вернёт те же кубики. Поэтому у ноды два выхода: video и prompt. Во втором лежит готовая инструкция: из видео брать только камеру, планы, тайминг и расположение объектов, каждый примитив считать заглушкой для реального объекта из описания, цвет примитива не считать цветом объекта.
Формулировку подбирали на Seedance 2.5 и Hailuo H3: у обеих есть конвенция явно назначать роль референсного видео, без неё ролик трактуется как источник внешнего вида. Длинные списки запретов работали хуже короткой позитивной инструкции «операторскую работу бери из референса, объекты и атмосферу из описания». К ней дописываешь своё описание сцены и референсы персонажей.
Чем отличается от Higgsfield 3D Jutsu
Higgsfield решает ту же задачу и с тем же сценарием: агент блокирует сцену серыми примитивами, экспорт даёт референс-видео, персонажи и локации генерируются отдельно, потом всё собирается в чате и рендерится. Разница в том, где это живёт и сколько стоит.
| Higgsfield 3D Jutsu | 3D-сцена в GPTunneL | |
|---|---|---|
| Где живёт | отдельное приложение, файлы носишь между инструментами | нода на холсте воркфлоу рядом с генерацией видео и монтажом |
| Кто собирает сцену | агент на GPT-6 Astra; сообщения на Auto бесплатны, конкретная LLM списывает кредиты (GPT-6 Astra около 17 кредитов за сообщение) | ассистент на компактном формате патчей и макросах, 10–100 ₽ за сцену |
| Ассеты | импорт GLB, персонажи Mixamo, экспорт GLB и mp4 | примитивы и группы, экспорт mp4 |
| Рендер финала | видеомодели Higgsfield, оплата кредитами подписки | Seedance 2.5, Hailuo H3 и остальной каталог, оплата по факту |
| Подписка | от $19 за 270 кредитов в месяц, оплата зарубежной картой | без подписки, российские карты, рубли |
| Правки | без перегенерации: объекты двигаются руками и через чат | без перегенерации: гизмо, инспектор, чат, undo |
У Higgsfield шире библиотека ассетов: готовые GLB-модели и анимированные персонажи Mixamo сразу дают сцене узнаваемые силуэты. У нас пока примитивы, зато сцена стоит на том же холсте, что и видеомодель, монтаж и извлечение кадров.
Сколько это экономит
Секунда Seedance 2.5 в 720p стоит 46,2 ₽, ролик на 15 секунд выходит около 700 ₽ за прогон без референса и около 830 ₽ с видео-референсом той же длины. Добиться сложного пролёта промптом с десяти попыток стоит 7 000 ₽ и пару часов ожидания, и это без гарантии. Сцена через ассистента обходится в 10–100 ₽, рендер бесплатный, а дальше один или два прогона видеомодели по референсу. Для Hailuo H3 пропорция та же: 768p стоит 12 ₽ за секунду, и пять лишних дублей всё равно дороже, чем сцена.
Ролик из примера сгенерирован в 480p с 15-секундным референсом, такой прогон стоит около 370 ₽. Точный расчёт под свою длительность и разрешение есть в калькуляторе на странице цен; тарифы видеомоделей меняются, актуальные цифры всегда в личном кабинете.
Ещё пример: погоня за 14 ₽
Второй воркфлоу короче, зато в нём видно весь путь целиком: сцену собирает ассистент, референсы задают внешний вид, видеомодель отдаёт кино. Сюжет — машина гонится за человеком по дороге, три ката: общий план, крупный план на бегущего, общий вид с отъездом. Сцена из 50 объектов через ассистента обошлась в 14 ₽.
Превиз, который ушёл в видеомодель, выглядит так: красный кузов на серой дороге, зелёные сферы вместо деревьев, камера за машиной.
К нему подключены референсные изображения человека и машины, и Seedance 2.5 вернула зимнюю дорогу в сумерках, битую «шестёрку» и снежную пыль из-под колёс. Каты и положение камеры из превиза сохранились.
Что это меняет
3D-сцена появилась не сама по себе, а как ещё одна нода в редакторе воркфлоу рядом с генерацией изображений и видео, LLM-нодами, извлечением кадров и видеоредактором с таймлайном. Раньше сцена собиралась в одном сервисе, референсы готовились в другом, ролик генерировался в третьем, монтаж делался в четвёртом. Теперь это один экран, и каждый шаг можно переиграть, не вынося файлы наружу.
Higgsfield и мы пришли к одному выводу почти одновременно: следующий шаг управления видеомоделями не в промптах, а в геометрии. Модель точнее повторяет то, что ей показали, чем то, что ей описали.
Где попробовать
Нода «3D-сцена» доступна в конструкторе воркфлоу всем пользователям GPTunneL: добавь её на холст, опиши сцену в чате или собери руками, подключи выходы к Seedance 2.5 или Hailuo H3. Быстрее всего начать с готового шаблона с орлом и трактором: открой его и подставь свою раскадровку. Без подписки, с оплатой по факту в рублях российскими картами и без VPN.
Вопросы
Нужно ли уметь работать в 3D-редакторах? Нет. Сцену собирает ассистент по текстовому описанию, руками остаётся подвинуть объект или переставить камеру. Гизмо и таймлайн устроены так же, как в любом 3D-пакете, но знать Blender не требуется.
Какие видеомодели понимают видео-референс? Промпт ноды подобран на Seedance 2.5 и MiniMax Hailuo H3, у обеих референсное видео можно явно назначить источником камеры. С другими моделями результат зависит от того, поддерживают ли они видео на входе.
Можно ли загрузить свою 3D-модель? Пока нет, сцена собирается из примитивов и групп. Внешний вид объектов задаётся референсными изображениями на входе видеомодели, а не геометрией.
Сколько стоит рендер превиза? Ничего. Рендер идёт в браузере через WebCodecs, платишь только за ассистента (10–100 ₽ за сцену) и за генерацию видеомоделью.
Это аналог Higgsfield 3D Jutsu? По задаче да: превиз из примитивов, который видеомодель использует как референс камеры. Отличия в том, что у нас сцена встроена в воркфлоу рядом с генерацией и монтажом, нет подписки и оплата в рублях.



