18 сентября мы выпустили Гром Звук - свою музыкальную модель, которая делает песню целиком: вокал, аранжировку, сведение. Первые сообщения в комментариях и в личке были не вопросами, а упрёком: «ах вы негодяи, отбираете хлеб у и так бедных музыкантов». Отвечаю развёрнуто потому что у нас есть то, чего нет у большинства спорящих - статистика. Через музыкальные модели GPTunneL проходят десятки тысяч генераций в сутки, и по ним хорошо видно какие задачи люди решают нейросетью на самом деле. Короткий ответ: ИИ не заменит музыкантов. Длинный - ниже: четыре трека, сравнения и рассказ о том, как я сам играл в группе.
Кто и зачем генерирует музыку десятки тысяч раз в день
Запросы делятся на четыре группы, и ни одна не выглядит как «уволить музыканта».
Первая и самая большая - музыка там, где музыканта никогда не было. Песня коллеге на день рождения, поздравление родителям, гимн для чата друзей, трек под ролик, фон для презентации. Никто из них не собирался заказывать аранжировщика и платить за студию. Раньше они брали чужой трек из библиотеки или обходились без музыки, теперь у них есть своя.
Вторая - черновик идеи. Это как раз музыканты и продюсеры. Есть текст и ощущение как это должно звучать, но неясно куда идти: в балладу или в панк, с гитарами или с синтами. Человек генерирует пять вариантов в пяти стилях и слушает где идея оживает. Это эскиз, а не релиз: дальше человек идёт в студию или в DAW своей дорогой.
Третья - каверы и переаранжировки. Услышать свою же песню в регги или с биг-бэндом, или взять известную мелодию и подставить свой текст. Один из самых востребованных сценариев, и судя по формулировкам здесь люди чаще играют, а не работают.
Четвёртая - прикладная музыка: джинглы для подкастов и малого бизнеса, инструментал под видео, эмбиент для приложения. Раньше это была ниша стоковых библиотек, и вот её генерация действительно теснит.
Заметь: в этом списке нет пункта «сочинить хит вместо артиста». Не потому что модели это запрещено, а потому что так запросы не выглядят. И это не случайно: для хита нужен талант. Написать нейросети «создай хит» недостаточно - она вернёт песню, но хитом её делает то, чего в промпте нет: идея, вкус и человек, которому есть что сказать.
Что умеет модель и что умеет музыкант
Гром Звук работает в два этапа: планировщик пишет партитуру символами (ноты и структура - где куплет, где припев, какая гармония), а синтезатор разворачивает её в звук 48 кГц стерео, до пяти минут за один проход. Это ремесло: аранжировка, исполнение, сведение. Модель делает его быстро и предсказуемо. А вот о чём песня, для кого и зачем - не решает.
| Задача | Нейросеть | Музыкант |
|---|---|---|
| Придумать, о чём песня и что в ней важно | Нет: работает только с тем, что задали | Да, это и есть авторство |
| Написать аранжировку под текст | За 1–2 минуты | От часов до дней |
| Переложить готовую песню в другой жанр | Минуты | Дни репетиций и перезапись |
| Услышать, что вариант плохой, и объяснить почему | Нет, у неё нет вкуса | Да - этому учатся годами |
| Сыграть на сцене перед залом | Нет | Да |
| Отвечать за результат своим именем | Нет | Да |
Дешёвыми стали те стадии, которые музыканты и раньше делегировали: сессионщикам, аранжировщикам, звукорежиссёрам. Дорогими остались замысел, вкус и отбор. Модель отдаёт варианты, а человек решает какой из них песня. Если решать нечего, инструмент не поможет - получится нейрослоп, о нём ниже.
Как это было в нулевых и как стало

Я в нулевых играл на электрогитаре в клубах Москвы, поэтому про «раньше» говорю не из статей. Репетиционная база по часам, а чаще гараж - в два раза дешевле, чем студия в ДК «Мир». Записывались в лучшем случае у кого-то дома, через линейный вход на старом Pentium 4. Макбук на Mac OS X Leopard был запредельной роскошью, зато позволял записать трек без наводок от сети. А чаще писали вообще на кассетник одним дублем - чтобы было что показать менеджеру клуба. Студия была не по карману, да и с ней всё было бы в разы дольше: писать, потом сводить. За всю мою историю мы записали в студии ровно один трек, и чтобы уложить все партии на три минуты, ушли почти сутки без перерывов. Записи, жаль, не сохранились, но трэш был тот ещё. Одну только свою гитарную партию я переписывал сотни раз: каждый дубль - непопадания, ошибки, и всё сначала.
Сейчас в Гром Звук замысел песни живёт в партитуре, и её можно править частями: сменить жанр, убрать вокал, поменять инструмент, подставить другие строчки. Результат приходит через минуту-две готовым треком. Мы бы о таком мечтали, если бы вообще могли представить что такое когда-нибудь будет возможно: нажать кнопку и услышать как эта же песня звучит без гитарной стены, но с духовыми. В то время жёсткий диск внутри iPod уже казался технологией с другой планеты.
Сами песни, риффы и тексты, которые мы писали на кухне, от кнопки лучше бы не стали. Кнопка сокращает дорогу от идеи до проверки, а не заменяет идею.
Четыре трека: одна модель, четыре подачи
Четыре примера со страницы Гром Звук, все сделаны моделью целиком, без ручного сведения. Это one shot - первый же вариант, как он вышел из модели, поэтому в треках есть шероховатости: неверное ударение, не то произношение. Всё это правится, но треки здесь именно для того, чтобы показать что получается, если просто закинуть идею и нажать кнопку.
«Гром со вкусом Пепси» - авторский текст, а мелодию и аранжировку с налётом Ланы Дель Рей модель собрала по примеру, который я в неё закинул. «Знаешь ли ты?», «Шадэ» и «Умный помощник» - каверы: мелодия и узнаваемость исходника на месте, но всё остальное пересмотрено полностью - другие инструменты, другой подход к подаче. Партитура та же, а песня совершенно другая. В этом и есть практический смысл генеративной музыки сегодня: проверить идею в нескольких стилях и подачах за считаные минуты, а не за недели репетиций. Какой из вариантов «правильный» модель не знает. Это решает тот, у кого была идея.
Технологии пугали музыкантов каждые двадцать лет
В 1930-х, когда в кинотеатры пришло звуковое кино, американская федерация музыкантов вела кампанию против «консервированной музыки»: оркестры, игравшие под немые фильмы, действительно потеряли работу. Музыка из кино при этом никуда не делась, её стали записывать, и композиторов для кино понадобилось больше.
В начале 1980-х британский профсоюз музыкантов пытался ограничить синтезаторы и драм-машины в записях: барабанщикам предрекали конец. Roland TR-808 вышла в 1980-м, и её звук стал основой хип-хопа и электроники - жанров, которые дали работу целому поколению новых музыкантов. Живые барабанщики остались, просто перестали быть единственным способом получить ритм.
В 1998-м Cher выпустила «Believe» с демонстративно слышимым Auto-Tune, и спор «это ещё пение или уже нет» шёл лет десять. Сегодня Auto-Tune - стандартная строка в любом продакшене, а певцы, которые поют чисто, ценятся выше.
Домашние студии в 2000-х сделали то же с записью: студий стало меньше, музыкантов, выпускающих треки, на порядки больше.
Схема одна: технология удешевляет ремесло, порог входа падает, музыки становится больше, а те, у кого есть вкус и своя интонация, на этом фоне только слышнее. Эволюцию не остановить, и не надо: она ни разу не убрала музыканта, она убирала монополию на инструмент.
Нейрослоп - это не свойство инструмента
Слово «нейрослоп» уже стало отдельным поисковым запросом, и я понимаю откуда оно: безликой сгенерированной музыки в интернете много - достаточно включить Алису, Яндекс Музыка кишит нейрослопом, и с этим конечно нужно бороться. Но слоп появляется не из-за модели, а из-за отсутствия замысла и отбора. Человек нажал кнопку один раз, взял первый вариант, выложил. У такого трека нет автора, и это слышно.
Тот же инструмент в руках человека с идеей даёт другое. Он пишет свой текст, а не просит модель «про любовь». Гоняет десять вариантов и выкидывает девять. Слышит что второй куплет провис и правит его отдельно, а не перегенерирует всё. Знает как должен звучать припев, потому что слышал его в голове до генерации. Электрогитара в 1950-х тоже была для одних игрушкой, а для других новым языком - разница была не в гитаре.
Формула простая: ИИ - это инструмент. Талантливому он помогает быстрее пройти путь от замысла до результата и попробовать то, на что раньше не хватало времени и денег. Человеку без замысла он честно отдаёт результат без замысла.
Кого заменит на самом деле
Чтобы не выглядеть агитацией скажу и неприятную часть. Давление уже чувствуют стоковые библиотеки и та часть рынка, где заказчику нужен «просто трек за три дня»: джингл для регионального автосалона, подложка под корпоративное видео. Такую работу генерация делает быстрее и дешевле, и этот спрос уходит в модели - по нашим десяткам тысяч генераций в сутки это видно уже сейчас.
Не под давлением всё, что держится на личности: артист с аудиторией, живой концерт, автор с узнаваемой интонацией, продюсер с вкусом. У этих людей инструментов стало больше, чем у любого поколения до них. Аранжировщик, который раньше писал три демо в неделю, теперь предлагает клиенту двадцать вариантов за вечер и занимается тем, за что ему на самом деле платят - выбором и доводкой.
Что мы будем с этим делать
Мы в GPTunneL много вкладываем во все направления генеративных моделей: текст, картинки, видео, звук. Музыка среди них - одно из самых важных. Гром Звук работает на наших собственных мощностях, и над ним занята отдельная команда специалистов по музыкальным моделям: в России мы одни из первых, кто развивает это направление у себя, а не перепродаёт чужой API. Модель будем развивать дальше: точнее пение по тексту, больше контроля над партитурой, правка отдельных частей трека.
Проверить сказанное на своей идее просто: открой Гром Звук, опиши стиль, отдай свой текст и послушай что получится. На старте трек стоит 4 ₽ - со скидкой 50%. Заодно проверишь главный тезис статьи: модель отдаст тебе песню, но решать песня ли это всё равно придётся тебе.



