ИИ генерация музыки. Барсучье руководство
В приложении удобнееQR для скачивания приложенияRuStore · Samsung Galaxy Store
Huawei AppGallery · Xiaomi GetApps

Читать бесплатно онлайн книгу  ИИ генерация музыки. Барсучье руководство

Игорь Барсуков

ИИ генерация музыки

Барсучье руководство

Шрифты предоставлены компанией «ПараТайп»


Дизайнер обложки Максим Ступин





12+

Оглавление

Предисловие

Тяга к новым горизонтам свойственна любому человеку, да и в целом полезно расширять круг интересов. По ходу литературной деятельности у меня скопилось некоторое количество стихов и песен, которые вкладывал в уста своих персонажей. А так как в хорошем тексте случайностей не бывает, то песнями я старался выразить черты характера или атмосферу, то есть они у меня по-настоящему играли в голове. Но не у читателя. Ничего удивительного, что глядя на текст, я постоянно видел нераскрытый потенциал.

Тексты долго пылились в столе, но вдруг наступила эпоха ИИ-технологий, и оказалось, что теперь можно озвучить то, что раньше безмолвно чернело на бумаге.

Занявшись вопросом, я за год прошёл полный путь от создания песен до их публикации, изрядно избороздил просторы интернета, много общался со специалистами и энтузиастами на тему генеративной музыки. При проработке вопросов, оказалось, что документации по генерации музыки хоть и много, но пребывает она в виде разрозненных хаотичных источников. Сами же генерирующие сервисы при этом не спешат давать исчерпывающую справку, заставляя пользователей искать решения методом тыка.

Глядя сколько у меня на руках образовалось материалов, мне откровенно стало жаль, что на этом заглохнет проделанная работа. Поэтому решил найти время и создать руководство по генерации песен с помощью ИИ. Здесь представлен гид и справочник на основе компиляции множества источников и бесед, приведённые к общей структуре. Если вы новичок в области генеративной музыки, но горите желанием в ней реализоваться, то данное руководство ответит на 95% ваших вопросов. Если же ИИ вам не в новинку, всё равно полистайте, уверен, найдёте много нового.

Надеюсь, что сэкономленное время на поиске нужной информации, вы потратите на повышение качества своих творений. Успехов!

Введение

Здравствуйте, дорогой читатель!

Раз уж вам в руки попалась данная книга, значит, в вас живёт интерес к теме генерации музыки. И потому сразу развеем главное опасение: если руководство настолько объёмно, то может технология слишком сложна и не стоит в неё лезть? Отнюдь. Данная книга получилась такой большой как раз потому, что мне очень хотелось собрать максимум информации по вопросу генерации музыки. Конечно, всех аспектов технологии и методик работы изложить в одной книге не получится, тем не менее, удалось собрать огромное количество инструкций, рекомендаций и шаблонов.

Всякий раз, когда мне приходилось осваивать новую технологию, почти всегда приходилось сталкиваться с куцей официальной документацией и слабыми примерами в гидах. В случае работы с ИИ ситуация гораздо хуже, официальной документации вообще нет. Данное руководство объёмное за счёт большого числа примеров и проработки различных нюансов. Буквально, если в рамках работы мне не хватало какого-то материала, и мне пришлось предпринять усилия, чтобы добыть его, я включил найденный материал в данное руководство. К примеру, описание полного состава симфонического оркестра или шаблоны по видам баса.


Как читать данную книгу?

Если вы хотите приступить к созданию аудио треков прямо сейчас, не тратя времени на книгу, то много читать не придётся. Вам достаточно пробежать пару страниц §1.2. «Сделать песню прямо сейчас», на что уйдёт несколько минут. И всё. Дальше садитесь к компьютеру или беритесь за смартфон, и через десять минут песня, созданная вашими руками, будет у вас. Причём совершенно бесплатно.

Но при этом новая песня будет получена с некоторой долей удачи. В ней могут оказаться не устраивающие вас моменты, а повторить тот же трек с небольшими изменениями будет почти невозможно. И тогда, наверное, захочется узнать немного больше: как строить целенаправленный запрос, как задать текст собственной песни, как выбрать ту или иную настройку. Для решения всех этих вопросов читать много тоже не потребуется. Параграф §1.4. «Краткий гид по Suno» занимает всего 3% руководства, но позволяет ознакомиться со всеми аспектами грамотного построения запроса к нейросети. Что позволит в свою очередь не просто играться с сервисами генерации музыки, а целенаправленно работать над достижением результата.

О чём же тогда остальная книга? Всё прочее — это разъяснение нюансов генерации. Большая часть руководства посвящена промпто-строению — формированию запроса к ИИ для создания нужного аудио трека. Одну треть книги занимает глава 2 «Составление промптов», в которой скрупулёзно перебираются элементы запроса к нейросети. Сходу совершенно не обязательно читать всю главу. Ей можно пользоваться отдельными разделами, в зависимости от того, с какими сложностями вы столкнётесь при работе. Но и прочитать целиком, в конце концов, стоит, потому как, наверняка, вы откроете для себя неизвестные или неочевидные моменты. Ещё четверть книги занимает приложение «Справочник тегов», расположенный в конце. Справочник в структурированной форме и сухом изложении перечисляет известные элементы запроса, что позволяет быстро по ним перемещаться и находить требуемую информацию: описание, параметры, синтаксис, жанровое влияние.

В третьей главе без лишних описаний приведено множество шаблонов и готовых промптов для генерации песен и инструментальных композиций. По сути уже их хватит на создание десятков треков во всём многообразии музыкальных жанров. Но в то время как глава 3 даёт возможность магическим способом решить задачу в нужном жанре, то глава 2 даёт понимание и позволяет перейти к инженерному проектированию.

Таким образом, на построение запроса к нейросети уделено три четверти руководства. О чём остальная часть книги?

В первой главе даются вводные о том, что такое искусственный интеллект, нейросеть, какие сети бывают и прочие термины, используемые в работе с ИИ.

Глава 4 «Производство музыки» рассказывает о медиа-сфере, методах публикации музыки, получении вознаграждения за прослушивание вашей музыки, продвижении и маркетинге. При этом возникает целый ряд вопросов по окончательному продакшену аудиотреков и подготовке дополнительных материалов. Глава 5 рассказывает о методах сведения и мастеринга аудио, а также проводит обзор по различным дополнительным аудиосервисам. В главе 6 отражены вопросы производства сопутствующих аудиокомпозиции видеороликах, изображений, а также работа с текстом. В вопросе работы с текстом рассматриваются не только моменты генерации текста, но и методики сочинения песен.


Непогрешимость нативного руководства

Казалось бы, раз уж вы держите в руках целую книгу, то написать её непременно должен специалист в данном вопросе. К сожалению, нет. Основная причина появления данного руководства — отсутствие подобных всеобъемлющих материалов. Во всяком случае, изрядно побродив по просторам интернета, мне не удалось найти единого материала в сопоставимых объёмах.

Второй причиной является сама природа ИИ-технологий. Нейросети отличаются от обычных программ тем, что предлагают не чёткую реакцию на заданный параметр, а имеют высокую степень вариативности, то есть непредсказуемости поведения. И возможно именно поэтому разработчики ИИ не спешат выкладывать детальную документацию. Она вся насквозь носит не обязательный характер, а рекомендательный.

Ну, и третьим моментом является стремительность развития технологии. К сожалению, передовые технологии имеют тенденцию быстро устаревать. Поэтому возможно, что материал данного руководства уже лет через пять потеряет актуальность. Но это не значит, что стоит вообще жить без документации. Держать в голове подобный объём информации не так уж просто, а как до него дойти, не имея точки опоры?

Данное руководство является компиляцией множества трудов исследователей и энтузиастов дела генеративной музыки. И, между прочим, среди них имеются и настоящие музыканты, певцы и музыкальные продюсеры.

Полный список источников, послуживших основой для создания руководства, приведён в конце книги. Как сможете убедиться, там нет литературных источников, всё сплошь интернет-страницы, что только подчёркивает новизну данного руководства.

В списке благодарностей упомянуты авторы разных проектов. Ведь часть информации получена в рамках общения, и предоставить ссылку на конкретное описание невозможно.

Все указываемые суммы справедливы в рамках цен на май 2026 года.


Указатели

Руководство содержит техническую информацию, и на всём протяжении книги используется ряд служебных символов и маркировок.

[] — квадратные скобки, наиболее часто встречающийся элемент в книге.

Инструкции к нейросетям содержат ключевые слова и фразы, часто называемые метатегами, а в данном руководстве просто «тегами», например: [female vocals]. Такие ключевые слова выделяются квадратными скобками, чтобы было понятно, что это инструкция, которую можно вставить непосредственно в запрос к нейросети. Учитывая специфику генерации музыки, комплексный запрос к ИИ может содержать текст песни, вводимый текстом «как есть», и описания стилей — уже названные теги. Тогда прямо в запросе теги выделяются квадратными скобками, и потому их можно копировать прямо из руководства (конечно, если вы читаете электронную версию книги, а не печатную).

Вторым элементом являются {} — фигурные скобки. Ими в руководстве маркируются две группы данных.

Если в фигурных скобках встречается только число {1} или число с заголовком {1. Бояндин К. Ю. Suno Tags}, то так в руководстве указан источник материала. Число указывает на пункт в «Списке источников».

В случае если фигурные скобки встречаются внутри инструкции с фразой внутри, то этим подразумеваются замещаемые данные. К примеру:

[genre: {жанр}]

В данной инструкции требуется заменить слово «жанр» на желаемое значение, то есть преобразовать в:

[genre: afro-rock] или [genre: cinematic]

По ходу изложения будет встречаться много текста на английском языке. Сразу уточним, что повсеместно для подачи информации автор использует русский язык. Соответственно, на английском представлены:

— элементы управления на описываемом интерфейсе;

— название опции, которая имеет неоднозначный перевод с русского для поиска дополнительных материалов, например: «whisper tracks» — шепчущие слои;

— теги.

Хотя приведённые инструкции должны работать в различных нейросетях, в основном речь идёт о сетях, произведённых в передовых западных проектах и использующих для внутреннего анализа инструкций английский язык. Поэтому и запросы к нейросетям в генерации музыки лучше делать на английском. Таким образом, теги в квадратных скобках чаще всего приведены в англоязычном выражении.

Замечание. Так как руководство в первую очередь преследует цель быстрой подачи информации, то многие фразы на английском (но не все) следом немедленно дублируются на русском.


Ссылки на треки

Публикуемый материал содержит ссылки как на шаблонные промпты, так и использовавшиеся для генерации треков. Во избежание претензий по авторским правам, автор руководства в связке промпт + название композиции указывает только промпты на свои треки. Именно поэтому в тексте можно увидеть преимущественно треки исполнителя «Барсук-Бэнд». Ссылки приведены на тот случай, если читатель захочет услышать звучание композиции, полученной с помощью приведённого промпта. Указанные композиции можно найти на стриминговых платформах.

Ссылки на треки иных исполнителей не сопровождаются промптами.

Ссылки на других исполнителей в сочетании с промптом даны только в рамках получения общего стиля, в котором преимущественно работал артист, но приведённого промпта не будет достаточно для получения имитации указанного артиста (разве что только в ходе случайного совпадения в рамках вариативности модели).


На этом с введением всё. Желаю приятного чтения, разнообразных идей, неожиданных находок, а главное, чудесного результата. В случае возникновения конструктивной критики, просьба писать на почтовый ящик, указанный в конце книги, в приложении «Список источников».

ГЛАВА 1. ОСНОВНЫЕ ПОНЯТИЯ

§1.1. Разбор матчасти

1.1.1.О чём речь?

2025 год стал переломным на рынке музыки. Год начинался в состоянии, когда музыкальные чарты почти полностью состояли из песен живых музыкантов. Треки могли быть собраны в программе, но, тем не менее, работа с DAW (цифровая звуковая рабочая станция) требовала определённых навыков музыканта или звукотехника. Заканчивался же год ситуацией, что большая часть музыкального контента поступающего на музыкальный рынок стала генеративной.

Что значит «генеративный контент»? Теперь многие новые инструментальные композиции и песни, которые вы слышите на радио, стримингах — создаются без участия живых музыкантов и вокалистов. Пользователь составляет зачастую несложный текстовый запрос и получает на выходе готовую песню или композицию. Возможно, часть из них дорабатывается с настоящими музыкальными инструментами, но основа — генерация из машины.

Сейчас чтобы выпустить песню не требуется иметь музыкальное образование, не обязательно владеть музыкальным слухом, не надо покупать дорогие инструменты, не нужно собирать и организовывать целую команду музыкантов, а затем долго репетировать, чтобы добиться слаженности. Всё можно сделать нажатием одной кнопки.

Отныне создавать музыку так просто, что порог входа в индустрию резко упал. В результате, некоторые умельцы поставили производство треков на поток, зачастую генерируя очень низкокачественный контент (нейрослоп). На начало 2025 года производство треков в мире оценивалось в 40000 ежедневно, причём до четверти приходилось на генеративную музыку. К концу года большая часть треков стала генеративной.

Генеративная музыка — это следствие развития ИИ-технологий. Массовая автоматизация человеческой деятельности докатилась до стадии, когда для выполнения работ не требуются особые навыки в виде знания языка программирования. Запрос на выполнение можно составить «на словах» — человеческим языком, ИИ расшифрует запрос пользователя, структурирует его и реализует задачу, если она обучена её выполнять.

С начала 2020-х годов несколько компаний предприняли разработку программ на основе генеративного ИИ и за короткий срок добились впечатляющих успехов. Главным мерилом стало то, что в 2025-ом году некоторые генеративные треки стали возглавлять музыкальные чарты, при этом средний слушатель не мог отличить ИИ-генерацию от живой музыки.

Направлений в развитии музыкальной генерации несколько: генерации бесконечных потоковых треков для фоновой музыки, подкастов и стримов; создание персонализированных звуковых ландшафтов для сервисов, магазинов и игр; песни по персональному запросу любой сложности; создание семплов — коротких звуковых фрагментов для DAW; музыка и звуковые эффекты для стилизации.

В данном руководстве мы разберём создание полноценных песен. Лидерами в данной технологии являются: MemoTune, Suno, GenAPI, Udio, Beatoven, MusicGEN. Безусловным лидером в сочетании лёгкость работы + качество и полновесность результата на момент написания руководства является Suno. В целом, всё изложенное в данном руководстве в первую очередь будет относиться к Suno, но вполне применимо и для прочих нейросетей с определёнными поправками.

1.1.2.Кому это нужно?

В целом технология вышла в народ, запрещать её бесперспективно, надо стремиться к повышению эффективности использования. Данным руководством я стремлюсь предоставить в готовом виде как можно больше информации, в первую очередь для повышения качества музыкальной продукции среди непрофессионалов.

До 2025 года генеративная музыка имела ярко-выраженные отличия от живой, и не воспринималась всерьёз музыкальной индустрией. Затем стало ясно, что на ограниченный музыкальный рынок заходит целый поток новых участников, и всем прочим придётся потесниться, что немедленно породило серию скандалов и судебных разбирательств. В основном в отношении авторского права, так как за иное зацепиться невозможно. Но любым рынком управляют магнаты, а для них «прибыль = доходы — расходы», где расходы — это затраты на производство медиа-контента. Снижая стоимость производства, они увеличивают прибыль и повышают независимость от рядового участника процесса. Поэтому технология зашла и стала распространяться на всех уровнях производства.

Для кого она может быть полезна? Если расценивать нейросеть в качестве нового музыкального инструмента, то — всем.

Артистам и авторам песен. Нейросеть помогает быстро проверить идею — записать демку, подобрать гармонию или понять, как звучит трек в разных стилях. Даже без продюсера и студии можно за пару минут получить черновик песни и дальше доработать его вручную.

Нейросеть полезна музыкантам, которые пробуют звучание в различных стилях и ловят удачное не предсказанное решение. ИИ позволяет в одиночку отрегулировать текст под заложенный мотив или исполнение, генерирует необходимые звуковые эффекты и фрагменты, а также демо или полноценные заготовки.

Музыкальным продюсерам. Нейросеть ускоряет работу над проектами, помогает накидать основу трека, подобрать мелодию или гармонию, сгенерировать партии отдельных инструментов — например, если нет сессионного музыканта или нужного инструмента под рукой. Это удобно и в коммерческих заказах: быстро собрать несколько вариантов и показать клиенту направление.

Саунд-дизайнерам и авторам контента. Если нужна музыка под видео, подкаст или сторис, нейросеть помогает сделать фоновые треки за пару минут. Не обязательно разбираться в теории музыки — достаточно описать настроение и жанр. Отлично подходит для инди-проектов, связанных с видеоиграми.

Она полезна простым людям возможностью легко создать музыкальную открытку, оригинальную песню для праздника, которая подчеркнёт настроение. Например, можно сделать весёлую поздравительную песню с упоминанием имён и важного события.

На самом деле спектр невероятно широк. Подумайте только, на какой уровень может подняться творческая самодеятельность. К примеру, школьная театральная постановка теперь не ограничена существующими композициями и не требует большого бюджета. При должном участии родители могут создать неповторимый уникальный репертуар на довольно высоком уровне за короткий срок.

В данном руководстве мы не будем учить музыкантов новому дивному миру (автор в плане музыки не дорос до их уровня), хотя ИИ-генерации в своём творчестве активно используют не просто известные исполнители, но и лидеры. Согласно исследованию Water & Music: 78% профессиональных музыкантов уже используют ИИ, но не для однокнопочной генерации, а для разделения на стемы, мастеринга и поиска идей. В качестве целевого читателя мы положим человека не слишком знакомого с процессом создания музыки, и постараемся ответить на все возможные вопросы. При этом надеемся, что руководство, хотя бы в качестве справочника, будет полезно и работникам медиа-сектора.

§1.2. Сделать песню прямо сейчас

1.2.1.Визард

Не хочу читать много слов, хочу прямо сейчас создать песню. И бесплатно.

Без проблем. Делаем по шагам:


Шаг раз

Открываем в браузере сайт Suno (прямая ссылка указана в конце данного параграфа). Сайт ждёт, что мы авторизуемся. Жмём справа вверху кнопку «Log In», если уже ранее работали с сайтом или «Join Suno for free», если в первый раз.

Можно зарегистрироваться непосредственно на сайте, но проще всего воспользоваться сквозной авторизацией от существующего аккаунта. К примеру, Google. Если у вас есть смартфон с ОС «Андроид», то, скорее всего, у вас уже есть аккаунт в Google, где хранится записная книжка ваших контактов и прочее. Если так, то жмём кнопку «Continue with Google» и сайт перебрасывает нас на страницу авторизации в Google. Если вы там уже авторизованы, то вам достаточно выбрать аккаунт, и вас вернёт на сайт Suno авторизованным. Если нет, то сможете прямо там войти в свой аккаунт. Также авторизоваться можно с помощью других сервисов (Apple, Discord, Microsoft или иностранный номер телефона).

Если аккаунта нет, то самое простое — зарегистрироваться на сайте Google, получить заодно почтовый ящик для работы, и использовать его для прочих подобных сервисов. Почти все нейросети адаптивны к сквозной авторизации, что позволяет не заморачиваться с бесчисленными личными кабинетами и не запоминать для них паролей.


Шаг два

Вернувшись на сайт после авторизации, в левом меню переходим на пункт Create, переключаем сверху селектор «Simple/Advanced» в режим «Simple», а также смотрим, чтобы расположенный рядом селектор версии стоял на «v4.5-all». На апрель 2026 года это наиболее качественная бесплатная модель.

Если указана другая, а у вас бесплатный тарифный план, то при нажатии на кнопку генерации вы получите предложение обновить план и всё.

В поле «Song Description» пишете (на русском или ином языке) то, какую песню хотели бы получить. К примеру: «поздравительная песня на день рождения любимой бабушке Анастасии от детей и внуков».


Шаг три

Жмите кнопку «Create» (генерация) внизу страницы.

Готово! Сайт за пару минут создаст два варианта песни по вашему запросу. Когда они появятся, вы можете нажать на иконку, чтобы прослушать прямо на сайте ещё до окончания генерации, либо нажать кнопку «…» (три точки) для вызова меню на песне. Если генерация закончилась, то в меню песни будет доступен пункт «Download/MP3 Audio». При нажатии на него вылезет предложение с обновлением тарифного плана, но нажав кнопку «Download Anyway» вы скачаете к себе на компьютер трек.

1.2.2.Чуть больше

То же самое можно реализовать на смартфоне. Для этого лучше скачать в магазине приложений приложение Suno. Меню в приложении немного отличается, но в целом повторяет те же пункты.


Сколько можно создавать песен в Suno бесплатно? До 10 песен ежедневно.

На бесплатном тарифе счёт пополняется до 50 кредитов каждые сутки в 00:00 по Гринвичу. Каждая генерация создаёт одновременно два варианта и тратит 10 кредитов. То есть в сутки удастся нажать на кнопку всего 5 раз. Если нужно больше, то придётся покупать платный тариф. В 2025 году тариф PRO стоит около 1000 руб./месяц, на нём можно создать 500 песен.

Как оплатить подписку, описано в п.4.4.7 «Прочее/Оплата НС».


Не хочу песню, хочу только музыку.

Композиция без слов называется инструментальной. В поле «Song Description» есть кнопка «Instrumental», которая позволит создать трек только с музыкой.


Хочется песню со своим текстом?

Переключитесь в режим «Advanced», там много настроек, но ключевыми становятся поля «Lyrics» и «Styles». В поле «Lyrics» внесите свой текст, а в поле «Styles» напишите стили, в которых вы хотите получить песню (можно на русском языке). К примеру, «диско 70-х с пульсирующим басом, женский вокал».


Каковы основные правила формирования запроса к нейросети?

— Текст в поле «Lyrics» должен содержать текст песни.

— Ничего кроме букв желательно не использовать. Будет ли НС петь цифры и как — зависит от настроения НС.

— Большие буквы означают усиление голоса или акцент.

— Текст в круглых скобках чаще всего обрабатывается как бэк-вокал.

— Текст в квадратных скобках — инструкции к исполнению. НС петь их не должна. В квадратных скобках также можно указать стили, вместо того, чтобы указывать их в поле «Styles».


Можно ли пользоваться Suno на русском языке?

Да, можно. Как текст в поле «Lyrics» можно задавать на русском, так и стили описывать в поле «Styles». Но стили всё же лучше писать на английском — меньше будет недопонимания из-за перевода.


Как сделать проще?

Проще не получится. Можно найти в интернете или в социальных сетях чат или канал с ботами, которые могут генерировать песню по вашему запросу. Но, во-первых, они наверняка будут платными; во-вторых, они потребуют указать всё то же самое, что и на формах Suno; а в-третьих, они подключатся к Suno и создадут песню для вас у них, сами они не умеют. То есть это, банально, посредники, которым надо платить.

Ссылок на боты мы давать не будем за отсутствием смысла как такового.


Прямая ссылка на сайт Suno: https://suno.com

Хотите знать больше? В разделе §1.4. «Краткий гид по Suno» изложены основные принципы работы с данной нейросетью.

§1.3. Нейросети

1.3.1.Генерация музыки

Начнём с того, что говорить в этой книге мы будем не об ИИ (искусственном интеллекте), а об НС (нейросети). Как это часто бывает в реальности, имеет место подмена понятий, и как следствие возникают заблуждения. ИИ — это сущность, способная решать задачи уровня человеческого интеллекта, в том числе в незнакомой ситуации. Первая же ассоциация с ИИ — машина, разумная как человек. Но подобное понятие неприменимо к генеративным моделям. Чаще всего, когда говорят ИИ, подразумевают программу, способную накапливать данные и автоматически обучаться на них, а в данной формулировке нет понятия «интеллект». Поэтому в данном руководстве будем старательно использовать формулировку НС (нейросеть) для обозначения программного продукта, способного расшифровать запрос пользователя, дополнить его и реализовать заданную цель.

НС генерирует треки по текстовому запросу, который может включать описание стиля желаемой композиции и текст песни. НС имитирует решение интеллектуальных задач, обучается на основе прошлых данных (запоминает стиль пользователя) и управляет технологией интерактивной композиции, при которой компьютер сочиняет музыку в ответ на живое исполнение.

Что нужно для создания песни в НС? Зависит от целей и исходных данных. В минимальном случае — ничего. Буквально, вы можете попросить НС сделать песню, задав буквально пару ключевых слов. Чем меньше входных данных, тем более свободно она поступит, а согласно предустановкам постарается выдать максимально популярный вариант.

Для экономии часов разочарований следует понимать, как НС интерпретирует инструкции, и как эффективно выстраивать с ней коммуникацию. НС не читает промпт, как человек. Не следует инструкциям в строгом иерархическом порядке. Не генерирует «чистые» изолированные жанры. Не интерпретирует слова буквально так, как вы это подразумеваете.

НС преобразует текст в вероятностную сетку стилей. Смешивает сопутствующие музыкальные концепции, усвоенные из обучающих данных. Выполняет «мягкую классификацию», разделяя управляющий текст (стиль) и исполняемый текст (лирику). По умолчанию скатывается в статистически доминирующие «колодцы», если её активно не ограничивать.

НС смешивает музыкальные стили на основе закономерностей, усвоенных в процессе обучения. Когда вы запрашиваете «рэп», НС не создаёт чистый рэп, она автоматически подмешивает такие элементы, как трэп, хип-хоп, тяжёлый бас и биты, потому что в обучающих данных эти стили постоянно встречались вместе. Именно поэтому некоторые сочетания жанров звучат естественно, в то время как другие требуют тщательной настройки для корректной работы.

Каждое используемое слово несёт «статистический багаж» — ассоциации, которые модель усвоила во время обучения. Популярные теги тянут музыку к стандартным значениям, настройкам по умолчанию. Нечёткие «литературные» описания усиливают «протечку текста», когда текст промпта пропевается как часть песни. Структурная ясность в промптах важнее, чем красноречивый слог. Самое важное: поп-музыка непрерывно тянет одеяло на себя. Почти любой жанр притягивается к поп-звучанию, если активно этому не сопротивляться.

По статистике взаимосвязей в НС Suno, у рока около 315 млрд. связей с поп-музыкой, у фанка 116 млрд., и даже эмо имеет 12 миллиардов связей. Вот почему тщательно составленный промпт «индустриальный рок» иногда звучит на выходе как синти-поп: усвоенные НС шаблоны продолжают тянуть к себе. Понимание поможет обойти проблему, используя исключения, необычные жанровые сочетания и стратегические комбинации.

1.3.2.Виды НС

Какие существуют нейросети для генерации музыки?

Их великое множество. В конечном счёте, НС может развернуть каждый, даже на своём локальном ПК (см. п.5.4.5. «ACE-Step-1.5»). Нейросеть, в большинстве случаев, это БЯМ (LLM) — большая языковая модель, обученная на каталоге музыки. LLM можно либо купить, либо взять с открытым кодом, а обучить можно на своих записях, сформировав уникальную НС, умеющую петь вашим голосом в вашем стиле.

В реальности же сформировать и обучить модель требует изрядного мастерства, а чтобы добиться вариативности, качества звучания и богатства аранжировок — обширного каталога и огромного количества времени. Поэтому лучше идти к профессионалам.

Ниже представлен список НС, в которых можно генерировать целиком музыкальный трек (инструментал или с вокалом) по категориям пользовательских прав на генерируемый контент. Актуальный список приведён на https://t.me/iimuzyka/32

Полностью легальные, права у пользователя:

— Google Flow Music https://flowmusic.app/

— ElevenMusic (ElevenLabs Music) https://elevenmusic.io/

— Songlab https://songlab.ai/

— MuxAudio https://mix.audio/

— JenMusic https://www.jenmusic.ai/

Полностью легальные, права у сервиса генерации, то есть риски на площадке:

— Boomy https://boomy.com/

— Hook AI https://hookmusic.com/

— Sonic Hub https://ampsoundbranding.com/sonic-hub

Сомнительно легальные НС, так как не покупают лицензию у правообладателей для обучения НС. Треки можно использовать в коммерческих целях:

— Suno https://suno.com/

— Soundraw https://soundraw.io/

— Mureka https://www.mureka.ai/

— Choruz https://www.choruz.ai/

— Moises AI Studio https://moises.ai/features/ai-studio-music-creation/

— Tunee https://www.tunee.ai (Tem. Polor https://www.tempolor.com/)

— DiffRhythm https://diffrhythm.ai/

— Cassette AI https://cassetteai.com/

— Loudly https://www.loudly.com/music/ai-music-generator

— Song Generator https://songgenerator.io/

— Musicful https://www.musicful.ai/

— AIVA https://www.aiva.ai/

— Minimax https://www.minimax.io/audio/music

— ACE Studio https://acestudio.ai/

— Mozart AI https://getmozart.ai/

— Greysound https://greysound.ai/

— Treblo https://treblo.com/

— Muse https://www.muse.art/

— Evoke Music https://amadeuscode.ai/en/music

— Tunesona https://www.tunesona.com/

— PureBPM https://www.purebpm.com/

— Musci https://musci.io/

— Soundful https://soundful.com/

— EasyMusic https://easymusic.ai/

— Ecrett music https://ecrettmusic.com/

— VibeMusicing https://vibemusicing.com/

— KlangKI https://kisongerstellen.com/

— Evabeat https://www.evabeat.com/

— Synthia https://www.synthia.co/

— Musc https://musci.app/

— FuturBeats https://futurbeats.com/

— GeneratorAIMusic https://www.generatoraimusic.com/

— Wondera https://www.wondera.ai/

— DeepAI https://deepai.org/music

— Сберзвук SymFormer https://studio.zvuk.com/promotion/main/symformer

— Wuble https://www.wubble.ai/

— AI Make Song https://www.aimakesong.com/

НС некоммерческого использования, нельзя выкладывать на стриминг-сервисы:

— Udio https://www.udio.com/

— Mubert https://mubert.com/

— Beatoven https://www.beatoven.ai/

— MusicGen: https://musicgen.com/

— Napster https://napster.com/

— Tiangong SkyMusic https://music.tiangong.cn/

— TopMediAI https://www.topmediai.com/app/ai-music/

— Doubao https://www.doubao.com/

— Soundful https://soundful.com/

— Soundverse https://www.soundverse.ai/

— AuTunes https://www.autunes.com/

— Donna https://www.musicdonna.com/

— Splash https://www.splashmusic.com/

— Musicstar AI https://www.musicstar.ai/

— HarmonAI https://www.harmonai.org/

— GPTIndia SongGen https://app.gptindia.pro/

— SongR https://www.songr.ai/

— Melobytes https://melobytes.com/

— Sovina https://sonivamusic.com/

— Haio https://haio.fun/

— Audio Muse https://audiomuse.ai/

— Mozart AI https://mozartai.app/

— Suede AI https://www.suedeai.xyz/

НС с открытым исходным кодом для некоммерческого использования. Можно генерировать на своём оборудовании:

— ACE-Step https://ace-step.github.io/

— HeartMula https://heartmula.github.io/

— LeVo https://github.com/tencent-ailab/SongGeneration

— YuE https://map-yue.github.io/

— Stable Audio https://stableaudio.com/

— NotaGen https://github.com/ElectricAlexis/NotaGen

— SongBloom https://github.com/Cypress-Yang/SongBloom

— DiffRhythm2 https://huggingface.co/ASLP-lab/DiffRhythm2

Здесь представлены только оригинальные НС. Их алиасы, дочерние или сторонние сервисы, использующие данные НС, не включены в списки.

1.3.3.Виды интерфейсов

На практике работа с НС реализуется в двух версиях интерфейсов: форма и диалог, либо их смешении.

Почему к нейросетям так прилипчива формулировка ИИ (искусственный интеллект)? Потому что НС в первую очередь адаптируют на взаимодействие с пользователем до такой степени, что НС вроде как понимает человеческую речь. Чаще всего, конечно, в текстовом выражении. На самом деле, первая задача, ради которой начали строить нейросети, была распознавание речи и её анализ для понимания. Задача преобразования одного документа в другой с передачей или выделением нужной информации в программировании встречается повсеместно. Большие языковые модели нейросетей позволяют выделить смысловую информацию из текста, составленного в свободной форме. Хотя по сути, это тот же парсер с глубоким уровнем сложности и большой базой взаимосвязей и весовых коэффициентов. Но для пользователя создаётся иллюзия, что НС действует как собеседник: понимает вопросы и формирует ответы.

Возникающую иллюзию собеседника разработчики стали использовать в качестве интерфейса. Зачем пользователю напрягаться, видя сложный интерфейс? Пусть задаёт вопросы, будто общается. НС отвечает и запрашивает уточнения. Всё очень просто и даже справки не требуется.

По такому принципу построены НС Producer, Tunee. Но раз вы читаете данное руководство, то очевидно, документация всё же требуется, а интерфейс не справляется с возникающими сложностями.

Проблема состоит в том, что человек зачастую не знает, что спросить. А иногда знает, но не понимает в какой форме. Ещё в подобных диалоговых интерфейсах дико раздражает льстивая манера общения НС. Её задают разработчики, видимо, в целях сокрытия проблем. А также постоянные оправдания НС, когда делает что-то противоречивое с запросом. Лучше бы уж молчала.

Интерфейс в виде формы сразу позволяет увидеть те самые рукоятки (поля ввода, селекторы и кнопки), за которые можно схватиться. Их названия подсказывают имеющиеся возможности и указывают возможные варианты. Поведение становиятся более ясным, предсказуемым и своевременным, даже если отправленная форма всё равно впоследствии слепляется в единый запрос в адрес НС.

По принципу формы построен интерфейс Suno. В нём некоторые поля требуют обязательного заполнения (всего одно), а прочие ручки/кнопки/поля можно крутить/заполнять по желанию. Не понравилась генерация, осознал, что хотел бы изменить — меняешь только требуемый параметр, а не пытаешься осознать, что в диалоге требуется уточнить НС так, чтобы она поняла.

1.3.4.Промпт

Традиционно запрос к НС называется промпт (prompt). В общем смысле под промптом понимается уточняющий запрос от системы к пользователю. В интернете промпты, как метод взаимодействия, возникли на стадии зарождения сети ещё в прошлом веке. В отношении же НС под промптом понимается запрос от пользователя, который позволит нейросети лучше понять поставленную задачу.

И тут мы можем увидеть очень интересную вещь.

Суть НС — понимать человеческую речь, а суть промпта — структурированный запрос. Явления на разных концах одной линейки. Но такова реальность. Хотите чтобы НС лучше вас понимала: изъясняйтесь чётче, механичней, эффективней — как робот.

Из-за этого меня всё время преследует мысль, что интерпретатор запроса можно отделить от собственно генератора музыки, а между ними обнаружить сложную структурную модель запроса, который уже напрямую говорит, как сформировать запись. Возможно, вручную я бы не смог набить модель из тысяч параметров. Но если бы у меня имелся доступ к ней, то получив на одной генерации годную композицию, я бы мог напрямую в ней подкрутить нужные мне элементы, доведя до идеала.

Но нет. Каждый новый запрос к НС проходит новый разбор и новое построение, получить из одного и того же запроса одинаковые результаты практически невозможно. Точнее, это зависит исключительно от разработчиков НС, насколько они выкрутили настройку случайной вариативности. К счастью, разработчики слушают пользователей и в какой-то мере стараются подстроиться. К примеру, невозможность получить идентичную композицию или скорректировать в небольшом объёме, часто ставилось в пику Suno v5 и ниже. Но в марте 2026 была выпущена Suno v5.5, которая при идентичных запросах позволяет получить очень близкие друг другу композиции. Даже у разных пользователей. Но в ответ, по общему мнению, композиции оказываются существенно беднее в звучании. А всё потому, что запрос пользователя очень слабо описывает композицию. НС по ряду признаков (структура текста, ритмика текста, хвосты стилей) в значительной степени дополняет промпт, а также наваливает типичный набор популярных решений. В принципе, по-другому быть и не может, ведь иначе составление промпта превратится в написание полноценной партитуры для всех инструментов, включая вокализацию исполнителей.

Так как же должен выглядеть промпт?

В общих чертах, это может быть прямая человеческая речь. Буквально, вы можете взять абзац текста из какой-нибудь книги, который навевает на вас некоторое впечатление и отправить в нейросеть. Точнее сформировать запрос в следующем виде: «Сделай песню, передающую впечатление, создаваемое следующим отрывком текста: <отрывок из книги>». Очень может быть, что НС его прочитает и сумеет превратить это впечатление в звуковой ряд.

Но если вы стремитесь к конкретному результату, то промпт лучше всего писать максимально структурированным. Вся вторая глава руководства посвящена правильной формулировке промпта и оттачиванию деталей.

НС могут иметь различные интерфейсы, но в целом написание промпта сводится к формированию двух частей: лирики и стилистики. Под лирикой понимается текст и структура композиции. К примеру, инструментальный трек без вокала с нужной структурой также требует заполнения раздела лирики:


[start]

[instrumental prelude]


[long instrumental intro: Staggered theme entries other instruments]


[instrumental buildup]

[instrumental chorus]

[drop]


[outro]

[instrumental interlude]

[end]


Под стилистикой понимается описание характеристик композиции, такие как: жанр, музыкальные инструменты, тип вокала и прочее.

В Suno эти части выделены в отдельные поля, в Tunee промпт формируется единым в диалоговом режиме. Но и в Suno можно переместить описание стилей в область лирики. А всё потому, что форма в итоге сводится к формированию единого промпта. В целом, хотя различные НС могли бы реализовывать разные виды структур обращения к ним, по большей части сложился стандарт в формировании промпта. Глава 2 данного руководства ориентируется в первую очередь на Suno, но с успехом может применяться и в прочих НС с некоторыми уточнениями.

1.3.5.Теги

В предыдущем разделе 1.3.4.«Промпт» демонстрируется структура промпта для построения инструментальной композиции. Почему там слова в квадратных скобках?

Как уже говорилось, промпт может быть просто текстом, в котором вы описываете свои пожелания к нейросети, но чем чётче вы формулируете, тем проще нейросети вас понять. Для повышения эффективности в промпт можно включать целый ряд специальных символов (скобки, знаки пунктуации и прочие). Большинство НС их обрабатывает одинаково. Что в целом связано с единым подходом к разметке промптов.

В прямом запросе простой текст означает текст песни. Текст в круглых скобках означает дополнительный вокал, чаще всего бэк-вокал. Текст в квадратных — инструкции, уточняющие промпт в конкретном разделе текста. В приведённом выше промпте фактически приведены инструкции по структуре композиции. Слова в инструкциях промпта чаще всего называются: теги или метатеги, в зависимости от источника. Для краткости мы будем использовать в руководстве термин «тег». Впрочем, оба варианта не являются правильными. Правильно было бы говорить «ключевое слово».

Тег или тэг от англ. tag «ярлык, этикетка, бирка, метить» — используется в языках программирования и разметки как указание характеристики объекта. Впоследствии распространился как метка в реестрах, каталогах, лентах соцсетей, упрощающая поиск. Метатег — это тег для метаданных. А метаданные — это технические, структурные данные, скрытые от пользователя, но полезные для системы.

Исходя из определения, метка должна однозначно указывать тип объекта. Но это не работает в случае НС. Нейросети, как настоящий интеллект, умеют игнорировать инструкции, если они мешают достижению цели или противоречат уже сложившейся модели. К примеру, НС может проигнорировать тег, указывающий на шёпот, если выбран жанр рок-оперы. Возникший набор характеристик вокала для оперы легко может не предусматривать переход на шёпот. Поэтому правильнее было бы использовать термины «ключевое слово» и «ключевое словосочетание», но так слишком долго.

В отношении НС, теги — это ключевые слова или фразы, указывающие как точнее реализовать заданный промпт. Значит ли это, что необходимо пользоваться только указанными ключевыми словами, но не другими? Нет. Смысл НС в том, что она может правильно интерпретировать самую вольную формулировку. А может и неправильно. Меньше сюрпризов будет, если использовать устоявшиеся термины. К примеру, лучше использовать [lush string arrangements], а не [rich string arrangements], что значит [насыщенная аранжировка струнных], хотя в общем случае НС должна их интерпретировать одинаково.

В главе 2 даются разъяснения о том, какие бывают теги и для чего применимы. В конце данного руководства вы найдёте целый справочник по тегам. А в главе 3 перечень шаблонов, который позволит быстрее и качественнее создавать промпты. Хотя бы в качестве основы или подсказок по формулировкам.

Написание тегов может быть строчными или заглавными буквами, теги могут включать двоеточие и уточнение, например [BPM: 70] и могут разделяться запятыми. Могут быть одиночными, либо составлять целые фразы.

В тексте песни теги заключаются в квадратные скобки, чтобы НС их поняла как инструкции, а не пропела, как текст. Теги в тексте касаются фрагментов композиции — это звуковые вставки, либо указания. Если произведение инструментальное, то они могут давать указания для каждой части композиции. Теги надо писать отдельной строкой. Тег внутри строки даже в скобках может быть воспринят как текст и озвучен.

Те же инструкции в поле «Styles» нужно использовать без квадратных скобок. Ключевые слова в этом случае относятся ко всей композиции в целом. Теги в поле «Styles» в квадратных скобках создают структуру для стилей, см. п.2.1.1.«Структурирование стилей».

Наибольший вес имеют теги, стоящие в начале. Каждый последующий тег будет применяться только сквозь призму непротиворечивости и бесконфликтности с уже сформированным описанием. Замечено также, что для НС первостепенное значение имеет содержание песни, ритмическая структура текста, текущий шаблон песни и музыкальный стиль, а потом уже прочие теги.

Общие рекомендации:

— размещение тегов в начале запроса усиливает их влияние на итог;

— важно не переусердствовать с количеством, лучше ограничиться 3—7 тегами, чтобы сохранить ясность замысла;

— сочетание противоречивых тегов может подарить неожиданную гармонию, хотя иногда результат удивляет своей непредсказуемостью;

— более конкретные теги, такие как [guitar], обычно доминируют над общими, вроде [happy], что стоит учитывать.

1.3.6.Язык промпта

На каком языке писать промпт?

Полностью и целиком зависит от НС. К счастью, разработчики почти всегда ориентируют продукт глобально и закладывают на начальной стадии обработки промпта его перевод. Чем? Конечно же, нейросетями.

И здесь становится очевидным, что промпт лучше всего писать на том языке, на котором «думает» НС. Таким образом, будет меньше ошибок перевода, особенно в плане оборотов речи. Большинство глобальных сетей корнями уходят в англо-американские университеты, многие иностранные стартапы также предпочитают базироваться на английском языке. Но, к примеру, русские доморощенные НС легко могут базироваться и на русских языковых моделях.

Уточним ещё момент по структуре промпта. Фактически, он состоит из трёх элементов: текст песни, описание стилей и структурной инструкции. Каждый элемент можно писать на своём языке.

Непосредственно инструкции, то есть описание стилей и теги в тексте, лучше писать на родном языке НС. В отношении Suno и большинства прочих — это английский.

Текст песни по логике надо писать на языке вокала. На самом деле не всегда. Во-первых, НС должна понять на каком языке вы пишете текст. Если с различием русский или английский вроде всё просто (латиница или кириллица), то посмотрите с точки зрения НС на текст на латинице и попытайтесь понять: а точно ли это английский? А может испанский или латынь? А ведь испанский по фонетике гораздо ближе к русскому, чем к английскому. Мало того, кто сказал, что нам не захочется выпустить песню сразу на нескольких языках?

К счастью, именно анализ текста, который стал возможен только в эпоху нейросетей, является краеугольным камнем успешной модели. НС по тексту пытается понять язык и тем самым подобрать правильную вокализацию (методику произнесения звуков). Плюс тегами можно указать язык произнесения в нужном блоке текста. А дальше: либо умеет, либо нет. К примеру, НС Minimax на осень 2025 выдавала хороший звук по музыкальным инструментам и генерировала песни хорошего уровня, но только на английском. На русском языке вокал болел жёстким латышским акцентом. Но даже в этом случае можно попытаться исправить ситуацию инструкциями в отношении вокала (см. п.5.1.3.«Разница в вокализации языков»).

Похожие книги