Как задать промт, чтобы получился речитатив

Речитатив — это ритмично произнесённый текст, который занимает место между обычной речью и пением. Такая подача нужна в музыке, подкастах, рекламных роликах и аудиокнигах. Однако нейросеть по умолчанию выдаёт либо пение, либо сухое озвучивание. Разбираемся, как сформулировать промт, чтобы результат звучал именно как речитатив.

Что нейросеть понимает под речитативом

Спорный момент: русское слово «речитатив» часто находится вне типичного словаря генеративных моделей. Нейросети обучались преимущественно на англоязычных данных, поэтому одно и то же понятие им знакомо под несколькими терминами:

Recitative

Классический термин из оперы: речь на музыкальной основе, почти без мелодии. Хорошо понимается моделями, обученными на академической музыке.

Spoken word

Разговорная декламация без пения. Подходит для текстов, поэзии и озвучивания. Даёт размеренную, разговорную подачу.

Rap / chant

Ритмичная читка. Если нужен речитатив с ярко выраженным битом и качающим ритмом — именно эти ключевые слова задают нужную интонацию.

Как собрать промт: формула из четырёх блоков

Точный результат даёт структурированный промт. Опыт промт-инженеров показывает, что оптимально работает связка из четырёх элементов:

1

Манера подачи

spoken word delivery, recitative style, rhythmic speech, chant-like vocals

2

Ритм и темп

steady rhythm, slow tempo, driving beat, monotone pulse — от этого зависит, насколько текст «ляжет» на музыку

3

Характер голоса

deep male voice, calm female voice, dry vocal, expressive intonation

4

Ограничения: что исключить

no singing, no melody in vocals, minimal instrumentation — так модель не «съезжает» в песню

Сравнение: слабый и сильный промт

Подход Пример промта Ожидаемый результат
Слабый «Сделай речитатив» Модель интерпретирует как угодно: пение, монотонная речь без ритма или обычная озвучка
Средний «spoken word, rhythmic» Декламация есть, но темп и характер голоса — случайные
Сильный «spoken word delivery, steady rhythm, deep calm male voice, no singing, minimal instrumentation» Чёткий ритмичный речитатив заданного типа без отклонений

Один и тот же текст по-разному звучит в зависимости от задачи. Ниже — типовые комбинации ключевых слов:

Эпичный трейлер dramatic spoken word, cinematic, slow buildup, powerful voice

Ритмичная читка rap-style spoken parts, syncopated rhythm, percussive vocals

Поэтическая декламация spoken word poetry, intimate, soft piano background

Монотонная читка chant, monotone vocals, ritualistic, minimal melody

Пять ошибок, которые ломают речитатив

Ошибка 1. Указать только жанр («rap»), когда нужна нейтральная речь. Модель добавит флоу, рифмы и агрессивную подачу — и это будет уже не речитатив.

Ошибка 2. Забыть запретить пение. Без «no singing» музыкальные модели почти всегда распевают текст.

Ошибка 3. Слишком длинный текст без разбивки на строки. В музыкальных генераторах каждая строка текста воспринимается как отдельная фраза — разбивка задаёт ритм.

Ошибка 4. Смешивать противоречащие указания в одном промте: «fast tempo» и «slow spoken word» одновременно. Модель выберет одно наугад.

Ошибка 5. Писать промт только на русском, если инструмент оптимизирован под английский. Структурные теги и описания стиля надёжнее давать на английском, а сам текст — на нужном языке.

Готовый шаблон промта

Каркас для музыкальной генерации

[spoken word delivery] + [steady rhythm, slow tempo] + [deep calm voice, no singing] + [minimal instrumentation]

Каждый блок в квадратных скобках заменяется под конкретную задачу. Достаточно изменить характер голоса или темп — и весь результат перестроится, сохранив формат речитатива.

Короткий итог

Речитатив получается, когда промт указывает четыре вещи: манеру подачи (spoken word, recitative, chant), ритм, характер голоса и запрет на пение. Чем конкретнее каждый блок, тем стабильнее результат — нейросеть перестаёт гадать и выдаёт именно ту ритмичную речь, которая требуется.