Один и тот же русский текст на разных нейросетях может звучать божественно или как робот с ударением в случайном месте — и дело далеко не всегда в вашей лирике
Вот эксперимент, который стоит держать перед глазами, прежде чем садиться переписывать текст песни. Автор из Selectel прогнал одно и то же русскоязычное задание — джаз, женский вокал — через три генератора и получил разброс оценок от 9 до 3,5 из 10: Riffusion — 9, Suno — 7, Udio Beta — 3,5, причём у Udio отмечены «роботизированный» вокал, «неправильные ударения» и слова, звучащие обрезанными (обзор Suno v5 на Habr). Это данные одного человека и единичные генерации; контролируемого замера здесь нет — но разрыв в 2,5 раза на идентичной задаче обесценивает типовой совет: «дело в тексте, а не в сервисе». Если бы дело было только в тексте, три модели на одном и том же прогоне не разъехались бы так далеко.
И всё же в другом практические гайды правы. Практический разбор Suno в блоге платёжного сервиса фиксирует три устойчивых дефекта: сервис «съедает окончания. Ставит ударения странно. Растягивает короткие слова», а при слишком шумном стиле аранжировки текст превращается в кашу (гайд Oplatym.ru на DTF). Эксперименту Selectel это не противоречит: речь про другой слой ошибки. Модель определяет базовый потолок разборчивости, а формулировка строки определяет, сколько из этого потолка вы реально получите. У того же теста Selectel есть и вторая линия дефектов — на уровне самой сгенерированной лирики: при явно заданном женском вокале Suno выдал строку «С каждым вдохом я другая, я живой» с рассогласованием рода и рифму-пустышку «беречь свою млеч» (примеры генерации из того же обзора). Лечится это прямым контролем над текстом в Custom-режиме — там, где строку пишете вы сами.
Почему именно русский ломается предсказуемо? Свежий препринт по синтезу пения показывает, насколько дорого обходится неродной язык, — правда, на других моделях: в кросс-языковом сценарии базовая модель Vevosing даёт WER 0,717 против 0,110 у специализированной SoulX-Singer, то есть разрыв между архитектурами на чужом языке огромен; при этом сам обучающий корпус перекошен в сторону мандаринского и английского (по 20 тысяч часов на каждый) против примерно 2 тысяч часов на кантонский (arXiv 2602.07803). Это не про Suno и не про русский напрямую — но логика переносится: чем меньше языка в обучающей выборке, тем чаще модель «угадывает» произношение вместо того, чтобы его знать. Отсюда практический вывод: правка текста не устраняет причину, она снижает количество ситуаций, где модели приходится угадывать.
Платите в рублях за AI-модели без наценки на токены через provod.ai
Что реально работает в тексте
Ниже — рабочий чек-лист, собранный из наблюдений практиков: это повторяющиеся закономерности из гайдов и разборов, измеренного протокола за ними нет.
- строка не длиннее 6–8 слогов — длинные фразы чаще проглатываются к концу;
- простые рифмы вместо составных — сложная рифма «уводит» ударение в погоне за созвучием;
- никакой инверсии («я жду тебя» вместо «тебя я жду») — модель хуже держит ударение на нестандартном порядке слов;
- проверка согласования рода под выбранный голос — иначе получите то же «я живой» вместо «я живая»;
- фонетическая перезапись проблемных слов и разбивка по слогам через дефис для слов, которые модель системно коверкает;
- отказ от шумных, плотных стилей там, где важна разборчивость текста — чем плотнее аранжировка, тем меньше «пространства» для вокала.
Таблица дефект → приём, если нужен быстрый разбор конкретной проблемы:
| Дефект | Приём |
|---|---|
| Съеденное окончание | Вынести слово в конец короткой строки, не в середину длинной |
| Ударение «плывёт» | Фонетическая перезапись или замена слова на синоним с однозначным ударением |
| Каша на шипящих | Убрать стечения согласных, упростить лексику строки |
| Неразборчивый припев | Снизить плотность аранжировки в style-промпте |
| Чужой род в вокале | Явный метатег [Female Vocal] / [Male Vocal] плюс переписанные строки, а не автогенерация |
Инструменты для доводки уже подросли: 11 июня 2026 в Suno расширили разделение на стемы — можно выбрать конкретный инструмент из почти сотни для чистки трека, а 9 июля переработали редактор лирики с метками структуры (Verse, Outro) и правкой строк на естественном языке (release notes Suno). Это снимает часть ручной работы, но не делает бесполезной подготовку текста до генерации — редактор чинит уже готовую строку, а не предсказывает, где модель ошибётся заранее.
Файл готов — а что с ним делать

Здесь начинается вторая проблема, о которой в гайдах про лирику пишут редко: слушабельный трек — не финал. На бесплатном плане Suno владельцем сгенерированных песен формально остаётся сам сервис, а пользователю разрешено только некоммерческое использование; коммерческая лицензия и владение появляются лишь на Pro ($8/мес, 2500 кредитов) и Premier ($24/мес, 10 000 кредитов) (условия Suno Free/Pro/Premier, тарифы Suno). Важная оговорка: это договорная позиция вендора, сформулированная в терминах права США, — на вопрос об охраноспособности трека в российской юрисдикции она не отвечает. Отдельно стоит положение о том, что права не работают задним числом: если удачный трек родился на бесплатном тарифе, после оплаты его придётся перегенерировать заново, а не просто «выкупить» уже созданный файл. Взято оно из пересказа в гайде, который ведёт платёжный сервис (раздел о правах в гайде DTF), а не из текста условий Suno: в самой справке сервиса оговорены только владение и коммерческая лицензия на Pro/Premier. Тот же заинтересованный источник пишет: «российские карты часто не проходят» — то есть перед тем как продумывать структуру песни, стоит решить вопрос оплаты. Здесь важно не смешивать две разные оплаты. Подписка Suno с её условиями владения и коммерческой лицензии покупается только у самого Suno — это вендорские права, и никакой сторонний доступ их не выдаёт. А вот доступ к моделям для самих генераций — отдельная история: provod.ai поддерживает рублёвую оплату российской картой, через СБП или по счёту, без иностранной карты и VPN, в пределах поддерживаемого каталога моделей музыки и аудио.
С Udio ситуация жёстче: после партнёрства с Universal Music Group скачивание аудио, видео и стемов полностью отключено — трек можно слушать внутри сервиса, но не забрать файлом, хотя лимиты кредитов подписчикам подняли (справка Udio о партнёрстве с UMG). Для подарка или личного контента, где файл нужен на руках, это делает Udio неудобным выбором вне зависимости от качества вокала в конкретном тесте.
Стоит ли вообще целиться в стриминги

Если вы метите в плейлисты, стоит остыть заранее. Deezer получает около 90 тысяч полностью ИИ-треков в сутки — больше половины всех загрузок на пике июня 2026 — но на ИИ-музыку приходится лишь 1–3% реального прослушивания, а до 85% этого прослушивания площадка относит на фрод; такие треки помечаются и исключаются из алгоритмических рекомендаций и редакторских плейлистов (пресс-релиз Deezer). CEO Deezer Alexis Lanternier формулирует это прямо: «Deezer has been at the frontline of fighting fraud and reducing payment dilution related to AI music for almost two years». Spotify держит похожий курс мягче — не запрещает генерацию, но, по данным релиза от сентября 2025, за 12 месяцев удалила свыше 75 миллионов спам-треков и вводит раскрытие роли ИИ по стандарту DDEX (Spotify Newsroom). Яндекс Музыка пока только запрашивает у лейблов данные об использовании ИИ; когда появится сама маркировка, в письме сервиса правообладателям не сказано (The Flow).
Есть и обратный пример, но это именно исключение. Создатель проекта СДП Кирилл Збродов сознательно берёт стихи, уже перешедшие в общественное достояние, и его трек «Сыпь, гармоника!» на слова Есенина первым в России одновременно возглавил чарты Яндекс Музыки и VK, собрав, по словам самого Збродова, больше 10 миллионов прослушиваний за декабрь 2025 — в 14 раз выше собственного плана («Инженерная лирика», Коммерсантъ). Здесь ключевая деталь юридическая: исключительное право действует 70 лет после смерти автора, Есенин умер в 1925 году, значит его стихи можно класть на музыку без выплат наследникам (ст. 1281 ГК РФ). Отдельно от срока действуют право авторства и неприкосновенность произведения — это другие нормы ГК, за пределами процитированной статьи: имя автора всё равно нужно указывать, а сам текст не искажать. Для Бродского, Пастернака или Ахматовой права всё ещё нужно выкупать — Збродов сам говорит об этом как о следующем шаге: «это позволит мне покупать права на использование произведений Бродского, Пастернака, Ахматовой».
Практический маршрут на один вечер
Для подарка или контента, где цель личная, а не дистрибуционная, разумный порядок такой: пишете текст сами в Custom-режиме, следуя чек-листу выше; размечаете структуру метатегами (Verse, Chorus, Outro); делаете 3–5 генераций одной строфы, чтобы отобрать вокал до того, как тратить кредиты на весь трек; правите проблемные строки фонетической перезаписью; чистите итог через стемы; и только на последнем шаге решаете, публиковать ли песню — с пониманием, что даже идеально «дослушабельный» результат почти нигде не попадёт в рекомендации. Именно так рождаются песни нейросети на русском, которые действительно можно подарить или выложить, а не только показать самому себе в приложении.
Разброс 9 против 3,5 в тесте Selectel оправдывает привычку пробовать несколько генераторов, прежде чем понять, какой лучше слышит вашу лирику, — с оговоркой, что перебирать имеет смысл среди сервисов, откуда трек потом можно забрать файлом. Побочный эффект такой привычки — отдельный аккаунт, отдельный баланс и отдельный способ оплаты под каждый эксперимент. В provod.ai доступ к поддерживаемым моделям музыки и аудио идёт из одного личного кабинета — через единый API и веб-интерфейс, в пределах того каталога, который платформа поддерживает сейчас; речь именно о моделях из этого каталога, а не о вендорских аккаунтах перечисленных выше сервисов.
provod.ai — перенос AI-интеграции без переделки продукта
Если приложение использует OpenAI-совместимый API, во многих случаях меняются только base_url и API-ключ: бизнес-логика, сценарии и привычные инструменты команды остаются на месте.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
После миграции стоимость модели не становится выше из-за роутера: provod.ai сохраняет официальный тариф провайдера 1:1 и не добавляет собственную наценку.
Проверьте совместимость своей интеграции: миграция с OpenAI SDK · форма регистрации · цены на модели · защита данных по 152-ФЗ
Источники
- Suno Release Notes — обновления редактора лирики и стемов
- Suno Pricing — тарифы Free/Pro/Premier
- Suno Help Center — кому принадлежат созданные песни
- Udio Help Center — последствия партнёрства с UMG
- Deezer Newsroom — доля ИИ-музыки в загрузках
- Spotify Newsroom — усиление защиты от ИИ-спама
- Habr/Selectel — сравнительный тест Suno, Udio и Riffusion на русском
- DTF — гайд по Suno AI в России
- Коммерсантъ — «Инженерная лирика» о проекте СДП
- The Flow — Яндекс Музыка о планах маркировки ИИ-треков
- ГК РФ, статья 1281 — срок исключительного права на произведение
- arXiv — SoulX-Singer о кросс-языковом синтезе пения
