← Все статьи
Новости10 мин чтения

Озвучка текста ИИ на русском: три барьера вместо одного вопроса о качестве

Тот, кто вбивает в поиск «озвучка текста ИИ» для подкаста или ролика, обычно ждёт ответа про естественность голоса. По состоянию на 26 июля 2026 года раньше голоса кончается доступ к сервису — и это переписывает весь список кандидатов.

Обложка статьи: Озвучка текста ИИ на русском: три барьера вместо одного вопроса о качестве

Тот, кто вбивает в поиск «озвучка текста ИИ» для подкаста или ролика, обычно ждёт ответа про естественность голоса. По состоянию на 26 июля 2026 года раньше голоса кончается доступ к сервису — и это переписывает весь список кандидатов.

Свежая проверка публичной документации даёт неприятную картину. Сбер с 15 июля 2026 года закрыл для новых юрлиц продажу пакетов SaluteSpeech и оплату по факту использования — той самой схемы, где синтез стоит 0,000186 ₽ за символ, то есть около 17 копеек за минуту речи. Для физлиц закрыт ещё и бесплатный лимит — 200 000 символов в месяц и продление Freemium прекращены с той же даты. Самый дешёвый российский тариф в статье остался доступен только тем, кто успел подключиться раньше.

С другой стороны — ElevenLabs, которого принято ставить эталоном естественности. Вендор официально ограничивает доступ к сервису из России и Беларуси в числе восьми стран и территорий. Дешёвый прайс и реально доступный сервис — просто разные множества, и сравнивать их по одной шкале — методическая ошибка, с которой начинается большинство статей про TTS.

Платите в рублях за AI-модели без наценки на токены через provod.ai

Что остаётся в игре

Из зарубежных облаков относительно прозрачно ведёт себя Cartesia: бесплатный план даёт около 27 минут синтеза в месяц, а право на коммерческое использование и клонирование голоса появляется только с плана Pro за $5 — это ≈133 минуты, то есть порядка 3 ₽ за минуту по текущему курсу. Русский язык формально входит в список из 42 поддерживаемых языков Sonic 3.5, но документация не измеряет качество на русском — это придётся проверять самому.

Из российских — Yandex SpeechKit. По независимому разбору интегратора Raft, тариф API v3 даёт около 0,55 ₽ за минуту, а задержка синтеза 10–15-секундного фрагмента — 1,81 секунды против 3,49 у открытой модели CosyVoice на той же GPU. Официальную страницу тарификации Яндекса на момент проверки закрывает антибот-капча, поэтому цифры стоит перепроверить в личном кабинете перед тем, как закладывать их в бюджет.

Если тестировать сразу несколько таких моделей, а не подписываться вслепую на одну, дешевле не заводить отдельный ключ и клиент под каждый сервис: агрегаторы вроде provod.ai дают доступ к аудио-моделям через один OpenAI-совместимый API — замена base URL вместо переписывания интеграции — и позволяют сравнить кандидатов до того, как платить за годовую подписку.

Бесплатно — не значит можно продавать

Открытые модели решают проблему доступности, но здесь начинается вторая стена — лицензионная, и она обычно недооценена. В сравнении семи открытых TTS-моделей на русском лучшую связку скорости и естественности дают Silero (естественность 4/5, 0,071 с на GPU) и русский файнтюн F5-TTS (4,5/5, 2,32 с на GPU) — а такие модели, как HiggsAudio, на том же железе тратят на один фрагмент 50,36 секунды на GPU и 123,34 секунды на CPU, что уже за гранью практичного использования. Но у Silero скорость не значит «свободно»: модели опубликованы под CC-NC-BY, то есть некоммерческая лицензия; под MIT идут только базовые cis-tts модели, а не голоса из линейки v5_5_ru с автоматической расстановкой ударений. XTTS-v2, который часто советуют как бесплатный клон голоса, выпущен под собственную Coqui Public Model License — и спросить о её толковании больше не у кого, компания Coqui закрылась.

Из проверенных вариантов под по-настоящему открытой лицензией нашёлся один: ESpeech-TTS-1_RL-V2 распространяется по Apache-2.0, обучен на 240 часах вебинаров с восемью дикторами. Это редкий случай, когда «бесплатно» и «можно продавать результат» совпадают — но карточка модели не приводит метрик качества, так что перед использованием в монетизируемом ролике модель придётся прогнать через собственный текст.

Клонирование чужого тембра — отдельная категория риска. Microsoft показывает, как выглядит легальная процедура: обязательна загрузка записанного голосового согласия человека, а доступ к API personal voice выдаётся только по одобренной заявке. Для бизнес-использования provod.ai закрывает соседний, но не тот же вопрос — рублёвая оплата и закрывающие документы от российского юрлица снимают часть административной головной боли, но не заменяют согласие владельца голоса.

Спор, который сцена ведёт не первый год

02 evidence

Разлом в индустрии проходит по одному вопросу: заменяет ли синтез диктора вообще. Инженер Raft Данил Музафаров занимает срединную позицию: открытые модели — «рабочий бизнес-инструмент, но не универсальная замена диктора для всех сценариев», годятся для коротких и средних фраз, ломаются на длинных текстах. Цеховые реплики ниже — из материала Sostav.ru от 8 июля 2023 года; насколько эти позиции держатся сегодня, публично не подтверждено. Актёр дубляжа Иван Жарков был резче: «Нейросети никогда не смогут достоверно сыграть так, как это может сделать профессиональный актер». Директор по контентному развитию «Литрес» Евгений Селиванов смотрел на это со стороны производства: для него синтез снимает ограничение по объёмам и позволяет выпустить книги, которые иначе не были бы озвучены вообще. Актриса Татьяна Шитова заняла третью позицию: синтез уже приемлем в нейтральном документальном закадре, но не в ролях, требующих актёрской игры. Председатель Союза дикторов России Александр Лапшин добавил юридический слой к спору — он описал случай, когда голос артиста синтезировали и использовали без согласия, а претензию оказалось не на что опереть.

Возражение, которое звучит убедительно и наполовину неправильно

Разница в цене минуты — от 17 копеек у закрытого теперь SaluteSpeech до 3 рублей у Cartesia — выглядит решающей. Но независимый тест OmniVoice на русском даёт средний балл 4,53 из 5 и проваливается именно там, где болит у авторов: омографы 4,1/5 и даты/время 4,1/5, с обрывами концов предложений и артефактами на стыках чанков в длинной генерации. Пятиминутный ролик всё равно требует прослушивания и ручных правок ударений — а час редактуры перекрывает разницу в тарифе за несколько дней использования любого сервиса.

Второй слой того же возражения — юридический, и он серьёзнее ценового. Общей охраны голоса в ГК РФ сейчас нет: законопроект № 718834-8 о новой статье 152.3 внесён 16 сентября 2024 года и почти два года стоит на первом чтении без назначенной даты. Единственная действующая норма — узкая: 130-ФЗ от 2 мая 2026 года запрещает синтезированный голос и изображение в агитационных материалах без письменного согласия, и на обычную коммерческую озвучку прямо не распространяется. Значит право на голос сейчас держится на договоре и лицензии платформы, а не на статье закона — и «дешёвая» озвучка чужим тембром без документа о согласии остаётся юридической миной вне зависимости от тарифа.

Есть и третье ограничение, которое часто упускают: не всякая многоязычная модель одинаково хороша на русском просто потому, что заявляет поддержку языка. Практический тест показал, что англоцентричные модели ломаются буквально: Kokoro озвучивает случайные английские слова вместо русского текста, а VibeVoice говорит с акцентом почти в каждом слове. Совет «возьмите любую топовую модель, она мультиязычная» на практике не работает.

Тест-скрипт на 10 ловушек русского TTS

03 decision

Прежде чем платить за подписку или считать открытую модель готовой, прогоните через неё один абзац с этими конструкциями и слушайте конкретно то, что указано:

ЛовушкаПримерЧто слушать
Омографы по смыслуза́мок / замо́к, бо́льшая / больша́яПравильное ударение по контексту предложения
Фамилии в косвенных падежах«письмо от Мельникова», «встреча с Ковтуном»Не съедает ли модель окончание, не читает ли как несклоняемое
АббревиатурыОМС, СНИЛС, ЭКГПо буквам или как слово; совпадает ли с привычным произношением
Числа и суммы«142 350 рублей 90 копеек»Полное правильное число, а не обрывок или «сто сорок два тысячи»
Даты«15 июля 2026 года»Порядковые числительные вместо количественных
«В т. ч.» и другие сокращения«в т. ч. НДС», «т. е.»Разворачивается ли в полное слово
Латиница внутри фразы«через API получить SLA»Транслитерация вместо побуквенного чтения английских слов
Длинное перечислениесписок из 6–8 однородных пунктовНе теряется ли интонация к концу списка
Стык длинных фрагментовтекст на 4–5 минут аудиоАртефакты и провалы на границах генерируемых чанков
Эмоциональная нейтральность vs монотонностьабзац с прямой речьюНе читает ли реплики персонажей одинаковым тоном

Если модель проваливает три и больше пункта из десяти, экономия на тарифе уже съедена временем редактуры.

Что выбрать сегодня

Кто по-прежнему набирает в поиске «озвучка текста ИИ» и хочет короткий ответ, а не сравнительную таблицу — вот он. Для короткого нейтрального ролика без клонирования голоса разумный путь — ESpeech-TTS под Apache-2.0 или платный план с явной коммерческой лицензией вроде Cartesia Pro, при условии, что оплата и API реально доступны из России (это стоит проверить отдельно — платёжная доступность в фактуре не подтверждена). Для длинного контента с игрой и эмоциями синтез пока не замена диктору, что подтверждают и вендорские, и независимые тесты. А для клонирования чужого голоса единственный защищённый вариант — письменное согласие владельца по образцу Azure personal voice, потому что закон эту дыру за вас не закроет ещё как минимум до осенней сессии Думы.

provod.ai — корпоративная работа с AI с учётом требований РФ

Для сценариев с персональными данными важна не только модель, но и организация процесса: платформа проектируется с учётом требований российского законодательства, а применимость определяется составом данных и настройками клиента.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Требования к корпоративному процессу не увеличивают тариф модели: стоимость сохраняется 1:1 с официальной ценой провайдера, без собственной наценки provod.ai.

Изучите условия для корпоративного сценария: форма регистрации · цены на модели · защита данных по 152-ФЗ · политика обработки данных

Источники