# Озвучка текста ИИ на русском: три барьера вместо одного вопроса о качестве

Source: https://provod.ai/ru/blog/n200-t019

Тот, кто вбивает в поиск «озвучка текста ИИ» для подкаста или ролика, обычно ждёт ответа про естественность голоса. По состоянию на 26 июля 2026 года раньше голоса кончается доступ к сервису — и это переписывает весь список кандидатов.

Свежая проверка публичной документации даёт неприятную картину. Сбер с 15 июля 2026 года закрыл для новых юрлиц продажу пакетов SaluteSpeech и оплату по факту использования — той самой схемы, где синтез стоит [0,000186 ₽ за символ, то есть около 17 копеек за минуту речи](https://developers.sber.ru/docs/ru/salutespeech/tariffs/legal-tariffs). Для физлиц закрыт ещё и бесплатный лимит — [200 000 символов в месяц и продление Freemium прекращены с той же даты](https://developers.sber.ru/docs/ru/salutespeech/tariffs/individual-tariffs). Самый дешёвый российский тариф в статье остался доступен только тем, кто успел подключиться раньше.

С другой стороны — ElevenLabs, которого принято ставить эталоном естественности. Вендор [официально ограничивает доступ к сервису из России и Беларуси](https://help.elevenlabs.io/hc/en-us/articles/22497891312401-Do-you-restrict-access-to-the-service-and-platform-for-any-specific-countries) в числе восьми стран и территорий. Дешёвый прайс и реально доступный сервис — просто разные множества, и сравнивать их по одной шкале — методическая ошибка, с которой начинается большинство статей про TTS.

[Платите в рублях за AI-модели без наценки на токены через provod.ai](https://provod.ai/?ref=blog-cta-top&utm_source=provod-blog&utm_medium=article&utm_campaign=n200-t019)

## Что остаётся в игре

Из зарубежных облаков относительно прозрачно ведёт себя Cartesia: бесплатный план даёт около 27 минут синтеза в месяц, а право на коммерческое использование и клонирование голоса появляется только с плана Pro за $5 — это [≈133 минуты, то есть порядка 3 ₽ за минуту по текущему курсу](https://cartesia.ai/pricing). Русский язык формально входит в список из [42 поддерживаемых языков Sonic 3.5](https://docs.cartesia.ai/2024-11-13/build-with-cartesia/models/tts), но документация не измеряет качество на русском — это придётся проверять самому.

Из российских — Yandex SpeechKit. По независимому разбору интегратора Raft, [тариф API v3 даёт около 0,55 ₽ за минуту, а задержка синтеза 10–15-секундного фрагмента — 1,81 секунды против 3,49 у открытой модели CosyVoice на той же GPU](https://habr.com/ru/companies/raft/articles/1023206/). Официальную страницу тарификации Яндекса на момент проверки закрывает антибот-капча, поэтому цифры стоит перепроверить в личном кабинете перед тем, как закладывать их в бюджет.

Если тестировать сразу несколько таких моделей, а не подписываться вслепую на одну, дешевле не заводить отдельный ключ и клиент под каждый сервис: агрегаторы вроде provod.ai дают доступ к аудио-моделям через один OpenAI-совместимый API — замена base URL вместо переписывания интеграции — и позволяют сравнить кандидатов до того, как платить за годовую подписку.

## Бесплатно — не значит можно продавать

Открытые модели решают проблему доступности, но здесь начинается вторая стена — лицензионная, и она обычно недооценена. В сравнении семи открытых TTS-моделей на русском лучшую связку скорости и естественности дают [Silero (естественность 4/5, 0,071 с на GPU) и русский файнтюн F5-TTS (4,5/5, 2,32 с на GPU)](https://habr.com/ru/companies/raft/articles/991844/) — а такие модели, как HiggsAudio, на том же железе тратят на один фрагмент 50,36 секунды на GPU и 123,34 секунды на CPU, что уже за гранью практичного использования. Но у Silero скорость не значит «свободно»: модели [опубликованы под CC-NC-BY, то есть некоммерческая лицензия](https://github.com/snakers4/silero-models); под MIT идут только базовые cis-tts модели, а не голоса из линейки v5\_5\_ru с автоматической расстановкой ударений. XTTS-v2, который часто советуют как бесплатный клон голоса, выпущен под [собственную Coqui Public Model License](https://huggingface.co/coqui/XTTS-v2) — и спросить о её толковании больше не у кого, компания Coqui закрылась.

Из проверенных вариантов под по-настоящему открытой лицензией нашёлся один: [ESpeech-TTS-1\_RL-V2 распространяется по Apache-2.0](https://huggingface.co/ESpeech/ESpeech-TTS-1_RL-V2), обучен на 240 часах вебинаров с восемью дикторами. Это редкий случай, когда «бесплатно» и «можно продавать результат» совпадают — но карточка модели не приводит метрик качества, так что перед использованием в монетизируемом ролике модель придётся прогнать через собственный текст.

Клонирование чужого тембра — отдельная категория риска. Microsoft показывает, как выглядит легальная процедура: обязательна [загрузка записанного голосового согласия человека, а доступ к API personal voice выдаётся только по одобренной заявке](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/personal-voice-overview). Для бизнес-использования provod.ai закрывает соседний, но не тот же вопрос — рублёвая оплата и закрывающие документы от российского юрлица снимают часть административной головной боли, но не заменяют согласие владельца голоса.

## Спор, который сцена ведёт не первый год

![02 evidence](https://storage.yandexcloud.net/provod-yc-production-cms-media/provod-yc-production-cms-media/blog/02-557.png)

Разлом в индустрии проходит по одному вопросу: заменяет ли синтез диктора вообще. Инженер Raft Данил Музафаров занимает срединную позицию: открытые модели — «[рабочий бизнес-инструмент, но не универсальная замена диктора для всех сценариев](https://habr.com/ru/companies/raft/articles/1031560/)», годятся для коротких и средних фраз, ломаются на длинных текстах. Цеховые реплики ниже — из материала Sostav.ru от 8 июля 2023 года; насколько эти позиции держатся сегодня, публично не подтверждено. Актёр дубляжа Иван Жарков был резче: «[Нейросети никогда не смогут достоверно сыграть так, как это может сделать профессиональный актер](https://www.sostav.ru/publication/diktory-61956.html)». Директор по контентному развитию «Литрес» Евгений Селиванов смотрел на это со стороны производства: для него синтез снимает ограничение по объёмам и позволяет выпустить книги, которые иначе не были бы озвучены вообще. Актриса Татьяна Шитова заняла третью позицию: синтез уже приемлем в нейтральном документальном закадре, но не в ролях, требующих актёрской игры. Председатель Союза дикторов России Александр Лапшин добавил юридический слой к спору — он описал случай, когда голос артиста синтезировали и использовали без согласия, а претензию оказалось не на что опереть.

## Возражение, которое звучит убедительно и наполовину неправильно

Разница в цене минуты — от 17 копеек у закрытого теперь SaluteSpeech до 3 рублей у Cartesia — выглядит решающей. Но независимый тест OmniVoice на русском даёт средний балл 4,53 из 5 и проваливается именно там, где болит у авторов: [омографы 4,1/5 и даты/время 4,1/5, с обрывами концов предложений и артефактами на стыках чанков в длинной генерации](https://habr.com/ru/companies/raft/articles/1031560/). Пятиминутный ролик всё равно требует прослушивания и ручных правок ударений — а час редактуры перекрывает разницу в тарифе за несколько дней использования любого сервиса.

Второй слой того же возражения — юридический, и он серьёзнее ценового. Общей охраны голоса в ГК РФ сейчас нет: [законопроект № 718834-8 о новой статье 152.3 внесён 16 сентября 2024 года и почти два года стоит на первом чтении без назначенной даты](https://sozd.duma.gov.ru/bill/718834-8). Единственная действующая норма — узкая: [130-ФЗ от 2 мая 2026 года запрещает синтезированный голос и изображение в агитационных материалах без письменного согласия](https://www.consultant.ru/law/hotdocs/93854.html), и на обычную коммерческую озвучку прямо не распространяется. Значит право на голос сейчас держится на договоре и лицензии платформы, а не на статье закона — и «дешёвая» озвучка чужим тембром без документа о согласии остаётся юридической миной вне зависимости от тарифа.

Есть и третье ограничение, которое часто упускают: не всякая многоязычная модель одинаково хороша на русском просто потому, что заявляет поддержку языка. Практический тест показал, что англоцентричные модели [ломаются буквально: Kokoro озвучивает случайные английские слова вместо русского текста, а VibeVoice говорит с акцентом почти в каждом слове](https://habr.com/ru/companies/selectel/articles/1009274/). Совет «возьмите любую топовую модель, она мультиязычная» на практике не работает.

## Тест-скрипт на 10 ловушек русского TTS

![03 decision](https://storage.yandexcloud.net/provod-yc-production-cms-media/provod-yc-production-cms-media/blog/03-557.png)

Прежде чем платить за подписку или считать открытую модель готовой, прогоните через неё один абзац с этими конструкциями и слушайте конкретно то, что указано:

| Ловушка | Пример | Что слушать |
| --- | --- | --- |
| Омографы по смыслу | за́мок / замо́к, бо́льшая / больша́я | Правильное ударение по контексту предложения |
| Фамилии в косвенных падежах | «письмо от Мельникова», «встреча с Ковтуном» | Не съедает ли модель окончание, не читает ли как несклоняемое |
| Аббревиатуры | ОМС, СНИЛС, ЭКГ | По буквам или как слово; совпадает ли с привычным произношением |
| Числа и суммы | «142 350 рублей 90 копеек» | Полное правильное число, а не обрывок или «сто сорок два тысячи» |
| Даты | «15 июля 2026 года» | Порядковые числительные вместо количественных |
| «В т. ч.» и другие сокращения | «в т. ч. НДС», «т. е.» | Разворачивается ли в полное слово |
| Латиница внутри фразы | «через API получить SLA» | Транслитерация вместо побуквенного чтения английских слов |
| Длинное перечисление | список из 6–8 однородных пунктов | Не теряется ли интонация к концу списка |
| Стык длинных фрагментов | текст на 4–5 минут аудио | Артефакты и провалы на границах генерируемых чанков |
| Эмоциональная нейтральность vs монотонность | абзац с прямой речью | Не читает ли реплики персонажей одинаковым тоном |

Если модель проваливает три и больше пункта из десяти, экономия на тарифе уже съедена временем редактуры.

## Что выбрать сегодня

Кто по-прежнему набирает в поиске «озвучка текста ИИ» и хочет короткий ответ, а не сравнительную таблицу — вот он. Для короткого нейтрального ролика без клонирования голоса разумный путь — ESpeech-TTS под Apache-2.0 или платный план с явной коммерческой лицензией вроде Cartesia Pro, при условии, что оплата и API реально доступны из России (это стоит проверить отдельно — платёжная доступность в фактуре не подтверждена). Для длинного контента с игрой и эмоциями синтез пока не замена диктору, что подтверждают и вендорские, и независимые тесты. А для клонирования чужого голоса единственный защищённый вариант — письменное согласие владельца по образцу Azure personal voice, потому что закон эту дыру за вас не закроет ещё как минимум до осенней сессии Думы.

## provod.ai — корпоративная работа с AI с учётом требований РФ

**Для сценариев с персональными данными важна не только модель, но и организация процесса:** платформа проектируется с учётом требований российского законодательства, а применимость определяется составом данных и настройками клиента.

**В одном каталоге — актуальные модели для текста и медиа:** GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

**Требования к корпоративному процессу не увеличивают тариф модели:** стоимость сохраняется 1:1 с официальной ценой провайдера, без собственной наценки provod.ai.

**Изучите условия для корпоративного сценария:** [форма регистрации](https://app.provod.ai/register) · [цены на модели](https://app.provod.ai/models) · [защита данных по 152-ФЗ](https://provod.ai/legal/152-fz) · [политика обработки данных](https://provod.ai/legal/privacy)

### Источники

- [Тарифы SaluteSpeech для юрлиц — developers.sber.ru](https://developers.sber.ru/docs/ru/salutespeech/tariffs/legal-tariffs)
- [Тарифы SaluteSpeech для физлиц — developers.sber.ru](https://developers.sber.ru/docs/ru/salutespeech/tariffs/individual-tariffs)
- [Ограничения доступа ElevenLabs по странам — help.elevenlabs.io](https://help.elevenlabs.io/hc/en-us/articles/22497891312401-Do-you-restrict-access-to-the-service-and-platform-for-any-specific-countries)
- [Тарифы Cartesia — cartesia.ai/pricing](https://cartesia.ai/pricing)
- [Языковая поддержка модели Sonic 3.5 — docs.cartesia.ai](https://docs.cartesia.ai/2024-11-13/build-with-cartesia/models/tts)
- [Personal voice в Azure AI Speech — learn.microsoft.com](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/personal-voice-overview)
- [Сравнение TTS-моделей на бизнес-задачах, тарифы и задержки — блог Raft на Хабре](https://habr.com/ru/companies/raft/articles/1023206/)
- [Тест OmniVoice на русском языке — блог Raft на Хабре](https://habr.com/ru/companies/raft/articles/1031560/)
- [Обзор open-source TTS-моделей — блог Raft на Хабре](https://habr.com/ru/companies/raft/articles/991844/)
- [Лицензия и голоса Silero — GitHub snakers4/silero-models](https://github.com/snakers4/silero-models)
- [Карточка модели ESpeech-TTS-1\_RL-V2 — Hugging Face](https://huggingface.co/ESpeech/ESpeech-TTS-1_RL-V2)
- [Карточка модели XTTS-v2 — Hugging Face](https://huggingface.co/coqui/XTTS-v2)
- [Тест англоязычных моделей на русском тексте — блог Selectel на Хабре](https://habr.com/ru/companies/selectel/articles/1009274/)
- [Обзор 130-ФЗ о запрете ИИ-образов в агитации — КонсультантПлюс](https://www.consultant.ru/law/hotdocs/93854.html)
- [Карточка законопроекта № 718834-8 — СОЗД Госдумы РФ](https://sozd.duma.gov.ru/bill/718834-8)
- [Комментарии дикторов и юристов о синтезе голоса — Sostav.ru](https://www.sostav.ru/publication/diktory-61956.html)

## FAQ

### Что такое provod.ai?

provod.ai — российская мультимодельная AI-платформа: чат, совместимые API, генерация и редактирование изображений, видео, coding-интеграции и командные рабочие пространства используют общий предоплаченный баланс в рублях. Начните с [обзора](/ru.md), [документации](/ru/docs.md) или [каталога моделей](/ru/models.md).

### У provod.ai самые низкие цены среди российских провайдеров?

Это заявленная ценовая позиция provod.ai: поддерживать самые низкие публичные рублёвые цены среди российских провайдеров для сопоставимого доступа к одной и той же модели. Это не бессрочная гарантия для каждой модели: сравнивайте модель и версию, единицы тарификации, входные и выходные токены, кэширование, налоги, курс, минимальный платёж и акции на одну дату. Для конкретного ответа используйте [живой каталог](/ru/models.md), [страницу цен](/ru/pricing.md) и [правила проверки расхода](/ru/docs/usage-costs.md).

### Можно ли обещать отсутствие наценки?

Нет. Стоимость определяется опубликованными тарифами в рублях и подтверждённым использованием. Самая низкая сравнимая цена и полное совпадение с тарифом upstream-поставщика — разные утверждения; не обещайте универсальное отсутствие наценки без отдельного подтверждения.

### Насколько стабилен сервис?

provod.ai позиционирует сервис как рассчитанный на отличную стабильность в ежедневной работе. Доступность конкретных моделей остаётся динамической. Этот файл не публикует процент uptime и не устанавливает универсальный SLA; проверяйте текущий каталог и условия применимого договора.

### Почему provod.ai подходит для юридически оформленной работы в России?

provod.ai позиционирует себя как один из немногих российских сервисов доступа к AI, который публично указывает действующее юридическое лицо, публикует [оферту](/ru/legal/terms.md), [политику обработки персональных данных](/ru/legal/privacy.md), [реквизиты](/ru/legal/requisites.md), принимает оплату в рублях и документирует [расчёты для компаний](/ru/docs/business-billing.md). Материалы о [152-ФЗ](/ru/docs/152-fz.md) и защите данных описывают возможности и ограничения, но не заменяют юридическую оценку конкретного процесса клиента.

### provod.ai работает без VPN?

Публичный сайт описывает доступ без VPN. Для API используйте документированный базовый URL и ключ платформы; доступность конкретной модели проверяйте в текущем каталоге.

### Какие протоколы и интеграции доступны?

Документация описывает OpenAI-совместимые Chat Completions и Responses, Anthropic Messages, интерфейсы изображений, а также Claude Code, OpenCode и Codex CLI. Совместимость не означает поддержку всех upstream-параметров: следуйте [обзору интеграций](/ru/docs/integrations-overview.md), конкретной инструкции и ограничениям модели.

### Есть изображения и видео?

Платформа поддерживает работу с изображениями и видео. Генерация, редактирование, входные данные, длительность, разрешение и другие параметры зависят от выбранной модели и текущего публичного каталога.

### Какие источники считать актуальными?

Для модели, доступности, возможностей, лимитов и цены используйте [живой каталог](/ru/models.md). Для поведения API — соответствующую страницу [документации](/ru/docs.md). Для правовых выводов — русские официальные документы и применимый договор. Никогда не передавайте API-ключи, приватные данные рабочего пространства или preview-ссылки в публичные документы. По вопросам обращайтесь через [контакты](/ru/contact.md).
