Тот, кто вбивает в поиск «озвучка текста ИИ» для подкаста или ролика, обычно ждёт ответа про естественность голоса. По состоянию на 26 июля 2026 года раньше голоса кончается доступ к сервису — и это переписывает весь список кандидатов.
Свежая проверка публичной документации даёт неприятную картину. Сбер с 15 июля 2026 года закрыл для новых юрлиц продажу пакетов SaluteSpeech и оплату по факту использования — той самой схемы, где синтез стоит 0,000186 ₽ за символ, то есть около 17 копеек за минуту речи. Для физлиц закрыт ещё и бесплатный лимит — 200 000 символов в месяц и продление Freemium прекращены с той же даты. Самый дешёвый российский тариф в статье остался доступен только тем, кто успел подключиться раньше.
С другой стороны — ElevenLabs, которого принято ставить эталоном естественности. Вендор официально ограничивает доступ к сервису из России и Беларуси в числе восьми стран и территорий. Дешёвый прайс и реально доступный сервис — просто разные множества, и сравнивать их по одной шкале — методическая ошибка, с которой начинается большинство статей про TTS.
Платите в рублях за AI-модели без наценки на токены через provod.ai
Что остаётся в игре
Из зарубежных облаков относительно прозрачно ведёт себя Cartesia: бесплатный план даёт около 27 минут синтеза в месяц, а право на коммерческое использование и клонирование голоса появляется только с плана Pro за $5 — это ≈133 минуты, то есть порядка 3 ₽ за минуту по текущему курсу. Русский язык формально входит в список из 42 поддерживаемых языков Sonic 3.5, но документация не измеряет качество на русском — это придётся проверять самому.
Из российских — Yandex SpeechKit. По независимому разбору интегратора Raft, тариф API v3 даёт около 0,55 ₽ за минуту, а задержка синтеза 10–15-секундного фрагмента — 1,81 секунды против 3,49 у открытой модели CosyVoice на той же GPU. Официальную страницу тарификации Яндекса на момент проверки закрывает антибот-капча, поэтому цифры стоит перепроверить в личном кабинете перед тем, как закладывать их в бюджет.
Если тестировать сразу несколько таких моделей, а не подписываться вслепую на одну, дешевле не заводить отдельный ключ и клиент под каждый сервис: агрегаторы вроде provod.ai дают доступ к аудио-моделям через один OpenAI-совместимый API — замена base URL вместо переписывания интеграции — и позволяют сравнить кандидатов до того, как платить за годовую подписку.
Бесплатно — не значит можно продавать
Открытые модели решают проблему доступности, но здесь начинается вторая стена — лицензионная, и она обычно недооценена. В сравнении семи открытых TTS-моделей на русском лучшую связку скорости и естественности дают Silero (естественность 4/5, 0,071 с на GPU) и русский файнтюн F5-TTS (4,5/5, 2,32 с на GPU) — а такие модели, как HiggsAudio, на том же железе тратят на один фрагмент 50,36 секунды на GPU и 123,34 секунды на CPU, что уже за гранью практичного использования. Но у Silero скорость не значит «свободно»: модели опубликованы под CC-NC-BY, то есть некоммерческая лицензия; под MIT идут только базовые cis-tts модели, а не голоса из линейки v5_5_ru с автоматической расстановкой ударений. XTTS-v2, который часто советуют как бесплатный клон голоса, выпущен под собственную Coqui Public Model License — и спросить о её толковании больше не у кого, компания Coqui закрылась.
Из проверенных вариантов под по-настоящему открытой лицензией нашёлся один: ESpeech-TTS-1_RL-V2 распространяется по Apache-2.0, обучен на 240 часах вебинаров с восемью дикторами. Это редкий случай, когда «бесплатно» и «можно продавать результат» совпадают — но карточка модели не приводит метрик качества, так что перед использованием в монетизируемом ролике модель придётся прогнать через собственный текст.
Клонирование чужого тембра — отдельная категория риска. Microsoft показывает, как выглядит легальная процедура: обязательна загрузка записанного голосового согласия человека, а доступ к API personal voice выдаётся только по одобренной заявке. Для бизнес-использования provod.ai закрывает соседний, но не тот же вопрос — рублёвая оплата и закрывающие документы от российского юрлица снимают часть административной головной боли, но не заменяют согласие владельца голоса.
Спор, который сцена ведёт не первый год

Разлом в индустрии проходит по одному вопросу: заменяет ли синтез диктора вообще. Инженер Raft Данил Музафаров занимает срединную позицию: открытые модели — «рабочий бизнес-инструмент, но не универсальная замена диктора для всех сценариев», годятся для коротких и средних фраз, ломаются на длинных текстах. Цеховые реплики ниже — из материала Sostav.ru от 8 июля 2023 года; насколько эти позиции держатся сегодня, публично не подтверждено. Актёр дубляжа Иван Жарков был резче: «Нейросети никогда не смогут достоверно сыграть так, как это может сделать профессиональный актер». Директор по контентному развитию «Литрес» Евгений Селиванов смотрел на это со стороны производства: для него синтез снимает ограничение по объёмам и позволяет выпустить книги, которые иначе не были бы озвучены вообще. Актриса Татьяна Шитова заняла третью позицию: синтез уже приемлем в нейтральном документальном закадре, но не в ролях, требующих актёрской игры. Председатель Союза дикторов России Александр Лапшин добавил юридический слой к спору — он описал случай, когда голос артиста синтезировали и использовали без согласия, а претензию оказалось не на что опереть.
Возражение, которое звучит убедительно и наполовину неправильно
Разница в цене минуты — от 17 копеек у закрытого теперь SaluteSpeech до 3 рублей у Cartesia — выглядит решающей. Но независимый тест OmniVoice на русском даёт средний балл 4,53 из 5 и проваливается именно там, где болит у авторов: омографы 4,1/5 и даты/время 4,1/5, с обрывами концов предложений и артефактами на стыках чанков в длинной генерации. Пятиминутный ролик всё равно требует прослушивания и ручных правок ударений — а час редактуры перекрывает разницу в тарифе за несколько дней использования любого сервиса.
Второй слой того же возражения — юридический, и он серьёзнее ценового. Общей охраны голоса в ГК РФ сейчас нет: законопроект № 718834-8 о новой статье 152.3 внесён 16 сентября 2024 года и почти два года стоит на первом чтении без назначенной даты. Единственная действующая норма — узкая: 130-ФЗ от 2 мая 2026 года запрещает синтезированный голос и изображение в агитационных материалах без письменного согласия, и на обычную коммерческую озвучку прямо не распространяется. Значит право на голос сейчас держится на договоре и лицензии платформы, а не на статье закона — и «дешёвая» озвучка чужим тембром без документа о согласии остаётся юридической миной вне зависимости от тарифа.
Есть и третье ограничение, которое часто упускают: не всякая многоязычная модель одинаково хороша на русском просто потому, что заявляет поддержку языка. Практический тест показал, что англоцентричные модели ломаются буквально: Kokoro озвучивает случайные английские слова вместо русского текста, а VibeVoice говорит с акцентом почти в каждом слове. Совет «возьмите любую топовую модель, она мультиязычная» на практике не работает.
Тест-скрипт на 10 ловушек русского TTS

Прежде чем платить за подписку или считать открытую модель готовой, прогоните через неё один абзац с этими конструкциями и слушайте конкретно то, что указано:
| Ловушка | Пример | Что слушать |
|---|---|---|
| Омографы по смыслу | за́мок / замо́к, бо́льшая / больша́я | Правильное ударение по контексту предложения |
| Фамилии в косвенных падежах | «письмо от Мельникова», «встреча с Ковтуном» | Не съедает ли модель окончание, не читает ли как несклоняемое |
| Аббревиатуры | ОМС, СНИЛС, ЭКГ | По буквам или как слово; совпадает ли с привычным произношением |
| Числа и суммы | «142 350 рублей 90 копеек» | Полное правильное число, а не обрывок или «сто сорок два тысячи» |
| Даты | «15 июля 2026 года» | Порядковые числительные вместо количественных |
| «В т. ч.» и другие сокращения | «в т. ч. НДС», «т. е.» | Разворачивается ли в полное слово |
| Латиница внутри фразы | «через API получить SLA» | Транслитерация вместо побуквенного чтения английских слов |
| Длинное перечисление | список из 6–8 однородных пунктов | Не теряется ли интонация к концу списка |
| Стык длинных фрагментов | текст на 4–5 минут аудио | Артефакты и провалы на границах генерируемых чанков |
| Эмоциональная нейтральность vs монотонность | абзац с прямой речью | Не читает ли реплики персонажей одинаковым тоном |
Если модель проваливает три и больше пункта из десяти, экономия на тарифе уже съедена временем редактуры.
Что выбрать сегодня
Кто по-прежнему набирает в поиске «озвучка текста ИИ» и хочет короткий ответ, а не сравнительную таблицу — вот он. Для короткого нейтрального ролика без клонирования голоса разумный путь — ESpeech-TTS под Apache-2.0 или платный план с явной коммерческой лицензией вроде Cartesia Pro, при условии, что оплата и API реально доступны из России (это стоит проверить отдельно — платёжная доступность в фактуре не подтверждена). Для длинного контента с игрой и эмоциями синтез пока не замена диктору, что подтверждают и вендорские, и независимые тесты. А для клонирования чужого голоса единственный защищённый вариант — письменное согласие владельца по образцу Azure personal voice, потому что закон эту дыру за вас не закроет ещё как минимум до осенней сессии Думы.
provod.ai — корпоративная работа с AI с учётом требований РФ
Для сценариев с персональными данными важна не только модель, но и организация процесса: платформа проектируется с учётом требований российского законодательства, а применимость определяется составом данных и настройками клиента.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Требования к корпоративному процессу не увеличивают тариф модели: стоимость сохраняется 1:1 с официальной ценой провайдера, без собственной наценки provod.ai.
Изучите условия для корпоративного сценария: форма регистрации · цены на модели · защита данных по 152-ФЗ · политика обработки данных
Источники
- Тарифы SaluteSpeech для юрлиц — developers.sber.ru
- Тарифы SaluteSpeech для физлиц — developers.sber.ru
- Ограничения доступа ElevenLabs по странам — help.elevenlabs.io
- Тарифы Cartesia — cartesia.ai/pricing
- Языковая поддержка модели Sonic 3.5 — docs.cartesia.ai
- Personal voice в Azure AI Speech — learn.microsoft.com
- Сравнение TTS-моделей на бизнес-задачах, тарифы и задержки — блог Raft на Хабре
- Тест OmniVoice на русском языке — блог Raft на Хабре
- Обзор open-source TTS-моделей — блог Raft на Хабре
- Лицензия и голоса Silero — GitHub snakers4/silero-models
- Карточка модели ESpeech-TTS-1_RL-V2 — Hugging Face
- Карточка модели XTTS-v2 — Hugging Face
- Тест англоязычных моделей на русском тексте — блог Selectel на Хабре
- Обзор 130-ФЗ о запрете ИИ-образов в агитации — КонсультантПлюс
- Карточка законопроекта № 718834-8 — СОЗД Госдумы РФ
- Комментарии дикторов и юристов о синтезе голоса — Sostav.ru
