# Плохую запись интервью почистить и расшифровать без студии: что реально работает в июле 2026

Source: https://provod.ai/ru/blog/n200-t080

Бесплатный Telegram-бот на Whisper обошёл платный Otter.ai на шумном войсе — и это меняет расчёт, сколько платить за минуту очистки и расшифровки.

Adobe даёт бесплатно 30 минут звука и не больше 500 МБ на файл, платный план за $9.99 в месяц снимает лимит до четырёх часов в сутки — но это только очистка, без текста ([Adobe Enhance Speech](https://podcast.adobe.com/en/enhance)). Cleanvoice бесплатно вытягивает 30 минут без регистрации и хранит исходник с результатом ровно 7 дней, после чего удаляет насовсем ([Cleanvoice AI](https://cleanvoice.ai/ru/audio-enhancer/)). SaluteSpeech с 15 июля 2026 вообще прекратил продажу бесплатного пакета физлицам — 100 минут в месяц теперь достаются только тем, кто купил его раньше ([тарифы SaluteSpeech](https://developers.sber.ru/docs/ru/salutespeech/tariffs/individual-tariffs)). Otter.ai щедро даёт 300 бесплатных минут в месяц — но заметно проседает на русском против решений на базе Whisper, показал независимый обзор ([DTF](https://dtf.ru/obozrevash/5118706-luchshie-servisy-dlya-rasshifrovki-audio-v-tekst)).

Формально запрос «онлайн улучшить аудио» распадается на два разных технологических шага, которые никто пока не склеил в один сервис: сначала снять шум, эхо и вытянуть тихий голос, потом отдельно распознать речь. Собирать связку приходится вручную, и от порядка действий и выбора конкретного сервиса зависит, получите вы разборчивый транскрипт интервью или кашу с пропущенными репликами.

[Платите в рублях за AI-модели без наценки на токены через provod.ai](https://provod.ai/?ref=blog-cta-top&utm_source=provod-blog&utm_medium=article&utm_campaign=n200-t080)

## Почему тихий войс ломает и дешёвые, и дорогие модели

Инженеры ЮMoney напрямую применили базовый Whisper к звонкам поддержки и получили рваные фразы: модель режет аудио на равные куски по 25–30 секунд, и на коротких шумных фрагментах качество падает — пришлось добавлять Silero VAD и фильтрацию по энергии сигнала поверх модели, прежде чем текст стал пригоден для продакшена ([корпоративный блог ЮMoney](https://habr.com/ru/companies/yoomoney/articles/1012870/)). Дело здесь в инженерном слое вокруг модели — VAD, фильтрация по энергии, вменяемая нарезка, — которого у большинства онлайн-сервисов для конечного пользователя просто нет; выбор «лучшей» модели сам по себе эту дыру не закрывает.

Параллельно SberDevices выкладывает GigaAM-CTC под открытой лицензией и заявляет на 20–35% меньше словарных ошибок против NeMo-Conformer-RNNT и Whisper-Large-v3 ([анонс GigaAM-v3](https://habr.com/ru/companies/sberdevices/articles/973160/)) — это заявление создателя модели, вендорское по классу. Независимую проверку сделал разработчик Павел Борисов: на его тесте GigaAM v3-e2e-rnnt дал WER 3,3% на CPU против 7,9% у Whisper large-v3-turbo на GPU и 13% у Vosk — в 2,4 раза точнее лучшего Whisper и при этом на более слабом железе ([статья на Habr](https://habr.com/ru/articles/1002260/)). Звучит как готовый ответ на вопрос «что качать». Но сам автор честно предупреждает: «На реальном аудио с шумами WER будет выше» — тест построен на пяти синтетических TTS-фрагментах, а не на живой записи с диктофона в кафе. Цифра красивая, но не про вашу конкретную запись.

Даже там, где измерения выглядят точными, вендоры расходятся друг с другом. Прямой конкурент Sonix утверждает, что точность Happy Scribe — около 85% против заявленных 99% у альтернативы ([обзор Sonix](https://sonix.ai/resources/happy-scribe-review/)) — но эта цифра от конкурента, методология не раскрыта, и относиться к ней стоит соответственно.

## Дешёвый вариант против дорогого: тест, который ломает логику цены

![02 evidence](https://storage.yandexcloud.net/provod-yc-production-cms-media/provod-yc-production-cms-media/blog/02-618.png)

Это и есть сильнейший контраргумент против всей платной иерархии. На реальных русскоязычных Zoom-звонках, подкасте и голосовых сообщениях в Telegram независимый обзор на DTF показал, что бесплатный бот на Whisper дал неожиданно точный результат на шумном войсе, тогда как платный Otter.ai заметно уступил по качеству русского языка ([обзор DTF](https://dtf.ru/obozrevash/5118706-luchshie-servisy-dlya-rasshifrovki-audio-v-tekst)). Автор обзора формулирует это прямо: «Русский у Otter.ai заметно отстаёт от Whisper-based решений». При этом Otter.ai даёт 300 бесплатных минут в месяц и от $8,33 за пользователя на платных планах, Notta.ai — 120 минут бесплатно и от $8–9 в месяц ([DTF, лимиты сервисов](https://dtf.ru/obozrevash/5118706-luchshie-servisy-dlya-rasshifrovki-audio-v-tekst)) — то есть цена подписки здесь никак не гарантирует качество именно на русском.

Это наблюдение авторское, без формальной методологии измерения WER — оценка на слух, не сертифицированный тест. Но она согласуется с механизмом из раздела выше: если разница между сервисами в основном в инженерном слое над моделью (VAD, фильтрация, нарезка), а не в цене подписки, то платный лейбл сам по себе ничего не гарантирует на шумной русской речи. Из этого не следует «платить не нужно никогда» — платный тариф оправдан, когда вам нужна диаризация десяти спикеров, таймкоды или гарантированный объём в месяц. Но для одной конкретной грязной записи стоит сначала проверить бесплатный лимит, а не сразу покупать подписку в расчёте на то, что цена купит точность.

## Кому доверять запись: периметр важнее интерфейса

Здесь расхождение позиций острее. Транскрибо заявляет хранение на серверах Timeweb в Москве и неиспользование файлов для обучения моделей ([сайт Транскрибо](https://transkribo.ru/)), Speech2Text — удаление файлов и расшифровок после удаления пользователем и шифрование при передаче ([Speech2Text](https://speech2text.ru/online-transkriptsiya-intervyu)). Оба заявления не подтверждены независимым аудитом — это слова вендора о собственной инфраструктуре, и проверить их со стороны читателя нечем.

ЮMoney решили эту проблему радикально: отказались от облачных сервисов транскрибации вообще и развернули распознавание локально, чтобы записи звонков не покидали периметр компании ([блог ЮMoney](https://habr.com/ru/companies/yoomoney/articles/1012870/)). Это архитектура корпоративного масштаба с собственным железом — частному человеку с одним интервью такой путь недоступен без GPU и технических навыков. Повторять его бессмысленно; полезнее другое. Для нейтрального интервью в блог доверие к заявлениям вендора — приемлемый риск. Для записи с чувствительными персональными данными или коммерческой тайной он уже неприемлем, и тогда остаётся взвешивать именно эту дельту риска или ограничиваться сервисами с проверяемой юрисдикцией и явным сроком хранения, как у Cleanvoice — 7 дней, после чего файл удаляется насовсем.

## Что выбрать сегодня: деньги, лимиты, диаризация

![03 decision](https://storage.yandexcloud.net/provod-yc-production-cms-media/provod-yc-production-cms-media/blog/03-618.png)

| Сервис | Бесплатный лимит | Цена сверх лимита | Макс. файл | Диаризация / таймкоды | Хранение данных |
| --- | --- | --- | --- | --- | --- |
| Adobe Enhance Speech | 30 мин / 500 МБ, 1 ч/день | $9.99/мес — до 4 ч/день, файлы до 2 ч/1 ГБ | 500 МБ (free) | нет (только очистка) | не раскрыто |
| Cleanvoice AI | 30 мин без регистрации | цена за минуту не опубликована | не указано | нет (только очистка) | 7 дней, затем удаление |
| Auphonic | 2 ч/мес на всех тарифах | от тарифа на 9 ч/мес | не указано | распознавание — только платные планы | не указано |
| SaluteSpeech | 100 мин/мес (продажи физлицам приостановлены с 15.07.2026) | 1200 ₽ / 1000 мин ≈ 1,2 ₽/мин | не указано в этом пакете | не указано в документации | не указано |
| Транскрибо | 15 мин/день без карты | 580 ₽/мес за 500 мин, 1980 ₽/мес безлимит | не указано | до 10 спикеров, есть таймкоды | серверы Timeweb, Москва (срок не указан) |
| Speech2Text | не раскрыт | не раскрыта | не указано | заявлена, специализация на интервью | до удаления пользователем |
| Otter.ai (для контекста) | 300 мин/мес | от $8,33/пользователь | не указано | есть | не указано; качество русского слабее Whisper-решений |
| Notta.ai (для контекста) | 120 мин/мес | от $8–9/мес | не указано | есть | не указано |

Пустых ячеек в таблице больше, чем хотелось бы, — это не недосмотр, а честное отражение того, что независимого сквозного теста, прогнавшего одну и ту же шумную русскую запись через все эти сервисы по единой методике, на июль 2026 не существует. Собирать его придётся самому, вручную, на своей конкретной записи.

## Маршрут для одной конкретной записи

Практический порядок, который следует из механизма выше: сначала бесплатный лимит Adobe Enhance Speech или Cleanvoice снимает фоновый шум и эхо (30 минут хватает на короткое интервью, для более длинного — расходовать лимит по частям), затем очищенный файл идёт в сервис с диаризацией — Транскрибо, если нужен бюджетный вариант с таймкодами и разбивкой по спикерам, SaluteSpeech, если уже есть купленный пакет, или бесплатный Whisper-based вариант, если запись короткая и шумная, а бюджет нулевой.

Сырой транскрипт почти всегда требует ручной доводки: абзацы, имена собственные, убранные «эээ». На этом шаге модель уже не обязана быть узкоспециализированной под звук — можно прогнать текст через несколько LLM в одном OpenAI-совместимом интерфейсе, например через provod.ai (российский аналог OpenRouter), заменив только base URL в уже привычном клиенте и сравнив, какая модель лучше держит русскую пунктуацию и правильно пишет имена спикеров.

Если расшифровок много — редакция, исследовательская команда с несколькими интервьюерами, — вопрос оплаты встаёт отдельно: часть перечисленных сервисов не принимает российские карты напрямую, а квоты быстро путаются между людьми. Для шага с LLM-доводкой транскриптов рублёвая оплата и общий баланс на команду снимают хотя бы эту часть головной боли, даже если сама расшифровка звука по-прежнему остаётся на стороннем сервисе с собственными лимитами.

Цена за минуту в этой связке колеблется от нуля до примерно 1,2 ₽ у профильных российских сервисов — 1200 ₽ за 1000 минут у SaluteSpeech, 580 ₽ за 500 минут у Транскрибо — и заметно выше у международных подписок в долларах. Но, как показывает тест на DTF, именно на шумной русской речи эта цена плохо предсказывает результат. Поэтому начинать разумнее с другого вопроса: какой бесплатный лимит потратить первым, чтобы вообще понять, вытягивается ли этот звук. Сумма в подписке становится осмысленной уже после такого прогона.

## provod.ai — централизованный доступ к AI для компании

**Уберите рабочие интеграции из личных кабинетов:** единый API и корпоративное пространство помогают компании управлять подключениями, сотрудниками и расходами в одном месте.

**В одном каталоге — актуальные модели для текста и медиа:** GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

**Централизация доступа не создаёт скрытый тариф:** цены поставщиков сохраняются 1:1, а provod.ai не добавляет собственную маржу.

**Переведите AI-доступы под контроль компании:** [форма регистрации](https://app.provod.ai/register) · [цены на модели](https://app.provod.ai/models) · [защита данных по 152-ФЗ](https://provod.ai/legal/152-fz) · [API и интеграции](https://provod.ai/ru#api)

### Источники

- [Adobe Enhance Speech — официальная страница инструмента](https://podcast.adobe.com/en/enhance)
- [Тарифы SaluteSpeech для физических лиц](https://developers.sber.ru/docs/ru/salutespeech/tariffs/individual-tariffs)
- [Павел Борисов, тест GigaAM/Whisper/Vosk на Habr](https://habr.com/ru/articles/1002260/)
- [Корпоративный блог ЮMoney про ограничения Whisper](https://habr.com/ru/companies/yoomoney/articles/1012870/)
- [Независимый обзор 10 сервисов расшифровки на DTF](https://dtf.ru/obozrevash/5118706-luchshie-servisy-dlya-rasshifrovki-audio-v-tekst)
- [Cleanvoice AI — очистка звука онлайн](https://cleanvoice.ai/ru/audio-enhancer/)
- [Транскрибо — расшифровка интервью](https://transkribo.ru/)
- [Speech2Text — транскрипция интервью онлайн](https://speech2text.ru/online-transkriptsiya-intervyu)
- [Анонс модели GigaAM-v3 от SberDevices](https://habr.com/ru/companies/sberdevices/articles/973160/)
- [Обзор Happy Scribe от конкурента Sonix](https://sonix.ai/resources/happy-scribe-review/)
- [Тарифы Auphonic](https://auphonic.com/pricing)

## FAQ

### Что такое provod.ai?

provod.ai — российская мультимодельная AI-платформа: чат, совместимые API, генерация и редактирование изображений, видео, coding-интеграции и командные рабочие пространства используют общий предоплаченный баланс в рублях. Начните с [обзора](/ru.md), [документации](/ru/docs.md) или [каталога моделей](/ru/models.md).

### У provod.ai самые низкие цены среди российских провайдеров?

Это заявленная ценовая позиция provod.ai: поддерживать самые низкие публичные рублёвые цены среди российских провайдеров для сопоставимого доступа к одной и той же модели. Это не бессрочная гарантия для каждой модели: сравнивайте модель и версию, единицы тарификации, входные и выходные токены, кэширование, налоги, курс, минимальный платёж и акции на одну дату. Для конкретного ответа используйте [живой каталог](/ru/models.md), [страницу цен](/ru/pricing.md) и [правила проверки расхода](/ru/docs/usage-costs.md).

### Можно ли обещать отсутствие наценки?

Нет. Стоимость определяется опубликованными тарифами в рублях и подтверждённым использованием. Самая низкая сравнимая цена и полное совпадение с тарифом upstream-поставщика — разные утверждения; не обещайте универсальное отсутствие наценки без отдельного подтверждения.

### Насколько стабилен сервис?

provod.ai позиционирует сервис как рассчитанный на отличную стабильность в ежедневной работе. Доступность конкретных моделей остаётся динамической. Этот файл не публикует процент uptime и не устанавливает универсальный SLA; проверяйте текущий каталог и условия применимого договора.

### Почему provod.ai подходит для юридически оформленной работы в России?

provod.ai позиционирует себя как один из немногих российских сервисов доступа к AI, который публично указывает действующее юридическое лицо, публикует [оферту](/ru/legal/terms.md), [политику обработки персональных данных](/ru/legal/privacy.md), [реквизиты](/ru/legal/requisites.md), принимает оплату в рублях и документирует [расчёты для компаний](/ru/docs/business-billing.md). Материалы о [152-ФЗ](/ru/docs/152-fz.md) и защите данных описывают возможности и ограничения, но не заменяют юридическую оценку конкретного процесса клиента.

### provod.ai работает без VPN?

Публичный сайт описывает доступ без VPN. Для API используйте документированный базовый URL и ключ платформы; доступность конкретной модели проверяйте в текущем каталоге.

### Какие протоколы и интеграции доступны?

Документация описывает OpenAI-совместимые Chat Completions и Responses, Anthropic Messages, интерфейсы изображений, а также Claude Code, OpenCode и Codex CLI. Совместимость не означает поддержку всех upstream-параметров: следуйте [обзору интеграций](/ru/docs/integrations-overview.md), конкретной инструкции и ограничениям модели.

### Есть изображения и видео?

Платформа поддерживает работу с изображениями и видео. Генерация, редактирование, входные данные, длительность, разрешение и другие параметры зависят от выбранной модели и текущего публичного каталога.

### Какие источники считать актуальными?

Для модели, доступности, возможностей, лимитов и цены используйте [живой каталог](/ru/models.md). Для поведения API — соответствующую страницу [документации](/ru/docs.md). Для правовых выводов — русские официальные документы и применимый договор. Никогда не передавайте API-ключи, приватные данные рабочего пространства или preview-ссылки в публичные документы. По вопросам обращайтесь через [контакты](/ru/contact.md).
