Бесплатный Telegram-бот на Whisper обошёл платный Otter.ai на шумном войсе — и это меняет расчёт, сколько платить за минуту очистки и расшифровки.
Adobe даёт бесплатно 30 минут звука и не больше 500 МБ на файл, платный план за $9.99 в месяц снимает лимит до четырёх часов в сутки — но это только очистка, без текста (Adobe Enhance Speech). Cleanvoice бесплатно вытягивает 30 минут без регистрации и хранит исходник с результатом ровно 7 дней, после чего удаляет насовсем (Cleanvoice AI). SaluteSpeech с 15 июля 2026 вообще прекратил продажу бесплатного пакета физлицам — 100 минут в месяц теперь достаются только тем, кто купил его раньше (тарифы SaluteSpeech). Otter.ai щедро даёт 300 бесплатных минут в месяц — но заметно проседает на русском против решений на базе Whisper, показал независимый обзор (DTF).
Формально запрос «онлайн улучшить аудио» распадается на два разных технологических шага, которые никто пока не склеил в один сервис: сначала снять шум, эхо и вытянуть тихий голос, потом отдельно распознать речь. Собирать связку приходится вручную, и от порядка действий и выбора конкретного сервиса зависит, получите вы разборчивый транскрипт интервью или кашу с пропущенными репликами.
Платите в рублях за AI-модели без наценки на токены через provod.ai
Почему тихий войс ломает и дешёвые, и дорогие модели
Инженеры ЮMoney напрямую применили базовый Whisper к звонкам поддержки и получили рваные фразы: модель режет аудио на равные куски по 25–30 секунд, и на коротких шумных фрагментах качество падает — пришлось добавлять Silero VAD и фильтрацию по энергии сигнала поверх модели, прежде чем текст стал пригоден для продакшена (корпоративный блог ЮMoney). Дело здесь в инженерном слое вокруг модели — VAD, фильтрация по энергии, вменяемая нарезка, — которого у большинства онлайн-сервисов для конечного пользователя просто нет; выбор «лучшей» модели сам по себе эту дыру не закрывает.
Параллельно SberDevices выкладывает GigaAM-CTC под открытой лицензией и заявляет на 20–35% меньше словарных ошибок против NeMo-Conformer-RNNT и Whisper-Large-v3 (анонс GigaAM-v3) — это заявление создателя модели, вендорское по классу. Независимую проверку сделал разработчик Павел Борисов: на его тесте GigaAM v3-e2e-rnnt дал WER 3,3% на CPU против 7,9% у Whisper large-v3-turbo на GPU и 13% у Vosk — в 2,4 раза точнее лучшего Whisper и при этом на более слабом железе (статья на Habr). Звучит как готовый ответ на вопрос «что качать». Но сам автор честно предупреждает: «На реальном аудио с шумами WER будет выше» — тест построен на пяти синтетических TTS-фрагментах, а не на живой записи с диктофона в кафе. Цифра красивая, но не про вашу конкретную запись.
Даже там, где измерения выглядят точными, вендоры расходятся друг с другом. Прямой конкурент Sonix утверждает, что точность Happy Scribe — около 85% против заявленных 99% у альтернативы (обзор Sonix) — но эта цифра от конкурента, методология не раскрыта, и относиться к ней стоит соответственно.
Дешёвый вариант против дорогого: тест, который ломает логику цены

Это и есть сильнейший контраргумент против всей платной иерархии. На реальных русскоязычных Zoom-звонках, подкасте и голосовых сообщениях в Telegram независимый обзор на DTF показал, что бесплатный бот на Whisper дал неожиданно точный результат на шумном войсе, тогда как платный Otter.ai заметно уступил по качеству русского языка (обзор DTF). Автор обзора формулирует это прямо: «Русский у Otter.ai заметно отстаёт от Whisper-based решений». При этом Otter.ai даёт 300 бесплатных минут в месяц и от $8,33 за пользователя на платных планах, Notta.ai — 120 минут бесплатно и от $8–9 в месяц (DTF, лимиты сервисов) — то есть цена подписки здесь никак не гарантирует качество именно на русском.
Это наблюдение авторское, без формальной методологии измерения WER — оценка на слух, не сертифицированный тест. Но она согласуется с механизмом из раздела выше: если разница между сервисами в основном в инженерном слое над моделью (VAD, фильтрация, нарезка), а не в цене подписки, то платный лейбл сам по себе ничего не гарантирует на шумной русской речи. Из этого не следует «платить не нужно никогда» — платный тариф оправдан, когда вам нужна диаризация десяти спикеров, таймкоды или гарантированный объём в месяц. Но для одной конкретной грязной записи стоит сначала проверить бесплатный лимит, а не сразу покупать подписку в расчёте на то, что цена купит точность.
Кому доверять запись: периметр важнее интерфейса
Здесь расхождение позиций острее. Транскрибо заявляет хранение на серверах Timeweb в Москве и неиспользование файлов для обучения моделей (сайт Транскрибо), Speech2Text — удаление файлов и расшифровок после удаления пользователем и шифрование при передаче (Speech2Text). Оба заявления не подтверждены независимым аудитом — это слова вендора о собственной инфраструктуре, и проверить их со стороны читателя нечем.
ЮMoney решили эту проблему радикально: отказались от облачных сервисов транскрибации вообще и развернули распознавание локально, чтобы записи звонков не покидали периметр компании (блог ЮMoney). Это архитектура корпоративного масштаба с собственным железом — частному человеку с одним интервью такой путь недоступен без GPU и технических навыков. Повторять его бессмысленно; полезнее другое. Для нейтрального интервью в блог доверие к заявлениям вендора — приемлемый риск. Для записи с чувствительными персональными данными или коммерческой тайной он уже неприемлем, и тогда остаётся взвешивать именно эту дельту риска или ограничиваться сервисами с проверяемой юрисдикцией и явным сроком хранения, как у Cleanvoice — 7 дней, после чего файл удаляется насовсем.
Что выбрать сегодня: деньги, лимиты, диаризация

| Сервис | Бесплатный лимит | Цена сверх лимита | Макс. файл | Диаризация / таймкоды | Хранение данных |
|---|---|---|---|---|---|
| Adobe Enhance Speech | 30 мин / 500 МБ, 1 ч/день | $9.99/мес — до 4 ч/день, файлы до 2 ч/1 ГБ | 500 МБ (free) | нет (только очистка) | не раскрыто |
| Cleanvoice AI | 30 мин без регистрации | цена за минуту не опубликована | не указано | нет (только очистка) | 7 дней, затем удаление |
| Auphonic | 2 ч/мес на всех тарифах | от тарифа на 9 ч/мес | не указано | распознавание — только платные планы | не указано |
| SaluteSpeech | 100 мин/мес (продажи физлицам приостановлены с 15.07.2026) | 1200 ₽ / 1000 мин ≈ 1,2 ₽/мин | не указано в этом пакете | не указано в документации | не указано |
| Транскрибо | 15 мин/день без карты | 580 ₽/мес за 500 мин, 1980 ₽/мес безлимит | не указано | до 10 спикеров, есть таймкоды | серверы Timeweb, Москва (срок не указан) |
| Speech2Text | не раскрыт | не раскрыта | не указано | заявлена, специализация на интервью | до удаления пользователем |
| Otter.ai (для контекста) | 300 мин/мес | от $8,33/пользователь | не указано | есть | не указано; качество русского слабее Whisper-решений |
| Notta.ai (для контекста) | 120 мин/мес | от $8–9/мес | не указано | есть | не указано |
Пустых ячеек в таблице больше, чем хотелось бы, — это не недосмотр, а честное отражение того, что независимого сквозного теста, прогнавшего одну и ту же шумную русскую запись через все эти сервисы по единой методике, на июль 2026 не существует. Собирать его придётся самому, вручную, на своей конкретной записи.
Маршрут для одной конкретной записи
Практический порядок, который следует из механизма выше: сначала бесплатный лимит Adobe Enhance Speech или Cleanvoice снимает фоновый шум и эхо (30 минут хватает на короткое интервью, для более длинного — расходовать лимит по частям), затем очищенный файл идёт в сервис с диаризацией — Транскрибо, если нужен бюджетный вариант с таймкодами и разбивкой по спикерам, SaluteSpeech, если уже есть купленный пакет, или бесплатный Whisper-based вариант, если запись короткая и шумная, а бюджет нулевой.
Сырой транскрипт почти всегда требует ручной доводки: абзацы, имена собственные, убранные «эээ». На этом шаге модель уже не обязана быть узкоспециализированной под звук — можно прогнать текст через несколько LLM в одном OpenAI-совместимом интерфейсе, например через provod.ai (российский аналог OpenRouter), заменив только base URL в уже привычном клиенте и сравнив, какая модель лучше держит русскую пунктуацию и правильно пишет имена спикеров.
Если расшифровок много — редакция, исследовательская команда с несколькими интервьюерами, — вопрос оплаты встаёт отдельно: часть перечисленных сервисов не принимает российские карты напрямую, а квоты быстро путаются между людьми. Для шага с LLM-доводкой транскриптов рублёвая оплата и общий баланс на команду снимают хотя бы эту часть головной боли, даже если сама расшифровка звука по-прежнему остаётся на стороннем сервисе с собственными лимитами.
Цена за минуту в этой связке колеблется от нуля до примерно 1,2 ₽ у профильных российских сервисов — 1200 ₽ за 1000 минут у SaluteSpeech, 580 ₽ за 500 минут у Транскрибо — и заметно выше у международных подписок в долларах. Но, как показывает тест на DTF, именно на шумной русской речи эта цена плохо предсказывает результат. Поэтому начинать разумнее с другого вопроса: какой бесплатный лимит потратить первым, чтобы вообще понять, вытягивается ли этот звук. Сумма в подписке становится осмысленной уже после такого прогона.
provod.ai — централизованный доступ к AI для компании
Уберите рабочие интеграции из личных кабинетов: единый API и корпоративное пространство помогают компании управлять подключениями, сотрудниками и расходами в одном месте.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Централизация доступа не создаёт скрытый тариф: цены поставщиков сохраняются 1:1, а provod.ai не добавляет собственную маржу.
Переведите AI-доступы под контроль компании: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции
Источники
- Adobe Enhance Speech — официальная страница инструмента
- Тарифы SaluteSpeech для физических лиц
- Павел Борисов, тест GigaAM/Whisper/Vosk на Habr
- Корпоративный блог ЮMoney про ограничения Whisper
- Независимый обзор 10 сервисов расшифровки на DTF
- Cleanvoice AI — очистка звука онлайн
- Транскрибо — расшифровка интервью
- Speech2Text — транскрипция интервью онлайн
- Анонс модели GigaAM-v3 от SberDevices
- Обзор Happy Scribe от конкурента Sonix
- Тарифы Auphonic
