DEV Community

Cover image for Плохую запись интервью почистить и расшифровать без студии: что реально работает в июле 2026
Promptra Team for provod.ai

Posted on

Плохую запись интервью почистить и расшифровать без студии: что реально работает в июле 2026

Бесплатный Telegram-бот на Whisper обошёл платный Otter.ai на шумном войсе — и это меняет расчёт, сколько платить за минуту очистки и расшифровки.

Adobe даёт бесплатно 30 минут звука и не больше 500 МБ на файл, платный план за $9.99 в месяц снимает лимит до четырёх часов в сутки — но это только очистка, без текста (Adobe Enhance Speech). Cleanvoice бесплатно вытягивает 30 минут без регистрации и хранит исходник с результатом ровно 7 дней, после чего удаляет насовсем (Cleanvoice AI). SaluteSpeech с 15 июля 2026 вообще прекратил продажу бесплатного пакета физлицам — 100 минут в месяц теперь достаются только тем, кто купил его раньше (тарифы SaluteSpeech). Otter.ai щедро даёт 300 бесплатных минут в месяц — но заметно проседает на русском против решений на базе Whisper, показал независимый обзор (DTF).

Формально запрос «онлайн улучшить аудио» распадается на два разных технологических шага, которые никто пока не склеил в один сервис: сначала снять шум, эхо и вытянуть тихий голос, потом отдельно распознать речь. Собирать связку приходится вручную, и от порядка действий и выбора конкретного сервиса зависит, получите вы разборчивый транскрипт интервью или кашу с пропущенными репликами.

Почему тихий войс ломает и дешёвые, и дорогие модели

Инженеры ЮMoney напрямую применили базовый Whisper к звонкам поддержки и получили рваные фразы: модель режет аудио на равные куски по 25–30 секунд, и на коротких шумных фрагментах качество падает — пришлось добавлять Silero VAD и фильтрацию по энергии сигнала поверх модели, прежде чем текст стал пригоден для продакшена (корпоративный блог ЮMoney). Дело здесь в инженерном слое вокруг модели — VAD, фильтрация по энергии, вменяемая нарезка, — которого у большинства онлайн-сервисов для конечного пользователя просто нет; выбор «лучшей» модели сам по себе эту дыру не закрывает.

Параллельно SberDevices выкладывает GigaAM-CTC под открытой лицензией и заявляет на 20–35% меньше словарных ошибок против NeMo-Conformer-RNNT и Whisper-Large-v3 (анонс GigaAM-v3) — это заявление создателя модели, вендорское по классу. Независимую проверку сделал разработчик Павел Борисов: на его тесте GigaAM v3-e2e-rnnt дал WER 3,3% на CPU против 7,9% у Whisper large-v3-turbo на GPU и 13% у Vosk — в 2,4 раза точнее лучшего Whisper и при этом на более слабом железе (статья на Habr). Звучит как готовый ответ на вопрос «что качать». Но сам автор честно предупреждает: «На реальном аудио с шумами WER будет выше» — тест построен на пяти синтетических TTS-фрагментах, а не на живой записи с диктофона в кафе. Цифра красивая, но не про вашу конкретную запись.

Даже там, где измерения выглядят точными, вендоры расходятся друг с другом. Прямой конкурент Sonix утверждает, что точность Happy Scribe — около 85% против заявленных 99% у альтернативы (обзор Sonix) — но эта цифра от конкурента, методология не раскрыта, и относиться к ней стоит соответственно.

Дешёвый вариант против дорогого: тест, который ломает логику цены

Это и есть сильнейший контраргумент против всей платной иерархии. На реальных русскоязычных Zoom-звонках, подкасте и голосовых сообщениях в Telegram независимый обзор на DTF показал, что бесплатный бот на Whisper дал неожиданно точный результат на шумном войсе, тогда как платный Otter.ai заметно уступил по качеству русского языка (обзор DTF). Автор обзора формулирует это прямо: «Русский у Otter.ai заметно отстаёт от Whisper-based решений». При этом Otter.ai даёт 300 бесплатных минут в месяц и от $8,33 за пользователя на платных планах, Notta.ai — 120 минут бесплатно и от $8–9 в месяц (DTF, лимиты сервисов) — то есть цена подписки здесь никак не гарантирует качество именно на русском.

Это наблюдение авторское, без формальной методологии измерения WER — оценка на слух, не сертифицированный тест. Но она согласуется с механизмом из раздела выше: если разница между сервисами в основном в инженерном слое над моделью (VAD, фильтрация, нарезка), а не в цене подписки, то платный лейбл сам по себе ничего не гарантирует на шумной русской речи. Из этого не следует «платить не нужно никогда» — платный тариф оправдан, когда вам нужна диаризация десяти спикеров, таймкоды или гарантированный объём в месяц. Но для одной конкретной грязной записи стоит сначала проверить бесплатный лимит, а не сразу покупать подписку в расчёте на то, что цена купит точность.

Кому доверять запись: периметр важнее интерфейса

Здесь расхождение позиций острее. Транскрибо заявляет хранение на серверах Timeweb в Москве и неиспользование файлов для обучения моделей (сайт Транскрибо), Speech2Text — удаление файлов и расшифровок после удаления пользователем и шифрование при передаче (Speech2Text). Оба заявления не подтверждены независимым аудитом — это слова вендора о собственной инфраструктуре, и проверить их со стороны читателя нечем.

ЮMoney решили эту проблему радикально: отказались от облачных сервисов транскрибации вообще и развернули распознавание локально, чтобы записи звонков не покидали периметр компании (блог ЮMoney). Это архитектура корпоративного масштаба с собственным железом — частному человеку с одним интервью такой путь недоступен без GPU и технических навыков. Повторять его бессмысленно; полезнее другое. Для нейтрального интервью в блог доверие к заявлениям вендора — приемлемый риск. Для записи с чувствительными персональными данными или коммерческой тайной он уже неприемлем, и тогда остаётся взвешивать именно эту дельту риска или ограничиваться сервисами с проверяемой юрисдикцией и явным сроком хранения, как у Cleanvoice — 7 дней, после чего файл удаляется насовсем.

Что выбрать сегодня: деньги, лимиты, диаризация

Сервис Бесплатный лимит Цена сверх лимита Макс. файл Диаризация / таймкоды Хранение данных
Adobe Enhance Speech 30 мин / 500 МБ, 1 ч/день $9.99/мес — до 4 ч/день, файлы до 2 ч/1 ГБ 500 МБ (free) нет (только очистка) не раскрыто
Cleanvoice AI 30 мин без регистрации цена за минуту не опубликована не указано нет (только очистка) 7 дней, затем удаление
Auphonic 2 ч/мес на всех тарифах от тарифа на 9 ч/мес не указано распознавание — только платные планы не указано
SaluteSpeech 100 мин/мес (продажи физлицам приостановлены с 15.07.2026) 1200 ₽ / 1000 мин ≈ 1,2 ₽/мин не указано в этом пакете не указано в документации не указано
Транскрибо 15 мин/день без карты 580 ₽/мес за 500 мин, 1980 ₽/мес безлимит не указано до 10 спикеров, есть таймкоды серверы Timeweb, Москва (срок не указан)
Speech2Text не раскрыт не раскрыта не указано заявлена, специализация на интервью до удаления пользователем
Otter.ai (для контекста) 300 мин/мес от $8,33/пользователь не указано есть не указано; качество русского слабее Whisper-решений
Notta.ai (для контекста) 120 мин/мес от $8–9/мес не указано есть не указано

Пустых ячеек в таблице больше, чем хотелось бы, — это не недосмотр, а честное отражение того, что независимого сквозного теста, прогнавшего одну и ту же шумную русскую запись через все эти сервисы по единой методике, на июль 2026 не существует. Собирать его придётся самому, вручную, на своей конкретной записи.

Маршрут для одной конкретной записи

Практический порядок, который следует из механизма выше: сначала бесплатный лимит Adobe Enhance Speech или Cleanvoice снимает фоновый шум и эхо (30 минут хватает на короткое интервью, для более длинного — расходовать лимит по частям), затем очищенный файл идёт в сервис с диаризацией — Транскрибо, если нужен бюджетный вариант с таймкодами и разбивкой по спикерам, SaluteSpeech, если уже есть купленный пакет, или бесплатный Whisper-based вариант, если запись короткая и шумная, а бюджет нулевой.

Сырой транскрипт почти всегда требует ручной доводки: абзацы, имена собственные, убранные «эээ». На этом шаге модель уже не обязана быть узкоспециализированной под звук — можно прогнать текст через несколько LLM в одном OpenAI-совместимом интерфейсе, например через provod.ai (российский аналог OpenRouter), заменив только base URL в уже привычном клиенте и сравнив, какая модель лучше держит русскую пунктуацию и правильно пишет имена спикеров.

Если расшифровок много — редакция, исследовательская команда с несколькими интервьюерами, — вопрос оплаты встаёт отдельно: часть перечисленных сервисов не принимает российские карты напрямую, а квоты быстро путаются между людьми. Для шага с LLM-доводкой транскриптов рублёвая оплата и общий баланс на команду снимают хотя бы эту часть головной боли, даже если сама расшифровка звука по-прежнему остаётся на стороннем сервисе с собственными лимитами.

Цена за минуту в этой связке колеблется от нуля до примерно 1,2 ₽ у профильных российских сервисов — 1200 ₽ за 1000 минут у SaluteSpeech, 580 ₽ за 500 минут у Транскрибо — и заметно выше у международных подписок в долларах. Но, как показывает тест на DTF, именно на шумной русской речи эта цена плохо предсказывает результат. Поэтому начинать разумнее с другого вопроса: какой бесплатный лимит потратить первым, чтобы вообще понять, вытягивается ли этот звук. Сумма в подписке становится осмысленной уже после такого прогона.


provod.ai — единая AI-платформа для текста, кода и медиа

Не нужно оплачивать и поддерживать отдельный сервис для каждого формата: веб-интерфейс, API, мультимедийный редактор и командный баланс работают в одном контуре.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

И текстовые запросы, и медиагенерации тарифицируются без собственной наценки provod.ai: стоимость соответствует официальным ценам поставщиков 1:1.

Соберите свой мультимодальный сценарий: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции

Источники

Top comments (0)