Аудио в текст — расшифровка записи по абзацам и говорящим

Онлайн-инструмент для расшифровки аудио- и видеозаписей в текст: совещаний, интервью, лекций, подкастов и голосовых заметок. Результат выходит по абзацам, с метками говорящих и таймкодами; его можно править прямо на странице, копировать и скачать в DOCX, PDF, TXT или субтитрами SRT/VTT. Короткие файлы распознаются в браузере, многочасовые — на нашем сервере, а о готовности приходит письмо.

Как расшифровать аудио в текст

1
Загрузите запись

MP3, WAV, M4A, FLAC, OGG, WebM или видео — перетащите файл на страницу или выберите на устройстве.

2
Настройте распознавание

Выберите язык и качество, включите «Помечать говорящих» и укажите число участников, если знаете его.

3
Заберите текст

Поправьте слова и имена говорящих прямо на странице, затем скопируйте текст или скачайте DOCX, PDF, TXT, SRT или VTT.

Превратите запись разговора в читаемый документ: кто что сказал и когда

Нужно надиктовать вживую? 🎤 Набор текста голосом

Перетащите аудиофайл сюда
MP4, WEBM, MOV, MP3, WAV, M4A, OGG, FLAC, AAC, M4B, WMA, AIFF, OPUS, CAF, MKV, AVI, WMV, FLV, M4V, 3GP, TS, MTS, M2TS, VOB, MPG, MPEG, OGV

Распознанный текст появится здесь.

00:00

Какую модель выбрать и чего это стоит

Распознавание идёт в браузере, поэтому модель скачивается один раз и остаётся в кэше. Модель побольше лучше слышит акценты и шум, но на той же машине работает дольше.

Модель Разовая загрузка Время на минуту звука Когда выбирать
Быстрый ~75 MB около 1 мин Быстрый черновик, чистая речь, один голос
Точный ~150 MB около 3 мин Обычные записи — привычный компромисс
Высокая точность (small) ~250 MB около 6 мин Акценты, фоновый шум, несколько говорящих
Премиум (Large v3 Turbo) ~600 MB зависит от видеокарты Самый трудный звук; нужна видеокарта или свежий процессор

Из видео сначала извлекается звуковая дорожка: час съёмки с телефона весит 2–3 ГБ, а звука в нём около 30 МБ.

Опубликовано Обновлено Автор: