Аудио в текст — расшифровка записи по абзацам и говорящим
Онлайн-инструмент для расшифровки аудио- и видеозаписей в текст: совещаний, интервью, лекций, подкастов и голосовых заметок. Результат выходит по абзацам, с метками говорящих и таймкодами; его можно править прямо на странице, копировать и скачать в DOCX, PDF, TXT или субтитрами SRT/VTT. Короткие файлы распознаются в браузере, многочасовые — на нашем сервере, а о готовности приходит письмо.
Как расшифровать аудио в текст
MP3, WAV, M4A, FLAC, OGG, WebM или видео — перетащите файл на страницу или выберите на устройстве.
Выберите язык и качество, включите «Помечать говорящих» и укажите число участников, если знаете его.
Поправьте слова и имена говорящих прямо на странице, затем скопируйте текст или скачайте DOCX, PDF, TXT, SRT или VTT.
Превратите запись разговора в читаемый документ: кто что сказал и когда
Нужно надиктовать вживую? 🎤 Набор текста голосом
Файлы расшифровываются по одному; каждый готовый текст сохраняется в историю ниже. Каждый файл — отдельный прогон.
📝 Имена и термины (необязательно)
Распознанный текст появится здесь.
Транскрипция
Протокол составляет языковая модель. Для разбора текст передаётся языковой модели в Yandex Cloud — она работает на серверах в России. Перед отправкой мы заменяем на метки паспортные данные, ИНН, СНИЛС, номера счетов и карт, телефоны и e-mail; имена, названия и адреса остаются в тексте — не загружайте разговор, если не вправе передавать его содержание третьим лицам. Каждый пункт протокола мы проверяем: он попадает в результат только если его цитата дословно есть в вашем тексте. Это защищает от выдуманных выводов, но не делает разбор безошибочным — сверяйте важное с записью.
📖 История
Какую модель выбрать и чего это стоит
Распознавание идёт в браузере, поэтому модель скачивается один раз и остаётся в кэше. Модель побольше лучше слышит акценты и шум, но на той же машине работает дольше.
| Модель | Разовая загрузка | Время на минуту звука | Когда выбирать |
|---|---|---|---|
| Быстрый | ~75 MB | около 1 мин | Быстрый черновик, чистая речь, один голос |
| Точный | ~150 MB | около 3 мин | Обычные записи — привычный компромисс |
| Высокая точность (small) | ~250 MB | около 6 мин | Акценты, фоновый шум, несколько говорящих |
| Премиум (Large v3 Turbo) | ~600 MB | зависит от видеокарты | Самый трудный звук; нужна видеокарта или свежий процессор |
Из видео сначала извлекается звуковая дорожка: час съёмки с телефона весит 2–3 ГБ, а звука в нём около 30 МБ.