Аудио в текст — Расшифровка аудиофайлов с помощью ИИ
Конвертер для превращения записанного аудиофайла в текст. Загрузите MP3, WAV, M4A, FLAC, OGG или WebM — лекцию, интервью, запись совещания, выпуск подкаста или голосовую заметку — и Whisper AI расшифрует её в чистый документ с таймкодами, который можно читать, редактировать и сохранять. Поскольку у каждой фразы сохраняется таймкод, этот же текст экспортируется прямо в субтитры SRT или VTT. Расшифровка выполняется в браузере через WebAssembly.
Как расшифровать аудио в текст
Перетащите записанный аудиофайл на страницу или нажмите, чтобы выбрать его на устройстве.
Выберите модель — Быструю для черновика, побольше для точной расшифровки длинного или шумного файла.
Запустите расшифровку и следите за прогрессом, пока Whisper читает файл в браузере.
Прочитайте текст, поправьте имена и экспортируйте в TXT для документа или в SRT/VTT для субтитров.
Загрузите готовую запись — получите текст с таймкодами и субтитры
📝 Имена и термины (необязательно)
Транскрипция
Протокол составляет языковая модель. Для разбора текст передаётся языковой модели в Yandex Cloud — она работает на серверах в России. Перед отправкой мы заменяем на метки паспортные данные, ИНН, СНИЛС, номера счетов и карт, телефоны и e-mail; имена, названия и адреса остаются в тексте — не загружайте разговор, если не вправе передавать его содержание третьим лицам. Каждый пункт протокола мы проверяем: он попадает в результат только если его цитата дословно есть в вашем тексте. Это защищает от выдуманных выводов, но не делает разбор безошибочным — сверяйте важное с записью.
📖 История
☁ Облако слов
Визуальная карта самых частых слов — чем крупнее слово, тем чаще вы его произносили.
🔖 Закладки
⌨ Горячие клавиши
Какую модель выбрать и чего это стоит
Распознавание идёт в браузере, поэтому модель скачивается один раз и остаётся в кэше. Модель побольше лучше слышит акценты и шум, но на той же машине работает дольше.
| Модель | Разовая загрузка | Время на минуту звука | Когда выбирать |
|---|---|---|---|
| Быстрый | ~75 MB | около 1 мин | Быстрый черновик, чистая речь, один голос |
| Точный | ~150 MB | около 3 мин | Обычные записи — привычный компромисс |
| Высокая точность (small) | ~250 MB | около 6 мин | Акценты, фоновый шум, несколько говорящих |
| Премиум (Large v3 Turbo) | ~600 MB | зависит от видеокарты | Самый трудный звук; нужна видеокарта или свежий процессор |
Из видео сначала извлекается звуковая дорожка: час съёмки с телефона весит 2–3 ГБ, а звука в нём около 30 МБ.