Как расшифровать аудио и видео в текст: Whisper и альтернативы
Как превратить интервью, лекцию или созвон в текст, разделить спикеров и сделать субтитры.
Редакция Стек AI·

Расшифровка речи — одна из задач, где нейросети уже работают почти без ошибок. Час записи превращается в текст за несколько минут.
Варианты
- Whisper — открытая модель OpenAI. Можно запустить на своём компьютере: запись никуда не уходит, ограничений по длине нет.
- Сервисы на базе Whisper — загружаете файл в браузере и получаете текст и субтитры. Удобно, если не хочется ничего ставить.
- Встроенные функции — расшифровку умеют многие видеоредакторы, мессенджеры и сервисы видеозвонков.
- Российские сервисы — например, расшифровка в продуктах Яндекса и Сбера: работают без зарубежной карты.
Как получить чистый текст
- Качество записи важнее модели. Отдельный микрофон и тихое помещение дают больше, чем смена сервиса.
- Указывайте язык, если инструмент позволяет. Автоопределение иногда ошибается на коротких фрагментах.
- Делите спикеров — функция диаризации подписывает, кто говорит. Для интервью это обязательно.
- Подсказывайте термины. Многие инструменты принимают список имён и терминов — так названия брендов не превратятся в похожие слова.
Что делать с расшифровкой
Сырой текст — ещё не результат. Отдайте его языковой модели:
промпт
Ниже расшифровка интервью. Сделай: 1) краткое содержание в 5 пунктах, 2) 3 самые сильные цитаты дословно, 3) список упомянутых имён, компаний и цифр. Ничего не добавляй от себя. """ [расшифровка] """
Субтитры
Для видео выгружайте расшифровку в формате SRT или VTT — с таймкодами. Их принимают YouTube, VK Видео и все популярные видеоредакторы.