К содержанию
ГайдАудио и голос4 мин

Как расшифровать аудио и видео в текст: Whisper и альтернативы

Как превратить интервью, лекцию или созвон в текст, разделить спикеров и сделать субтитры.

Редакция Стек AI·

Расшифровка речи — одна из задач, где нейросети уже работают почти без ошибок. Час записи превращается в текст за несколько минут.

Варианты

  • Whisper — открытая модель OpenAI. Можно запустить на своём компьютере: запись никуда не уходит, ограничений по длине нет.
  • Сервисы на базе Whisper — загружаете файл в браузере и получаете текст и субтитры. Удобно, если не хочется ничего ставить.
  • Встроенные функции — расшифровку умеют многие видеоредакторы, мессенджеры и сервисы видеозвонков.
  • Российские сервисы — например, расшифровка в продуктах Яндекса и Сбера: работают без зарубежной карты.

Как получить чистый текст

  1. Качество записи важнее модели. Отдельный микрофон и тихое помещение дают больше, чем смена сервиса.
  2. Указывайте язык, если инструмент позволяет. Автоопределение иногда ошибается на коротких фрагментах.
  3. Делите спикеров — функция диаризации подписывает, кто говорит. Для интервью это обязательно.
  4. Подсказывайте термины. Многие инструменты принимают список имён и терминов — так названия брендов не превратятся в похожие слова.

Что делать с расшифровкой

Сырой текст — ещё не результат. Отдайте его языковой модели:

промпт
Ниже расшифровка интервью. Сделай:
1) краткое содержание в 5 пунктах,
2) 3 самые сильные цитаты дословно,
3) список упомянутых имён, компаний и цифр.
Ничего не добавляй от себя.
"""
[расшифровка]
"""

Субтитры

Для видео выгружайте расшифровку в формате SRT или VTT — с таймкодами. Их принимают YouTube, VK Видео и все популярные видеоредакторы.