whisperX

WhisperX — это инструмент для автоматического распознавания речи, обеспечивающий быструю транскрипцию с точными временными метками на уровне слов и идентификацией говорящих.

Он поддерживает пакетную обработку, достигая скорости до 70 раз быстрее реального времени при использовании модели large-v2, и требует менее 8 ГБ видеопамяти.

WhisperX использует принудительное выравнивание с помощью модели wav2vec2 для точных временных меток и интегрирует диаризацию говорящих с использованием pyannote-audio для определения, кто что сказал.

Включение предварительной обработки с обнаружением голосовой активности (VAD) снижает количество ложных срабатываний без ухудшения точности распознавания.

Lang: Python https://github.com/m-bain/whisperX