whisperX
WhisperX — это инструмент для автоматического распознавания речи, обеспечивающий быструю транскрипцию с точными временными метками на уровне слов и идентификацией говорящих.
Он поддерживает пакетную обработку, достигая скорости до 70 раз быстрее реального времени при использовании модели large-v2, и требует менее 8 ГБ видеопамяти.
WhisperX использует принудительное выравнивание с помощью модели wav2vec2 для точных временных меток и интегрирует диаризацию говорящих с использованием pyannote-audio для определения, кто что сказал.
Включение предварительной обработки с обнаружением голосовой активности (VAD) снижает количество ложных срабатываний без ухудшения точности распознавания.
Lang: Python https://github.com/m-bain/whisperX