Russian Speech-To-Text

Cделал небольшой бенч как работают разные speech-to-text модели. Было интересно, придумали ли что-то лучше Whisper (он всё ещё хорош, и его легко развернуть). Но очень порадовали метрики и скорость работы GigaAM-RNNT и GigaAM-CTC (про них можно почитать тут). Но если тезисно CTC: Connectionist Temporal Classification - предсказывает один символ на каждый кадр аудио, потом жадный/beam search декодинг. А RNN-T: Recurrent Neural Network Transducer - авторегрессивная модель, генерирует токены последовательно с учетом контекста. • GigaAM модели получилсь на порядок быстрее Whisper при сопоставимых метриках. А вот мультимодальные модели работают долго, и качество у них проседает: возможно, нужно использовать более жирные версии, но это уже вне рамок данного исследования

Использованная версия qwen не знала русского, метрики грустные получились

✍️ Как бонус применить llm для постпроцесинга улучшает качество на очевидных ошибках

(WER - word error rate, CER - character error rate)

Russian Speech-To-Text
Cделал небольшой бенч как работают разные speech-to-text модели. Было интересно, придумали ли что-то лучше Whisper (он всё ещё хорош, и его легко развернуть) | Сетка — социальная сеть от hh.ru