Russian Speech-To-Text
Cделал небольшой бенч как работают разные speech-to-text модели. Было интересно, придумали ли что-то лучше Whisper (он всё ещё хорош, и его легко развернуть). Но очень порадовали метрики и скорость работы GigaAM-RNNT и GigaAM-CTC (про них можно почитать тут). Но если тезисно CTC: Connectionist Temporal Classification - предсказывает один символ на каждый кадр аудио, потом жадный/beam search декодинг. А RNN-T: Recurrent Neural Network Transducer - авторегрессивная модель, генерирует токены последовательно с учетом контекста. • GigaAM модели получилсь на порядок быстрее Whisper при сопоставимых метриках. • А вот мультимодальные модели работают долго, и качество у них проседает: возможно, нужно использовать более жирные версии, но это уже вне рамок данного исследования
• Использованная версия qwen не знала русского, метрики грустные получились
✍️ Как бонус применить llm для постпроцесинга улучшает качество на очевидных ошибках
(WER - word error rate, CER - character error rate)