Разобрал, какие open-source модели распознавания речи реально работают на русском языке в 2026-м.
Главное: рекламируемый в сети NVIDIA Canary-Qwen 2.5B под русский не подходит - модель английская, русского в её обучении нет.
Что брать:
- универсально - быстрый Whisper (faster-whisper, large-v3-turbo)
- максимальная точность на русском - русский fine-tune на его базе
- слабое железо и real-time - Silero STT
Плюс про диаризацию и подводные камни.
Читать: https://presniakov.ru/blog/raspoznavanie-russkoj-rechi-open-source-2026