Как мы сравнивали ASR-решения
Мы собрали несколько сотен минут реальных звонков — с перебиваниями, фоновым шумом, акцентами и быстрой речью. И прогнали через всех заметных игроков на рынке: от гигантов вроде Google и Yandex до узких специалистов по телефонной речи. Результаты оказались очень разными. Один сервис отлично распознаёт тихую речь, но падает, когда два человека говорят одновременно. Другой идеально разделяет спикеров, но съедает окончания слов. Третий работает только на английском, четвёртый требовал отправлять аудио за границу.
Спойлер: идеального решения не существует. Поэтому мы выбрали комбинацию из двух сервисов — основной и fallback. Если основной не справляется с конкретным звонком (например, из-за плохой связи), второй подхватывает. Для пользователя это выглядит как одна стабильная система.