На выходных сделали тестирование моделей для транскибции аудио. Это имеет практический смысл – записали встречу, нужно сделать саммари от этой встречи. И тут важно понимать, что точность распознавания крайне важна. Одно некорректное слово может поменять смысл. Мы взяли 3 модели для этого теста.

Microsoft заявляет для MAI-Transcribe-2 первое место на FLEURS: средний WER 5,2% на 60 языках. Отдельной цифры по русскому нет вообще. А FLEURS – это начитанная речь: носители по одному читают подготовленные предложения. Совещание звучит иначе, и меряют это только на своей записи.

Мы взяли запись открытой встречи сообщества казахстанских тимлидов «Тимлид не кодит» от 3 июня 2026 года (страница встречи). Она публичная, цифры можно перепроверить. 40 минут, несколько говорящих, перебивания, в начале возня с микрофонами. Темы: серверный полигон, Discord вместо Telegram, культура найма.

И вот что разные модели распознали

MAI-Transcribe-2: ...музыку-то слышал. Мне интересно. Похоже, т- техника как бы, которая... всё портит.

Gemini 3.5 Flash: ...музыку-то слышал? Мне интересно. Похоже тут техника как бы, которая всё портит

Yandex SpeechKit: ...музыку то слышал Не интересно. Покажите техника как бы которая Все портит

Две ошибки в одном предложении у Yandex на этой записи, и обе переворачивают смысл: «Мне интересно» стало «Не интересно», «Похоже» стало «Покажите». В протоколе встречи это уже другое утверждение.

А там, где MAI и Gemini слышат «О, сейчас пошло», Yandex выдает «вова сейчас пошла». Междометие стало именем, глагол согласован с ним по роду.

Но смысл – не единственное расхождение. MAI вернул расшифровку за 15,8 секунды, Gemini – за 88,6, Yandex – за 62,9. Это 5,6 и 4 раза. У Yandex в расшифровке ноль точек и ноль запятых: 21 910 символов одной строкой. Протокол из этого собирают второй обработкой.

MAI сохранил все заполнители в речи, по принципу «э-э», остальные две модели их убрали. Для стенограммы нужен первый, для протокола второй. Цена MAI-Transcribe-2 – $0,10 за час аудио.

И в общую картину это ложится. По обзору русских сервисов на русском аудио Yandex SpeechKit последний из пяти: Nexara, Palatine, Shopot и Sber API впереди.

При этом WER (количество ошибок в тексте, по отношению к реальному разговору) мы не считали: эталонной расшифровки нет, сравнение качественное. Отраслевой терминологии в записи не было. Именно там работает keyword biasing, и это осталось непроверенным. Одна запись, одна акустика, один домен, поэтому все выводы – это только тестовый прогон моделей.

И важно здесь то, что выбирая модель для использования в вашем личном случае – необходимо проводить замеры в вашем конкретном случае, чтобы говорить, что вы "внедрили". Без бенчмарков на ваших задачах, ошибка может быть значительной.

На выходных сделали тестирование моделей для транскибции аудио. Это имеет практический смысл – записали встречу, нужно сделать саммари от этой встречи | Сетка — социальная сеть от hh.ru На выходных сделали тестирование моделей для транскибции аудио. Это имеет практический смысл – записали встречу, нужно сделать саммари от этой встречи | Сетка — социальная сеть от hh.ru