Выбор модели для распознавания речи 🎙️

Развивая мысль со вторника. Недавно меня достало низкое качество в Yandex SpeechKit, которое даже через LLM не всегда нормально восстанавливается.

Попробовал разные модели, делюсь. Все расчёты на примере 12 мин. MP3 с моей речью.

🔴 Yandex SpeechKit: 25 сек. и 7₽ + 1₽ на коррекцию — 1/5 качество

🔴 ChatGPT Audio: 17 сек. и 19,55₽ ($0,256) — 4/5 качество

🟡 ChatGPT Audio Mini: 19 сек. и 0,55₽ ($0,00721) — 3/5 качество

🟢 Gemini 3 Flash: 12 сек. и 1,7₽ ($0,0224) — 5/5 качество

На всё ушло: • 30 мин. чтобы собрать, ибо надо было уйти с проприетарного формата API SpeechKit. • 15 мин. подвести итоги

Это маленькая локальная задача, но она идеально иллюстрирует то, о чём я писал во вторник.

Нужна модель для своих задач? — бери самую дорогую доступную и дальше перебирай варианты, пока не найдёшь оптимум.

Для работы с речью я остановился на Gemini 3 Flash в большинстве задач и ChatGPT Audio Mini для больших аудио, но с допустимыми потерями качества.

И да, я знаю про Whisper и т.п. Но увы, на моём сервере такое не запустить, в OpenRouter этих моделей нет и другие агрегаторы не хочу подключать.

#ии_в_работе

@tsvetkovdaily


В этом посте были ссылки, но мы их удалили по правилам Сетки