Выбор модели для распознавания речи 🎙️
Развивая мысль со вторника. Недавно меня достало низкое качество в Yandex SpeechKit, которое даже через LLM не всегда нормально восстанавливается.
Попробовал разные модели, делюсь. Все расчёты на примере 12 мин. MP3 с моей речью.
🔴 Yandex SpeechKit: 25 сек. и 7₽ + 1₽ на коррекцию — 1/5 качество
🔴 ChatGPT Audio: 17 сек. и 19,55₽ ($0,256) — 4/5 качество
🟡 ChatGPT Audio Mini: 19 сек. и 0,55₽ ($0,00721) — 3/5 качество
🟢 Gemini 3 Flash: 12 сек. и 1,7₽ ($0,0224) — 5/5 качество
На всё ушло: • 30 мин. чтобы собрать, ибо надо было уйти с проприетарного формата API SpeechKit. • 15 мин. подвести итоги
Это маленькая локальная задача, но она идеально иллюстрирует то, о чём я писал во вторник.
Нужна модель для своих задач? — бери самую дорогую доступную и дальше перебирай варианты, пока не найдёшь оптимум.
Для работы с речью я остановился на Gemini 3 Flash в большинстве задач и ChatGPT Audio Mini для больших аудио, но с допустимыми потерями качества.
И да, я знаю про Whisper и т.п. Но увы, на моём сервере такое не запустить, в OpenRouter этих моделей нет и другие агрегаторы не хочу подключать.
@tsvetkovdaily
В этом посте были ссылки, но мы их удалили по правилам Сетки