OpenAI Whisper на CPU

Делая RAG-систему для одного клиента, столкнулся с невозможностью использовать вычисления на CUDA для Whisper из-за того, что клиент арендовал сервер в формате 1U, с невозможностью поставить GPU.

Задача - распознать в текст имеющуюся библиотку видео + сделать автораспознавание вновь загруженных видео.

Второй сервер клиент брать пока не хочет, т.к. система делается экспериментально для данной организации, и пока непонятно, насколько реально они это будут использовать.

Задача - обойтись имеющимися мощностями.

Ключевая проблема в том, что OpenAI Whisper работает экстремально медленно на CPU, если использовать для распознавания библиотеку large-v3

А medium и base-варианты допускают очень много опечаток для русской речи.

Неплохой вариант в этой ситуации - использовать FasterWhisper.

Библиотека оптимизирована под вычисления на CPU, используя алгоритмы квантования (в настройках указать режим int8 при вызове)

И в остальном - это порт оригинального OpenAI Whisper, я проверял итоговые результаты распознавания на нескольких видео, отличий не нашел.

Важно: НЕ использовать библиотеку large-v3-turbo, в ней всего 809 млн. параметров vs 1.55 млрд в large-v3, и это даёт опечатки в результате (проверено)

По итогу, FasterWhisper распознает 2хчасовое видео на CPU примерно за 5 часов.

Сильно быстрее, чем оригинальный от OpenAI (у того, думаю, ушло бы несколько суток, я так и не дождался завершения)

CPU клиента - 2 x Xeon Silver 4314 2.40 ГГц, больше чем на 50% Whisper его не нагружает, и вполне хватает обрабатывать все обычные задачи сервера + распознавать видео

Хороший вариант в ситуации, когда видео не очень много, и не хочется тратиться на GPU.

OpenAI Whisper на CPU | Сетка — социальная сеть от hh.ru OpenAI Whisper на CPU | Сетка — социальная сеть от hh.ru