Из проблемы получил мега проблему

Искал сервис, который генерирует субтитры с разделением по спикерам — чтобы монтажёр смог лучше понимать замечания. Когда непонятно, где какой спикер, приходится страдать и по тысяче раз пересматривать видео, чтобы понять, какой кусок вырезать.

Разделение по спикерам и качественные субтитры позволяют упростить процесс сведения. Предыдущий опыт показал, что это мега важно и сохраняет нервы и время — мне и монтажёру.

Субтитры CapCut или YouTube — полный отстой. CapCut ещё более-менее, но не умеет в разделение по спикерам. А у YouTube нет ни разделения, ни нормальных субтитров, которые, чтобы вытащить, нужно сначала загрузить видео на канал. Короче, сервисов оказалось не так много!Есть парочка зарубежных, но там, как правило, ограничение на 15–20 мин. в бесплатной версии.

Окей, я не против заплатить, но нужна карта зарубежного банка и VPN. А вот с картой у меня пока проблемы — её заблокировали. Всякие способы по типу plati.ru — неудобны, да и не всегда там есть нужные сервисы. Решил найти российский сервис, но до того как начал искать, попробовал инструмент от OpenAI — WhisperX. Ну, как попробовал :) Попытался попробовать.

Думал я примерно так: у меня есть нормальная видеокарта, мне нужно решение, которым буду пользоваться постоянно. Почему бы один раз не настроить на ПК? И денег сэкономлю, и гемора с картой не будет.

Тем более уже есть либа, которую можно развернуть локально, скормить файлик и получить на выходе субтитры в нужном формате и с разделением по спикерам. Ну сказка! Я ж инженер. Короче, не хотелось засирать свой ноутбук и винду на ПК, я пошёл ставить всё на Ubuntu. Она у меня есть в наличии, на ней обычно экспериментирую, проектики свои делаю, да и просто наслаждаюсь простотой и удобством.

Для меня macOS всё же не про свободу, и когда запускаю Ubuntu, ощущаю это в полной мере.

Правда, когда начал всё устанавливать, понял, что это не просто. Там нужно было получить какие-то токены на каком-то сайте, чтобы поставить обвес для разделения голоса. Потом собрать WhisperX по исходникам, а затем уже только скормить аудиофайл. И вот здесь понеслось!Неактуальные версии библиотек. Потом запускалась на CPU, а мне надо на GPU.

Дальше начал разбираться, почему Ubuntu GPU не видит. Думал, может, проблема в драйверах. Сидел, ставил дрова, потом переключался на винду — оказалось, там тоже не видно GPU. Получается, аппаратная проблема.

Полез разбирать системник — заметил, что монитор подключил к материнке, а надо к GPU. Поправил. Смотрю — кулеры не крутятся. Оказалось, неправильно подключил видеокарту. Завёл видеокарту. Подумал: ну всё — теперь у меня будут субтитры! Но нет.Новая версия WhisperX несовместима с библиотеками для разделения спикеров. Ааа.

До этого я ещё потратил время на обновление Ubuntu и винды, потому что редко сижу за ПК. С видюхой вообще интересно получилось — она не работала, потому что мне как-то захотелось почистить от пыли системник, и я его так почистил, что потом неправильно карту подключил.

В общем, часа 4 потратил, а субтитров так и не получил! Плюнул на всё это и пошёл искать российский сервис.Нашёл speech2text.ru. Сайт у них, конечно, не то чтобы супермега бомбический, зато всё остальное работает и нормально делит субтитры по спикерам. Цены адекватные. Короче, мне подошёл. Поймал себя на мысли, что в РФ нет нормального маркетплейса для сервисов, построенных на базе нейронок. А ещё не так много адекватных сервисов для распознавания текста в аудио. Кажется, там ещё есть рынок, где можно неплохо зарабатывать.

Настрадался, но решение найдено!