Отгуливаю оставшиеся 3 дня отпуска, думаю - можно начинать подводить какие-то итоги 2025. Главная мысль в части речевых технологий - их разработка все еще актуальна. Моделей распознавания, одинаково хорошо справляющихся с телефонным коллцентром и записью с видеокамеры в розничном салоне - нет. А если еще требуется диаризация, да еще и в потоке - там очень даже есть над чем работать. Синтезов, которые могут неотличимо от человека озвучить фразу - уже много. Топовые иностранные разработки, при этом - путают ударения и выдают себя акцентом. Ну и при доступе через API не особо дешевы. Если надо озвучить длинные формы, или поддержать живой диалог - это пока что умеет мало кто. Честные voice-to-voice LLM вроде и где-то рядом, но не в проде практически нигде. И по прежнему много значит эффективность инференса. Если заказчику для автоматизации его коллцентра надо покупать/арендовать H100 - он поищет другое решение. Про свои успехи и успехи своего отдела - вывели в прод войсклонинг, основательно улучшили ASR и сильно ускорили все. А так же делаем весьма востребованный голосовой антиспуфинг. Отдел немного подрасширился. Потом, правда, обратно подсократился, но итогово - в плюсе. Запустил пилотный проект по портированию части функционала на Rust, результаты выглядят неплохими, думаю - расскажем. И планируем выпустить кое-что еще в опенсорс, там правда без раста, но интересное. #итоги #ml