Как глубоко надо погрузиться в ML и DS, чтобы уметь в AI ?

Я начал свой путь в ML не с чат-бота, а с кода, который реально распознаёт речь. Вместо того, чтобы просто подключать готовые нейросети, я решил пойти глубже — понять, как работает пайплайн распознавания речи. Использую Vosk + ffmpeg, чтобы вытягивать текст из аудио/видео. 🧩 Что внутри: ffmpeg для извлечения и конвертации аудио Vosk — оффлайн модель ASR (automatic speech recognition) Python-код, который склеивает пайплайн 🔍 Почему это важно мне как продакту? Я хочу уметь не просто говорить “внедрите нейросеть”, а понимать, что она делает, как обучена, где у неё слабые места Это мой способ стать сильнее в ML-инженерной логике, чтобы строить не “обёртки для моделей”, а настоящие ML-сервисы