🎙 Вы ещё говорите, а ИИ уже начинает работать с вашим запросом

Microsoft представила MAI-Transcribe-2-Streaming, модель потокового распознавания речи на 60 языках. По данным компании, первые фрагменты текста появляются чуть более чем через 100 миллисекунд после получения аудио. По мере продолжения речи модель уточняет расшифровку.

Почему для бизнеса это интересно? Голосовой помощник может начать искать информацию, пока человек ещё формулирует вопрос. А система речевой аналитики может готовить подсказку сотруднику прямо во время разговора. Представьте: клиент рассказывает о проблеме, а система уже находит нужную инструкцию и поднимает историю обращений. К моменту, когда вопрос закончен, у сотрудника есть основа для ответа.

Но здесь есть нюанс: первые фрагменты расшифровки могут измениться. Начать поиск по ним полезно, а вот выполнять необратимые действия до уточнения запроса рискованно.

Именно поэтому в корпоративных решениях так важна связка речи, контекста и действий. Что было до этого обращения? Какие данные доступны сотруднику? Что он вправе сделать? Быстро распознанная фраза становится полезной, когда система умеет ответить на эти вопросы.

Подробнее о запуске — Microsoft AI