- Модель обеспечивает более высокие показатели выполнения задач в шумной среде, имитирующей реальные условия, за счет фильтрации фоновых звуков, таких как шум транспорта или телевизора, при сохранении при этом способности реагировать на инструкции.
- Возможности выполнения инструкций были значительно улучшены, что позволяет агентам оставаться в рамках оперативных ограничений даже во время неожиданных поворотов разговора.
- Улучшенная задержка и более точное распознавание акустических нюансов, таких как высота тона и темп, делают разговоры в реальном времени более плавными и естественными по сравнению с предыдущей моделью Flash Native Audio 2.5.
- Данная модель поддерживает более 90 языков для многомодального общения в режиме реального времени.
- Разработчики, включая Stitch, уже используют API для создания голосовых агентов, которые позволяют пользователям проектировать с помощью голоса, в то время как агент «видит» холст и выбранные экраны.
Общая картина: развитие голосового ИИ в реальном времени сталкивается с проблемами задержки и надежности, которые нарушают ход разговора. Gemini 3.1 Flash Live, ориентированный на распознавание акустических нюансов и фильтрацию шума, устраняет разрыв между голосовыми агентами демонстрационного качества и готовыми к производству системами, работающими в сложных условиях реального мира. Для разработчиков эта предварительная версия сигнализирует о том, что многомодальный разговорный ИИ переходит из разряда исследовательских новинок в разряд развертываемой инфраструктуры — если, конечно, преимущества в плане снижения задержки сохранятся в масштабе.