🎧 СБЕР ОТКРЫЛ ОБА ПОЛУШАРИЯ МОЗГА Сбер выкатил две новые речевые модели GigaChat Audio 🎙. ▌ Аудионативная LLM Работает со звуком напрямую, без кривой промежуточной транскрибации в текст. Отвечает на вопросы по аудио, распознаёт, переводит, классифицирует и находит события в длинных записях с точными таймкодами ⏱️.

Контекст до двух часов Загружай встречу или лекцию целиком и спрашивай: «На какой минуте обсуждали бюджет?» — и получай саммари с привязкой к конкретным секундам, а не гадание на кофейной гуще 🎯.

Метрики, которые унижают конкурентов На локализации событий (20–60 минут) модель выдаёт mIoU 48.3. Для сравнения: у Voxtral, Phi-4 и Qwen3-Omni этот показатель жалкие 0.1–0.2, потому что у них нет механизма привязки ко времени 📉. Здесь же временные маркеры вшиты прямо в поток аудиотокенов и обучены на синтетике 🧠. На русскоязычном бенчмарке RuBQ — 60 баллов против 43.7 у Qwen3-Omni 🏆.

GigaAM Multilingual Вторая модель — GigaAM Multilingual. ASR-модель для русского, английского, казахского, киргизского и узбекского языков 🌍. Предобучена на 2 млн часов аудио. Компактная версия на 220M параметров обходит Whisper Large v3 на русском и центральноазиатских языках, будучи в семь раз меньше 🤏.

Бонус для гиков Открыт датасет TimeGround-1M — миллион примеров для обучения привязке событий к таймкодам. Строй своё решение, не благодари 🛠.

Статья по GigaChat Audio уже принята на Interspeech 2026, а голосовое общение на этих технологиях доступно в ГигаЧате прямо сейчас, без установок и танцев с бубном 🚀. 💥 ПОЧЕМУ ЭТО КРУТО? ▸ Конец эпохи «сломанного телефона». Аудионативность означает, что ИИ слышит интонации, паузы и смысл напрямую, а не через текстовый костыль, который теряет 90% контекста 👂✨.

▸ Таймкоды, которые реально работают. mIoU 48.3 против 0.1 у конкурентов — это не маркетинговая лапша, а пропасть в качестве. Ты получаешь точный ответ «на 45-й минуте», а не «где-то в середине» 🎯⏱️.

▸ Давид против Голиафа. Модель на 220M параметров кладет на лопатки гиганта Whisper Large v3. Меньше весит, быстрее работает, лучше понимает региональные языки 🥊📉.

▸ Два часа контекста — это абсолютная свобода. Закидывай многочасовые подкасты или советы директоров. Система переварит всё и выдаст выжимку, пока ты пьёшь кофе ☕️📚.

▸ Open-source щедрость. Веса не прячут за пейволлом. Забрал GigaChat Audio, GigaAM и датасет TimeGround-1M — и пили свои фичи 🎁🔓.

▸ Признание на мировом уровне. Статья принята на Interspeech 2026, что подтверждает: это не просто «очередной релиз», а реальный прорыв в аудио-ИИ 🌍🏆. 💼 КАК ИСПОЛЬЗОВАТЬ В БИЗНЕСЕ? ▸ Автоматизация колл-центров. Анализируй часовые звонки клиентов, находя конкретные моменты жалоб или согласований с точностью до секунды. Никакого ручного прослушивания операторами 📞✅.

▸ Транскрибация и саммари встреч. Загружай запись созвона команды → ИИ выдает структурированный протокол с таймкодами: «Иван предложил бюджет на 15:30» 📝🤝.

▸ Медиа и образовательные платформы. Создавай интерактивные конспекты лекций или подкастов. Пользователь кликает на тему в саммари и мгновенно перематывает аудио на нужный момент 🎓🎧.

▸ Мультиязычная экспансия. Используй GigaAM для обработки контента на казахском, киргизском и узбекском языках с качеством, которое обходит западные аналоги, но стоит дешевле 🌍💰.

▸ Собственные AI-продукты. Бери открытый датасет TimeGround-1M и дообучай модель под узкие ниши: медицинская диктовка, юридические переговоры или техническая поддержка 🛠🚀.

▸ Экономия на инфраструктуре. Компактная 220M модель требует в разы меньше GPU-ресурсов для инференса, чем гиганты вроде Whisper, сохраняя при этом топовое качество 📉💸. ⏳⏳⏳⏳⏳⏳⏳⏳ ⚡️ Робот Рекрутер 👩‍🍼 Это наш ИИ-Продавец ▶️ Это наш Ютубчик #голос


В этом посте были ссылки, но мы их удалили по правилам Сетки

🎧 СБЕР ОТКРЫЛ ОБА ПОЛУШАРИЯ МОЗГА
Сбер выкатил две новые речевые модели GigaChat Audio 🎙.
▌ Аудионативная LLM
Работает со звуком напрямую, без кривой промежуточной транскрибации в текст | Сетка — социальная сеть от hh.ru