Французы из Kyutai, авторы первого прототипа полнодуплексной аудио llm-ки, начали делать более классические решения на основе своей технологии. В частности выпустили ASR модель с семантическим VAD. Есть два варианта - англо-французская на 1b параметров и чисто английская на 2.6B. Доступны веса в satfetensors и candle форматах. Обещают, что за счет семантического VAD реальная задержка отклика на окончание реплики в маленькой модельке укладывается в 500мс. В большой - 2.5 секунды. Модель на основе содержания речи и акустических признаков пытается предсказать отсутствие речи на горизонтах 0.5s, 1s, 2s, and 3s. Если я правильно понял из кода инференса, конец реплики ставят если предсказанная вероятность тишины на 2с горизонте больше 0.5. Инференсить можно либо через moshi server, либо через отдельный standalone rust скрипт. Заявляют до 400 одновременных потоков на H100, правда latency при этом уже подскакивает до 2.5 секунд. Но whisper-streaming при тех же характеристиках, по их картинке - держит 5 потоков. Основная архитектурная идея - delay stream modeling. Аудио и текст представляются как два выровненных по времени потока, где текст подается с некоторой задержкой, чтобы реализовать механизм lookahead. Во время обучения модель учится предсказывать оба потока. На инференсе аудио поток фиксируется, и предсказывается только текст. Обещают скоро TTS на том же принципе и статью с деталями. #asr #llm #ml