NVIDIA представила модель Nemotron 3 Diarization для разделения аудио по спикерам . Она возглавила дебютный бенчмарк VoiceArena Diarization-Bench. Модель заменяет громоздкие каскадные пайплайны единым сквозным проходом, что идеально для транскрибации, анализа встреч и подкастов. Это открытый стандарт для локального использования.

Эндоу-энд архитектура: Единый сквозной проход вместо раздельных шагов. Основа — 100-миллионный энкодер на 31-слойном Transformer с Rotary Positional Embeddings.

До 8 спикеров: Точное разделение до восьми уникальных голосов, включая случаи сильного наложения.

Стриминг и офлайн: Один чекпоинт обрабатывает многочасовые записи и потоковое аудио в реальном времени с настраиваемой буферизацией.

Точность: Уровень ошибок (DER) ~14.72% в VoiceArena, опережение ближайших конкурентов на ~24%.

Технические требования: Вход: моноаудио 16 кГц (.wav, .flac, .opus, .mp3). Выход: покадровый тензор вероятностей активности спикеров.

Лицензия: OpenMDW 1.1. Разрешено коммерческое использование в экосистеме NVIDIA NeMo на GPU архитектур Ampere, Ada Lovelace, Hopper и Blackwell.

Модель доступна на Hugging Face.