Новые разделы!
ИИ, квантовые вычисления и много других интересных тем
27.09.2026
Nvidia выпустила 100-миллионную модель Nemotron 3 Diarization, определяющую, кто и когда говорит, в записях и потоковом аудио. Она поддерживает до восьми собеседников, распознаёт одновременную речь и может работать с буфером от 0,32 секунды.
Nvidia представила модель Nemotron 3 Diarization для диаризации — определения временных интервалов, в которых говорит каждый участник разговора. Модель работает с записанным и потоковым аудио, поддерживает до восьми собеседников и учитывает ситуации, когда несколько человек говорят одновременно.
Nemotron 3 Diarization содержит около 100 млн параметров. Она присваивает голосам анонимные метки наподобие speaker_2, но не устанавливает личности участников и не преобразует речь в текст. Для подготовки расшифровок с указанием говорящих её можно объединить с системой автоматического распознавания речи.
Разработчикам доступны рекомендуемые конфигурации с входным буфером 30,4, 1,04, 0,64 и 0,32 секунды. Эти показатели не учитывают время вычислений, передачу данных и обработку другими компонентами; сокращение буфера обычно снижает точность.
В первоначальной версии теста VoiceArena Diarization-Bench модель показала коэффициент ошибок диаризации DER 14,72% против 19,3% у следующей системы. При буфере 1,04 секунды среднее относительное снижение DER по восьми тестовым условиям по сравнению с предыдущей моделью Nvidia составило 41%.
Веса и инструкции по запуску опубликованы на Hugging Face по лицензии OpenMDW 1.1. Модель допускается использовать в коммерческих и некоммерческих проектах.
Источник: huggingface.co