Новые разделы!
ИИ, квантовые вычисления и много других интересных тем

Заходите в ЦИТадель!
Век живи — век учись

Nvidia открыла веса модели Nemotron 3 Diarization для разделения речи восьми собеседников

Nvidia выпустила 100-миллионную модель Nemotron 3 Diarization, определяющую, кто и когда говорит, в записях и потоковом аудио. Она поддерживает до восьми собеседников, распознаёт одновременную речь и может работать с буфером от 0,32 секунды.

Nvidia представила модель Nemotron 3 Diarization для диаризации — определения временных интервалов, в которых говорит каждый участник разговора. Модель работает с записанным и потоковым аудио, поддерживает до восьми собеседников и учитывает ситуации, когда несколько человек говорят одновременно.

Nemotron 3 Diarization содержит около 100 млн параметров. Она присваивает голосам анонимные метки наподобие speaker_2, но не устанавливает личности участников и не преобразует речь в текст. Для подготовки расшифровок с указанием говорящих её можно объединить с системой автоматического распознавания речи.

Разработчикам доступны рекомендуемые конфигурации с входным буфером 30,4, 1,04, 0,64 и 0,32 секунды. Эти показатели не учитывают время вычислений, передачу данных и обработку другими компонентами; сокращение буфера обычно снижает точность.

В первоначальной версии теста VoiceArena Diarization-Bench модель показала коэффициент ошибок диаризации DER 14,72% против 19,3% у следующей системы. При буфере 1,04 секунды среднее относительное снижение DER по восьми тестовым условиям по сравнению с предыдущей моделью Nvidia составило 41%.

Веса и инструкции по запуску опубликованы на Hugging Face по лицензии OpenMDW 1.1. Модель допускается использовать в коммерческих и некоммерческих проектах.

Источник: huggingface.co

Связь с редакцией