爱可可-爱生活
26-09-24 18:09 微博认证:AI博主 2025微博新锐新知博主

多人交谈或抢话时,语音转写往往很难分清谁在何时发言。NVIDIA 最新开源的 Nemotron 3 Diarization 模型就是为此而来。该模型仅 100M 参数,支持最多 8 位发言人的重叠语音检测与时间戳切分,并在 VoiceArena 评测榜以 14.72% 的错误率(DER)位列第一。它兼顾离线批处理与流式实时推理,输入缓冲延迟可在 0.32 秒到 30.4 秒间灵活调节,配合 NeMo 工具包可直接跑通带说话人标签的转写流水线。模型权重与试玩 Demo 现已开放:huggingface.co /blog/nvidia/nemotron-diarization

发布于 北京