英伟达最近推出了一款叫 Nemotron 3 Diarization 的语音 AI 模型,通俗来说,它的本事就是多人说话录音自动区分是谁在讲话。
日常开会录音最头疼的一件事,就是一堆人一起聊天,经常好几个人同时开口,录音回放只能听见一团嘈杂的声音,很难分清哪句话是谁说的。这个模型就是专门解决这个痛点。它最多可以识别 8 个人同时在场的对话,就算几个人说话重叠、抢话,也能把每个人的发言拆分开,标注清楚每个人说话的时间顺序。
厉害的一点是,这个模型体量很小,参数量只有 100M,不需要很高配置的电脑就能跑起来。很多语音识别模型想要做到多人区分,往往需要巨大算力,普通电脑根本带不动。这个小模型门槛低,普通企业、小工作室都能用。
模型已经开源放到 Hugging Face 平台,任何人都能下载试用。可以用到线上会议记录、访谈录音整理、播客转文字这些场景。以后开会录音,AI 能自动把每个人的话分开整理成文稿,省去人工逐句分辨发言人的大量时间。
发布于 福建
