Meta搞了个能"边说边转文字"的AI模型,名字叫Muse Voice Transcribe。
简单说就是你说它转,不用等整段说完才出结果,一小段一小段持续输出,延迟很低。开会记录、通话字幕这种场景直接能用。最夸张的是20多个人同时说话的录音,它也能把每个人分开识别出来。
支持70多种语言,超过1小时的音频也能处理,句子里中英文切换也没问题。开发者通过Meta Model API就能调用,价格每1000分钟3美元,算下来一小时不到2块钱。
Meta说这玩意儿目前在流式语音转文字排行榜上排第一。AI听写这块,越来越卷了。http://t.cn/AX0GmyJD
发布于 北京
