【Tavus 发布 Sparrow-2,让语音 Agent 学会等待和识别环境声】 #Tavus发布Sparrow2#
和语音 Agent 聊天时,最容易出戏的瞬间之一,就是你刚停下来想一想,它已经抢着回答。
Tavus 新发布的 Sparrow-2 想解决的正是这个问题:它不再只靠静音时长判断一句话有没有结束,而是把语义、语调、停顿、说话人和环境声放在一起理解。
👀 几个关键变化:
- 以 10ms 帧率处理音频,每秒更新 100 次对话状态;
- 80ms 音频约用 7ms 完成处理,上一代约为 30ms;
- 能区分「嗯」等附和与真正打断;
- 用户思考时可等待 6~8 秒,听不清时会主动请求重复。
模型使用 1.6 万段真实对话和 2000 段合成对话训练。Tavus 自建测试显示,在 575 个真实对话事件中,Sparrow-2 的时机判断失败率为 2.1%;面对超过 1 秒的停顿,它有 97% 的情况不会抢话。对比中的 LiveKit 采用可在设备端运行的 v1-mini,并非其最先进模型,因此数据更适合观察 Sparrow-2 的设计方向。
Sparrow-2 现已在 Tavus PAL、API 和企业平台中正式可用。
语音 Agent 真正自然之前,先学会不抢话可能比声音更像人重要。
#语音Agent##对话式AI#
