介绍 PhoneLLM,一个用于语音代理的开源模型。
GPT 5.6 Terra 在典型语音代理任务上的性能,延迟仅为其 1/3,成本仅为其 1/18。
对于语音代理,我们需要既具有极低延迟又非常擅长工具调用和指令遵循的模型。
这里存在权衡,在构建语音代理时,我们常常不得不在延迟或能力上做出妥协。借助 PhoneLLM(以及使该模型成为可能的训练和数据堆栈),我们正在解决这个问题。
过去几年,前沿模型开发的大部分努力都集中在利用测试时计算。这很棒!各种形状和大小的模型都可用,它们表现得非常、非常出色……前提是你为模型开启了“思考”功能。
但是,如果你的代理需要在语音对话速度下响应,你就不能使用思考模型。
PhoneLLM 是 NVIDIA Nemotron Nano 30B 的全权重微调版本。我们在广泛的现实世界电话和客户支持用例上进行了训练。训练重点是利用优秀的 Nano 30B 基础能力,并在禁用思考功能的情况下教会模型执行典型的语音代理任务。
结果非常出色:准确的工具调用以及在长对话中简洁、切题的响应。
而且速度很快:服务器端测量的 TTFAT 在 B200 上运行 PhoneLLM 时,如果负载较轻,则 <100ms。 :-)
但说正经的,当我们表征模型延迟时,我们使用真实的 Pipecat 语音代理管道进行完整、端到端的批量请求模拟。
你可以在单个 B200 上服务超过 80 个并发代理,P95 端到端 TTFAT <600ms。包括网络开销。这相当于每分钟 LLM 成本约 0.0025 美元。(四分之一美分。)延迟低于当今任何第三方 API 提供的水平。
有关该模型的更多细节,包括
@huggingface
上的权重、如何在 Modal 上点击启动,以及你可以克隆的入门项目仓库,都在该线程中……
http://t.cn/AXp3IrQX
