蚁工厂
26-07-31 08:57 微博认证:科技博主

Hugging Face 开源了一个低延迟语音智能体框架
地址:github.com/huggingface/speech-to-speech
主要是串联这个过程:麦克风音频 → VAD → 语音识别 STT → 大模型 LLM → 语音合成 TTS → 播放音频
里面的语音识别、LLM、语音合成都可以自己指定来源,可以本地可以云端。
#How I AI# ​

发布于 山东