这个GLM-4-Voice可真是AI界的小机灵鬼儿!不仅能中英互译,还能陪你聊天,关键是还能根据你的心情、喜好,变换声音风格。放出来就开源了(在github上),另外也在清言上可以体验(不过为了速度性能有点损失)。大家先玩一玩,我们持续改进哈。
来,给各位老铁介绍一下GLM-4-Voice的三大法宝:
GLM-4-Voice-Tokenizer:这个小能手,把声音变成小点点,一秒音频才用12.5个小点点表示,省事儿!
GLM-4-Voice-Decoder:这位大兄弟,擅长把小点点变回声音,10个小点点就能开工,延迟?不存在的!
GLM-4-Voice-9B:这位大佬,不仅会玩儿声音,还能把声音和文字玩儿得666,智商爆表,还能给你捏个声音出来!
这货是怎么炼成的呢?先把它分成两个小任务,一个负责听声音回文字,一个负责看文字变声音。然后,用海量的音频和文字数据喂饱它,让它成为声音界的学霸!
最后,为了让聊天更丝滑,它还学会了边想边说,根据你的声音指令,随时变换声音,保证聊得嗨皮,还不会卡壳!
(text by glm-4)
发布于 北京
