这几天我不是在研究AI语音嘛,但是我发现了一个细思极恐的事情。
其实聊天AI已经内置了世界上最牛逼的语音能力,无论是豆包,还是chatgpt,他们的语音表达的流畅度,甩任何TTS引擎100条街,别说逼近人类语音,甚至已经超越大多数人的表达水平,只有经过专业演播训练的人类才能媲美。
为什么?背后的技术原理和传统的TTS完全不同。这么说吧,首先,chatgpt的语音回答,它不是TTS那种是基于“字”的理解,而是基于“整段文本”的理解,所以它自己就知道哪里该读重音,哪里还用反问,哪里可以加一个衔接词,哪里可以加上语气....
第二,它也并不是TTS的【先有文字,然后读一遍】,chatgpt的语音和文字,实际上是两个不同的模型。chatgpt用语音和你交流时,根本不走文字模型,它的大脑就是语音的。换言之,AI已经有左右大脑了。
发布于 上海
