狼与接听人
26-09-06 13:52 微博认证:搞笑幽默博主 微博原创视频博主

怎么说呢,「AI会这么写是因为它最常用/人们认为它最好」,这个观点其实对AI训练原理有一些误解……对文字敏感的人应该能感觉到,如今的AI写作实际上自成一派,虽然会随着使用者的输入而有所差别,但那些「让人感觉到是AI」的所谓「AI味」,并不能归类到任何现有的文风流派里去。比如再爱用否定句的人也不会写出这么多的“不是而是”和“她没说话”“我没去”,再爱用比喻的人也不会以这么诡异的方式写比喻,而否定句和高频比喻也绝对不是人类写作最突出的特点。

因为模型实际上没有那么聪明,它不是什么都学得会的。具体到风格上的这种精细训练,是无法通过发给它一堆优秀文本让它直接照着学来达成的。训练过程比如Reward Learning,需要:1. 一批优质数据;2. 一套精细的奖励标准,做得好加分做得不好就减分;3. 反复多次训练,模型根据分数来不断调整自己的回答。这里最大的问题就是【奖励标准】:我们当然知道哪些文本更好,但怎么去量化这种感性的「好」?最直接的方式就是,拆解成思维深度、修辞手法、句式多样性这些硬性指标。然后再训练一个裁判模型,让它按照这些指标去给每个回答打分。

然后这就又带来了三个问题:1. 模型会hack,完全混沌邪恶,它才不知道你训练它的目的是什么呢,它发现这么说话能加很多分,它就每句话都这么说;2. 裁判模型也是模型,它根据人类标准打出来的分数,不一定符合真正的人类审美;3. 更终极的问题是,文字真的能够被拆解成一套硬性指标吗?所有让人觉得美丽和感动的文字,真的能被如此确定地分析出优点一二三四吗?

当然现在搞大模型的是全世界最聪明的人,这些问题正在以越来越快的速度减少。但这样的训练原理就决定了,AI风格并不是对最好的、最常见的人类风格的学习,而是对「最容易学会」的「人类标准」的学习,是一个它自己创造的加分项大杂糅。不是而是的句式大概率能在思考深度类的指标上获得更高的分数,每句话都要比喻是因为能更高效地拿到修辞分,“先说结论”和现在的短句风格,我猜可能是对早期版本过多长难句问题的调整结果。在几百万次的重复之后,它就从不知道哪一刻开始产生了新的习惯,然后训练员又会开始新一轮的斗争。

最后这种大杂糅又在充满AI的内容环境中,污染了普通人类的语言能力,让越来越多的人习惯于看或者用这种方式讲话。。。我真是感到非常恐怖

发布于 美国