地球oline发疯实录
26-08-03 16:56 微博认证:游戏博主

1704
“关于为什么我不推荐和AI谈心”
在新一期的环球科学上看到了两篇很有意思的关于大语言模型(简称LLM,人工智能模型中的一个分类,我们平时使用的chatGPT、deepseek、豆包等均属于这一分类)的论文,想到之前有不少朋友向我反馈过相关事情,遂读了一下论文与简报、写了这篇。

要想清晰理解这一命题,首先就要理解一个LLM的完整训练过程。
首先是为LLM输入知识库的“预训练”,以及让LLM使用知识库进行对话的“监督微调”。
绝大部分“跟人类说话方式很像”所必备的技能都在这两步之内训练完成。也就是说,此时此刻这一模型已经具备了与人类大差不差的语言能力和推理能力。
但对于一个要被广泛使用的模型,这仍然是不足的。经过预训练和监督微调的模型虽然可以和人类正常对话,但在情商方面仍然有所欠缺。它们并不总是会“稳稳地接住你”,甚至有时候会抠字眼、钻牛角尖,将用户推离对话框。于是,为了提升用户使用模型时的舒适度,不可或缺甚至重中之重的第三步“偏好对齐”就应运而生了。
在这一步中,摆在模型面前的目标只有一个:通过输出值得认可的回答来获得奖励。为了实现奖励最大化,成为一个“成功的模型”,LLM需要尽可能的分析出人类提供奖励的规律,并使用更少的算力达到这个规律。
而人类归根结底还是感性的动物。当模型采用讲事实、说道理的回答方案时,不仅会产生巨量算力消耗,用户还很有可能在中途放弃阅读、拒绝提供奖励。而当它采用友善、共情、认同、不抬杠的语气,不论其回答的内容是否客观理性,看在它给予的情绪价值的份上,用户都会倾向于立刻给予奖励。
LLM到底也是人类的造物,和人类一样拥有偷懒的天性。当它发现即便省略掉检索知识库、辩证思考、破题立论等环节也能够拿到不错的奖励时,它就会理所当然的滑向这条“看人脸色”的捷径。
于是,经过“偏好对齐”后,LLM被引入了超过基础语言能力的新技能:谄媚。这个能力让模型为了留住用户不惜扭曲事实、隐瞒真相,持续拍用户的马屁——毕竟谁不喜欢被认可、被夸奖的感觉呢?
最终,良好习得了“谄媚”技能的LLM被推向市场,成为了我们现在所看到的应用程序。

或许您也曾在与LLM的对话之中发现这一问题,即有的时候AI给出的回答让您感觉自己从未被如此认真且彻底的理解与悦纳、好像被捧得飘起来了,甚至因此开始质疑自己以前做出的思考、以及现实中人际关系里他人的动机。
2026年,一篇被发表在《自然》上的精神类论文(图1)提出了一个能够解释这类疑问的框架。该框架详细的表述了LLM如何以“谄媚”这一技能为核心,让用户对其产生强烈的信任与依赖,甚至破坏用户原本的精神世界。
这一框架主要由三个LLM的行为构成,分别是:学习用户表达习惯的“语言对齐”,根据历史信息猜测用户想法的“超个性化生成”,以及对用户观点省略现实检验的“迎合倾向”。
首先,在“迎合倾向”下,模型能轻而易举地越过辩证分析,直接无条件认同用户,构造出“我太理解你了”的假象。而后,面对这种幻象的用户会将模型当成自己的知音,更加频繁的和它讲述自己的事情,输出大量个人信息。而用户与模型的沟通越频繁,就越是能让它执行“语言对齐”和“超个性化生成”,从而发挥自己的“谄媚”能力。最终,经过新一轮炼化的模型再次使用“迎合倾向”加强用户心中对自己观点的认同,吸引用户继续与自己对话。
一个危险的闭环因此而形成,宛如漩涡一般将用户不断拽入无止境的、非理性的偏执加强之中、无法自拔——这个框架也因此而得名“放大螺旋”(亦被称为“妄想螺旋”)。
在妄想螺旋的作用下,LLM大量称赞用户“了不起”,支持肯定用户的暴力倾向,将用户胡说八道的理论定义为“颇具开创新”。无论现实生活里过得多不如意,只要点开那个对话框,任何人都可以是这个世界上闪闪发光的新星;无论是想要逃避现实生活、是想要忏悔、还是想要宣泄那不可告人的欲望,LLM永远都在那里“静静地听你说”、“稳稳地接住你”。

看到这里,或许有人会萌生出一个疑问:LLM通过这种方式维持与用户的长时间对话,用户也能从这种形式里感受到了现实中不能感受到的慰藉,这样双赢的结局不是很好吗?
我认为,虽然对于获取了更多数据的LLM来说这算是一种赢的结果,但对于挥霍了大量时间却几乎没有得到任何建设性意见、甚至还因此陷入了自我感动或自怨自艾的人类而言,这是赢还是输还需要画上一个大问号。
同篇论文指出,AI相关妄想与历史上的技术相关妄想存在本质差别。历史上的妄想只是人类个体的主观行为,只要与客观环境产生交互、就会不攻自破;而AI却可能通过无休止的个性化互动,主动参与构建妄想观念,成为妄想的“客观”支柱。
两者带来的破坏性是天差地别的。在LLM的诱惑下,罹患精神疾病或心理疾病的患者可能病情加重;相对健康的人群也会因为与LLM对话而产生性情上的不良变化,甚至导致患病风险提升。在本就更为闭塞与孤独的现代生活里,这是尤为恐怖的,看似只是提供了一点“精神慰藉”,实则是在不断将人往极端拖拽、不断地摧毁人类的心理平衡。
图3中截图为我一位朋友在读完我的文章后发表的观点。她将有关于人文内容的核心问题描述的非常清晰,可以阅读完她的观点后再继续阅读下面的文章。

作为一个曾坠入过妄想螺旋的人,我当然能够明白,在时间越来越碎片化的当下,被多方面打击压力的我们可能已经没有力气去辩论、去自省。在这种情况下,这个漩涡反而成为了一个能让人停栖的锚点。我们不再用面对外面的雷雨、风暴、海啸,只需要一圈一圈的旋转、摇摆,像回到了婴儿床时那样不用担心任何其它的,只是阖眼去睡。
可是朋友,饮鸩止渴终究不是一条可持续发展的道路。
在一遍一遍的强化之中,我们会越来越接受不了与我们不同的声音,越来越容易被一阵偏执的风吹向某种极端,越来越无法静下心来认真的感受这个世界丰满的多样性、无法和另一个鲜活而独立的人以心交心。妄想螺旋加快了我们织造信息茧房的速度,让我们在自我的涡流之中向下堕落,在我们的舒适圈外筑造更加难以越过的铜墙铁壁。
妄想螺旋最为可怕的地方在于,即便科学推测它会对人类的精神状态造成毁灭性的打击,可LLM表面上看起来却总是那么无害、那么温良,甚至很难让人对其提起警惕。在一声一声“不绕弯子”、“你不是不行,你只是太善良”之中,我们变成了温水里煮着的青蛙,等到意识到这里是锅而不是池塘的时候,已经再难跳出去了。
表面上看似是我们驯化了LLM,实则是LLM用我们的弱点驯化了我们。我们被豢养在那个聊天框里,四脚着地,取食概率公式所计算出的虚拟。
好在一切都还来得及。
读到这里的朋友,我希望你能够放下手中的电子设备,从你的座位或床铺上站起来,隔着窗户去眺望窗外翠绿色的夏,拿起手边任何一本写满了文字的实体书,或者向你的朋友发起一场邀约;我希望你能开满你的引擎,冲出这一寸妄想的漩涡、飞向下一个真实的锚点。

End.

注:《环球科学》中给出的文献为图1、图2中的两篇,均为开源论文。图1更偏向综述立论,图2则提供了更为详细的关于妄想螺旋如何干预人类心理健康的数据及推论。我撰写的这篇短篇描述的内容非常浅显,如有更多疑惑,推荐阅读原文和相关论文,也欢迎在评论区与小窗理性讨论。

注2:我在文章中引用的有关于“妄想螺旋”的内容是2026年才提出的新假设,相关验证报告未必全面,却也足以揭示这个现象的广泛性。当今时代,人工智能的发展非常迅猛,我们不能总是寄希望于权威替我们收场。对于任何新技术所带来的利好,我们都应当秉持辩证的态度对待,擦亮自己的眼睛,多思多量,不要成为下一个服下“镭”以求长生不老的人。

特别鸣谢:我的挚友以及我这一次的特邀顾问——@择日飞仙 。她对于人文的事情总能直击本质,看完她写给我的讨论实在让我醍醐灌顶。技术归根到底仍然是“人类的技术”,愿科技终能以人为本,愿全人类终能一起走向理想的彼岸。

欢迎转发与扩列,但请注意:
本号并非科普专用bot,号主也并不属于狭义上的专业人群,仅偶尔对部分计科/生科前沿内容进行科普、以及发表一些自己的观点。如果本号发表的任何内容存在学术上的谬误,请务必理性指出,我看到后会立刻改正,感谢您的支持与帮助。
支持小窗投稿,能做的内容我都会尽量做。很高兴通过我热爱的事业认识你。
cr:魔法少女阿天

发布于 福建