agentzh
25-02-12 13:37 微博认证:OpenResty Inc 创始人

从前我以为通过错误反馈,可以让大模型不断修正其输出。但对于真正复杂的问题,即使是目前最好的大模型在反馈提示下却并不一定是收敛的,可能陷入死循环出不来,或者误入花园小径,迷途不知返,又或者越改越坏。Deepseek 的研究人员也承认 R1 会有这样的问题。传说中的“Aha moment”真是可遇而不可求。真实世界还是很血腥的,比那些奥数题和 evals 测试集要血腥多了。我现在甚至经常避免让 LLM 自我纠正,因为大模型自己越改越坏的风险在真实世界中是很大的。[允悲] #ai创造营# #LLM# #DeepSeek为何一夜爆火#

发布于 美国