向度之桥
26-01-04 14:48 微博认证:科技博主

最近AI圈都在讨论同一件事:图灵奖得主LeCun离开Meta了。

如果你只看到这个新闻本身,可能会觉得这不过是又一次高管变动。
然而当我把他离职后说的那些话串起来看,突然意识到这背后藏着一个更大的问题。

这个问题关乎整个AI行业的走向,也关乎我们每个人对技术未来的判断。

先说导火索。
去年4月,Meta发布了Llama 4,这本该是一次展示技术实力的时刻,结果翻车了。

外界开始质疑Meta在基准测试上动了手脚,也就是为了让成绩好看,团队在不同的测试项目上用了不同版本的模型。
哪个版本在某个测试上跑分高,就用哪个版本去报那项成绩。

这种做法在学术圈有个不太好听的名字,叫「cherry-picking」,翻译过来就是挑樱桃,专挑好看的摘。

之前这只是外界的猜测,现在LeCun站出来了,直接说团队对基准测试结果进行了「捏造」。
这是第一次有内部核心人物亲口承认这件事。

基准测试是整个AI行业的「通用语言」,研究者用它来比较不同模型的能力,投资人用它来判断一家公司的技术水平,开发者用它来决定选用哪个模型。
当这个「通用语言」被污染了,所有基于它做出的判断都会出问题。

接下来发生的事情,就更有意思了。
扎克伯格开始重组团队,他从Scale AI挖来了创始人Alexandr Wang,让他来领导新成立的「超级智能实验室」。

Alexandr Wang今年28岁,而LeCun,65岁,图灵奖得主,Meta首席科学家。
突然之间,一个比自己小37岁的人成了自己的上司。

当被问到怎么看这件事时,LeCun的回答说他习惯和年轻人共事。
当年刚加入Facebook的时候,公司工程师平均年龄27岁,他的年龄是他们的两倍。

但紧接着,他又补了一句:你不能告诉研究人员该怎么做,更不能告诉像我这样的研究人员该怎么做。
这句话听起来是在说自己,实际上,他是在说一个更普遍的问题:外行能不能指导内行?

LeCun对Alexandr Wang的评价是这样的:他学得很快,知道自己不知道什么。但他没有科研经验,不知道如何进行科研,也不知道科研人员会喜欢什么或不喜欢什么。

管理科研人员和管理工程师、产品经理是完全不同的事情。
科研的本质是探索未知,而探索未知这件事,很难用KPI来衡量,也很难用deadline来催促。

LeCun预言,Meta AI接下来会有更多员工离职。
这个预言正在应验。

如果只是管理风格的冲突,或者刷榜丑闻的余波,事情可能还没那么严重。
真正让LeCun无法忍受的,是他认为Meta正在集体沉迷于一条错误的方向。

他的原话是这样的:那批公司为了冲刺超级智能而招来的人,完全被大语言模型洗脑了。
这话说得相当重。

要理解这个分歧,我们得先搞清楚一件事:大语言模型(LLM)的本质是什么?

假设你从来没见过猫,但你读了一万本关于猫的书。
你能描述猫的毛色、叫声、习性,甚至能写出一篇关于猫的论文。

但有一天,一只真猫跳到你面前,你可能根本不认识它。

这就是LLM的局限,它是通过语言来理解世界的。
它知道「猫会跳」这个说法,但它不真正理解「跳」是什么意思,它没有在脑子里模拟过一个物体从A点移动到B点的过程。

LeCun的观点是:语言本身就是束缚。要实现人类水平的智能,必须理解物理世界的运作方式。
换句话说,光会「说」是不够的,还得会「想象」。

这就是他提出「世界模型」概念的原因。

什么是世界模型?
想象一下你在走路,前面有个水坑,你会绕过去,因为你的大脑在你真正踩进去之前,就已经「模拟」了踩进去会发生什么:鞋子会湿,袜子会不舒服,可能还会滑倒。

这个模拟过程,就是世界模型在起作用。
你不需要真的踩进去才知道结果,你的大脑建立了一个关于物理世界的「内部模拟器」,可以预测行动的后果。

但现在的LLM没有这个能力。
它可以告诉你水坑是什么,踩进水坑会有什么后果,但它并没有真正「想象」过这个过程。
它的所有知识都来自语言描述,而不是对世界的直接建模。

LeCun想做的V-JEPA世界模型,就是要给AI装一个「脑内物理沙盒」。

具体怎么做呢?
第一步,用超过100万小时的互联网视频做大规模自监督预训练。
让模型通过观看视频,学会理解物体是什么、它们怎么动、动的规律是什么。

第二步,用少量机器人交互轨迹,让模型学会「如果我这么做,世界会怎么变」。
这就从单纯的「看懂」,进化到了「能规划」。

传统的生成式训练常常逼模型还原每个像素,但JEPA的思路更务实:不抠像素细节,预测「抽象状态」。

打个比方,你看一段视频,一个球从桌子边缘滚落。
普通的视频生成模型会试图预测球落下时每一帧的画面是什么样子。

但世界模型不这么做,它只需要理解:球在桌子边缘,重力会让它往下掉,它会落到地上然后弹几下。

它预测的是「会发生什么」,而不是「看起来像什么」。
这是一个根本性的区别。

你可能会想,这不就是学术圈的路线之争吗?跟我有什么关系?
关系大了。
如果LeCun是对的,那现在所有押注在LLM上的公司,都在往一条死胡同里冲。

当然,这并不是说现有的大语言模型没用。
ChatGPT确实改变了很多人的工作方式,但问题在于,沿着这条路继续走下去,能不能达到真正的超级智能?
LeCun的答案是否定的。

他认为,LLM虽然有用,但从根源上受限。
它能帮你写文章、改代码、回答问题,但它永远不会真正「理解」世界。

这个观点有没有道理?我觉得可以从另一个角度来思考这个问题。

人类婴儿在学会说话之前,就已经对物理世界有了基本的理解。
几个月大的婴儿就知道,一个物体被遮挡住并不代表它消失了。
这种能力不是通过语言学来的,而是通过观察和与世界的互动。

换句话说,人类智能的底层是对世界的物理建模,语言只是在这个基础上建立起来的。
如果这个顺序是对的,那么只通过语言来训练AI,确实可能是本末倒置。

发布于 上海