返朴
26-09-06 11:01 微博认证:科学新媒体《返朴》的官方微博

【对话英伟达李柏依:物理智能的基本单位可能是运动】
2020 年底,李柏依在康奈尔大学的博士生涯进入第三年,也走进了一段研究上的困顿期。

此前,她一直从事表征学习研究,但在那段日子里,她越往前走,似乎越不知道这条路还能通向哪里。也就是在那段时间,她开始接触多模态学习。当时,多模态还不是视觉研究的主流热点,三维视觉吸引了更多关注。她向同学说起自己正在做多模态,得到的反应往往礼貌而寡淡。

但她隐约觉得,当时按照固定类别完成检测和分割的视觉系统太“死”了:输入是预设的,输出也是预设的,像功能机上的实体按键,只能完成事先规定好的操作。有没有可能像智能手机一样,让输入变得任意,让视觉系统根据人的意图灵活地理解世界?
这个问题把她引向视觉与语言的对齐,也让她恰好赶上了 CLIP 发布后多模态研究爆发的前夜。

几年后,多模态已经成为 AI 领域最核心的方向之一。李柏依也从那个“不知道该往哪里走”的博士生,成为英伟达研究院和加州大学伯克利分校的研究员与研究负责人,带领团队推进 Foundation Motion,探索机器能否通过运动理解物理世界。

她的研究从计算机视觉出发,经过多模态学习,延伸到自动驾驶和具身智能。应用场景不断变化,贯穿其中的问题却始终指向同一条路径:机器能否从不同的感知信号中,形成一种可泛化、可交互、能够支持行动的世界表征?从“看见什么”,到“正在发生什么”,再到“接下来可能发生什么”,最终走向“为了目标应该做什么”。

2026 年,李柏依入选《麻省理工科技评论》“35 岁以下科技创新 35 人”中国区名单。这次采访从她的研究经历谈起,话题也逐渐延伸到研究究竟是如何被推进的:怎样判断一个方向是否值得长期投入,一次失败的实验能够留下什么,以及个人的判断如何在团队中被验证和修正。她谈多模态、自动驾驶和具身智能,也不断回到一个更基础的问题:面对尚无确定答案的方向,研究者如何形成判断,又如何根据新的证据改变判断。
以下是 DeepTech 与李柏依的对话。
阅读全文:http://t.cn/AX0pWdLH
#人工智能##上微博涨知识#

发布于 北京