宝玉xp
24-12-03 07:26 微博认证:前微软Asp.Net最有价值专家 2025微博年度新知博主 科技博主

转译:引入人工智能进入物理世界的"独角兽"企业

凭借在机器人学习领域的惊人突破,Physical Intelligence公司组建了一支实力雄厚的团队,成功筹集4亿美元资金。
在旧金山使命区的一扇金属门上,一个低调的"π"符号暗示着门后正在进行的创新实验。

推开这扇门,映入眼帘的是一派热火朝天的人机协作场景。一名女性研究员正用双手操控操纵杆,指挥桌面上的机械臂将T恤整齐叠放。房间一角,另一名研究员正在调试装有摄像头的塑料夹具。四周散布着各式机器人零部件。
这里是Physical Intelligence(简称PI或π)的研发基地。这家新兴科技公司立志通过深度人工智能技术为机器人注入智慧,彻底革新机器人领域。投资者对其寄予厚望,已投入数亿美元资金,期待它能带来颠覆性突破。近日,Physical Intelligence宣布完成新一轮4亿美元融资,投资方包括OpenAI和亚马逊创始人杰夫·贝索斯,公司估值已突破20亿美元。

在二楼的玻璃会议室内,公司首席执行官Karol Hausman分享了他的愿景:"如果让你操作一台全新的机器人,经过简单练习就能上手。我们的目标是让人工智能也具备这样的能力。"

Physical Intelligence的核心理念是:通过收集和分析机器人执行各类任务时的传感器数据和运动数据,将这些信息输入其主要AI模型,从而赋予机器人类人的物理认知能力和灵活性。正如Hausman所说:"这就是我们'破解'物理智能的关键所在——只需接入我们的模型,就能让机器人变得智能。"

虽然近年来人工智能取得长足进步,但让机器人真正拥有智慧和能力仍是一大难题。当前工厂或仓库中的机器人依然只是按部就班执行预设程序的高级自动机器,缺乏真正的智慧与创造力。

核心团队成员齐聚会议室:除了Hausman,还有加州大学伯克利分校副教授Sergey Levine、曾与Hausman在谷歌共事的温和睿智的Brian Ichter,以及通过视频连线参会的斯坦福大学助理教授Chelsea Finn。

他们深信机器人领域即将迎来革命性突破,这种信念源自其他人工智能领域的最新进展,特别是支撑ChatGPT等对话型AI的大型语言模型(LLM)所展现出的惊人能力。他们相信,这种突破性技术很快就能在物理世界得到应用。
2018年是人工智能语言能力发展的重要转折点。当时,OpenAI展示了一种名为Transformer的机器学习模型,它能够根据给定的开头自动生成连贯的文本内容。多年来,计算机科学家一直在努力编写程序以应对语言的复杂性和模糊性。OpenAI的生成式预训练Transformer(GPT)模型通过海量的图书和互联网数据训练,不断进化,最终实现了自然对话和解答各类问题的能力。

2022年初,当时仍在谷歌工作的Hausman和Ichter与Levine、Finn等研究人员共同证明,LLM可以作为机器人智能的基础。虽然LLM无法直接与现实世界互动,但由于其训练数据涵盖范围广泛,包含了大量关于物体和场景的信息。这种能力尽管不够完美,但已足以让机器人制定简单的行动计划。

Hausman团队将一个LLM连接到谷歌总部模拟厨房中的单臂机器人,使其具备解决开放性问题的能力。当收到"我把可乐洒在桌子上了"这样的指令时,机器人能够利用LLM自主规划合理的行动步骤:找到并拿起易拉罐,将其扔进垃圾桶,然后取来海绵擦拭桌面——整个过程无需传统编程指令。

随后,团队又将一个经过文本和图像训练的视觉语言模型接入同一机器人,进一步提升了它对周围环境的理解能力。在一次实验中,研究人员在机器人周围放置了不同名人的照片,并要求它将一罐苏打水递给泰勒·斯威夫特。Finn笑着说:"泰勒的形象并未包含在机器人的训练数据中,但视觉语言模型已经认识她。"

同年晚些时候,正值ChatGPT开始走红之际,团队在新西兰奥克兰的一次学术会议上展示了他们的机器人成果。与会者有机会通过输入指令远程操控位于加州的机器人。机器人展现出的问题解决能力令观众惊叹不已,与此同时,关于ChatGPT更深远影响的讨论也如火如荼。

尽管LLM能够帮助机器人进行交流、识别物体和制定计划,但在具体行动方面仍受限于对物理世界认知能力的不足。对人类来说,知道如何抓取一个形状不规则的物体是再简单不过的事情,因为我们天生就理解三维物体的特性以及如何用手指操作。研究人员意识到,如果能大规模采集和学习动作数据,ChatGPT的非凡能力或许可以转化为类似的物理技能。正如Finn回忆道:"当时的氛围充满了憧憬。"

2023年,Physical Intelligence的联合创始人之一Quan Vuong协调21家机构的研究人员,利用同一个Transformer模型训练了22种不同的机器人手臂完成各类任务。结果令人振奋。Finn表示:"在大多数情况下,新模型的表现超越了研究人员专门为各自机器人开发的模型。"

正如人类从幼年时期笨拙地触摸物体,到多年后能够熟练弹奏钢琴一样,通过输入海量训练数据,机器人或许也能掌握非凡的新技能。

随着Agility、Figure等初创企业以及现代汽车、特斯拉等大型公司纷纷推出人形机器人,机器人革命的愿景愈发清晰。虽然这些机器人的实际能力仍然有限,但远程操控演示让它们看起来更加强大。支持者们承诺未来还会有更大突破。特斯拉CEO埃隆·马斯克甚至大胆预测,到2040年人形机器人数量将超过地球人口——这种说法显然需要谨慎对待。

为一家专注基础研究突破的公司投入数亿美元也许看似冒险之举。但OpenAI已经证明了巨额回报的可能性。OpenAI不仅参与了Physical Intelligence的种子轮融资,还通过其创业投资基金参与了最新一轮融资。"投资的核心是人才,"一位熟悉OpenAI投资策略的内部人士表示。"他们拥有全球顶尖的机器人领域人才。"

OpenAI显然也在加大机器人领域的投入。近日,曾在Meta主导虚拟和增强现实头显开发的Caitlin Kalinowski在LinkedIn上宣布,她已加入OpenAI,负责包括机器人在内的硬件开发工作。

OpenAI CEO Sam Altman的好友、Physical Intelligence投资人兼联合创始人Lachy Groom也加入了会议室团队,共同探讨商业发展计划。身着一件看似价值不菲的连帽衫的Groom显得年轻有为。他强调,Physical Intelligence拥有充足的资金来推进机器人学习领域的突破。"我刚刚和Kushner通过电话,"他提到,这位Kushner是Thrive Capital的创始人兼管理合伙人Joshua Kushner,该公司主导了Physical Intelligence的种子轮融资。值得一提的是,Joshua是美国前总统特朗普女婿Jared Kushner的兄长。

还有其他公司也在追求类似的突破。例如,由卡内基梅隆大学机器人专家创立的初创公司Skild于今年7月募集了3亿美元资金。"就像OpenAI为语言开发出ChatGPT一样,我们正在为机器人打造通用大脑,"Skild的首席执行官、CMU助理教授Deepak Pathak如是说。

然而,并非所有人都认为这一目标能像OpenAI破解AI语言难题那样轻易实现。

首先,目前还没有类似用于训练LLM的互联网级文本和图像数据那样的大规模机器人动作数据库。而且,实现物理智能突破可能需要更为庞大的数据量。

卡内基梅隆大学机器人专家Illah Nourbakhsh指出:"与字母表中的字母相比,物理世界中运动和活动的自由度要复杂得多。我们在物理世界中的自由度远远超过文字的排列组合。"Nourbakhsh并未参与Skild的研究工作。

加州大学伯克利分校专注于机器人人工智能应用的学者Ken Goldberg警告说,围绕数据驱动机器人革命和人形机器人的热情已达到近乎炒作的程度。他表示:"要达到预期的性能水平,我们需要'传统工程学',包括模块化、算法和度量标准。"

麻省理工学院计算机科学家、丰田研究院机器人研究副总裁Russ Tedrake表示,LLM的成功促使包括他在内的许多机器人学者重新审视研究重点,转向更具前瞻性的机器人学习目标。但他承认,这一领域仍面临巨大挑战。

谈及大规模学习的构想时,Tedrake说:"解锁机器人通用能力仍然是一个梦想,尽管已经有人展示了一些初步成果。"

Tedrake指出,突破的关键可能在于教会机器人以新的方式学习,比如通过观看YouTube上的人类行为视频。他设想这种方法可能会让未来的机器人表现出一些独特的行为,例如掌握TikTok舞蹈或瓶子翻转的绝技。他解释说,这种方法最初只能教会机器人一些基本动作,如伸手取物,还需要结合实际机器人操作中收集的数据。

"当你我用智慧的眼光观看YouTube视频时,我们能够推断出人们使用的力度,"他说。"有些学习体验只能通过机器人与物理世界的实际互动才能获得。"

Hausman带我下楼,展示Physical Intelligence计划如何在更大规模上推进机器人学习。一对机器人手臂正在使用公司的算法尝试独立折叠衣物。机器人手臂迅速而坚定地抓起一件T恤,然后像孩子一样缓慢而笨拙地将其折叠,最后轻轻放下。

Hausman解释说,某些任务(如折叠衣物)对于训练机器人特别有价值,因为这类家务涉及处理各种各样的物品,这些物品通常会扭曲或起皱,在操作过程中会发生弯曲和变形。"这是一个很好的训练任务,因为要真正掌握它,需要很强的泛化能力,"他说。"即使收集了海量数据,也无法涵盖衣物可能出现的所有状态。"

Physical Intelligence计划通过与电商和制造企业等合作伙伴合作来收集更多数据,这些企业的机器人正在执行各种任务。该公司还计划开发定制硬件,例如配备摄像头的机械夹爪;虽然具体用途尚未公布,但它可能用于通过人类日常任务进行众包训练。

参观演示后,我离开Physical Intelligence时,脑海中充满了对更智能机器人的遐想。重返阳光下的街道,我不禁思考,世界是否已经准备好迎接像ChatGPT这样的技术进入物理世界,接管众多实体任务。这不仅可能彻底改变工厂和仓库的运作方式,为经济带来新的活力,也可能引发人们对人工智能自动化潜力的更广泛担忧。

几个月后,我再次联系Physical Intelligence,发现团队在机器人技术上已取得一些令人瞩目的进展。

Hausman、Levine和Finn挤在同一个Zoom窗口中,介绍说公司利用海量训练数据开发出了首个模型,已经掌握了50多项复杂的日常家务任务。

三人向我展示了几段视频:一台移动机器人正在清空烘干机;一个机器人手臂在清理杂乱的厨房桌面;还有一对机器人手臂现在已经能够熟练地折叠衣物。机器人的动作让我印象深刻,特别是那种甩动机械手腕抖平短裤的动作,看起来十分接近人类的操作方式。

实现这种通用能力的关键不仅在于庞大的数据量,还包括将LLM与一种源自AI图像生成技术的模型相结合。Levine以OpenAI的第一个大型语言模型为参照说道:"这还算不上ChatGPT,但可能已经达到了GPT-1的水平。"

同时,机器人也会出现一些奇怪的、或许更像幼儿的错误行为。比如,有的机器人会将鸡蛋装得过满,然后强行关闭盒子;另一个机器人会把容器从桌上推下,而不是将物品放入其中。对于这些问题,三位研究者并不感到担忧。Hausman充满信心地说:"对我们来说,最令人振奋的是我们找到了这样一个通用框架,它已经展现出了一些真正令人期待的生命迹象。"

文章来源 wired :http://t.cn/A6mxeV8N

发布于 美国