42号电波
26-08-21 14:37 微博认证:AI博主

大模型的「上下文学习」,被搬进了机器人。

GPT-3 当年有个标志性能力,给几个例子、不用重新训练,就能执行没见过的新任务。这个「当场学会」在具身智能领域说了很多年,一直没做通。8 月 19 日,一家叫 Generalist 的公司发布新一代具身基础模型 GEN-1.5,想把这件事做通。

它的做法是把 3 到 12 秒的单次演示放进模型的 30 秒记忆窗口,模型数秒内学会任务,全程不更新任何权重。团队给这种「用演示当提示词」起了个名字,叫物理提示(physical prompting)。

实验结果放在边界里看:在 10 项短时程操作任务上,纯看演示平均成功率 59%;换成 5 分钟数据加 10 步梯度更新,拉到 83%。任务偏短、成功率还称不上稳定,团队自己也承认,上下文学来的技能现在比微调更脆弱。

更有意思的是它泛化的方式。把两段独立演示拼进上下文,模型会自己补出衔接动作串成连续行为;一段完全在仿真里录的演示,可以直接提示真机,而 GEN-1.5 的预训练里没有任何仿真数据。

团队说,他们没刻意去造「单样本学习者」,这是连续预训练 8 个月自己「长」出来的能力。

如果和机器人的交互真能简化到「给它看一遍该怎么做」,那么,任何人都能操作它了。

#GEN-1.5##Generalist##具身智能#

发布于 上海