大模型的「上下文学习」,被搬进了机器人。
GPT-3 当年有个标志性能力,给几个例子、不用重新训练,就能执行没见过的新任务。这个「当场学会」在具身智能领域说了很多年,一直没做通。8 月 19 日,一家叫 Generalist 的公司发布新一代具身基础模型 GEN-1.5,想把这件事做通。
它的做法是把 3 到 12 秒的单次演示放进模型的 30 秒记忆窗口,模型数秒内学会任务,全程不更新任何权重。团队给这种「用演示当提示词」起了个名字,叫物理提示(physical prompting)。
实验结果放在边界里看:在 10 项短时程操作任务上,纯看演示平均成功率 59%;换成 5 分钟数据加 10 步梯度更新,拉到 83%。任务偏短、成功率还称不上稳定,团队自己也承认,上下文学来的技能现在比微调更脆弱。
更有意思的是它泛化的方式。把两段独立演示拼进上下文,模型会自己补出衔接动作串成连续行为;一段完全在仿真里录的演示,可以直接提示真机,而 GEN-1.5 的预训练里没有任何仿真数据。
团队说,他们没刻意去造「单样本学习者」,这是连续预训练 8 个月自己「长」出来的能力。
如果和机器人的交互真能简化到「给它看一遍该怎么做」,那么,任何人都能操作它了。
#GEN-1.5##Generalist##具身智能#
发布于 上海
