张嘉森_杠杆哥
25-08-09 18:09 微博认证:财经博主 财经观察官 头条文章作者

今日,在2025世界机器人大会上,宇树科技王兴兴认为,目前机器人行业对数据关注太多,对模型关注太少,现在最大的问题其实是模型问题,当前的机器人模型架构不够好不够统一,即使有很多比较好的数据训练,但是也无法使用。

HumanPlus:由斯坦福大学 ALOHA 团队开发,核心目标是使人形机器人能够从人类数据中学习动作和自主技能。该系统包括实时影子系统(HST)和人形模仿Transformer(HIT)两个主要部分。HST 基于大量的模拟人体运动数据进行训练,允许人类操作员使用单个 RGB 相机实时控制人形机器人。HIT 是一个高级模仿学习算法,基于双目视觉输入,能够通过少量演示高效学习复杂的任务,如穿鞋、行走等。

NVIDIA Cosmos:由英伟达推出,开发人员可以利用 Cosmos 为强化学习生成 AI 反馈,从而改善策略模型并测试在不同场景下的性能。开发人员还可使用 Omniverse 创建三维场景,然后使用 Cosmos 将其转换为照片级逼真的场景,帮助机器人找到完成任务的最佳方法,实现更快学习和进步。

SAM-6D:由跨维智能、香港中文大学(深圳)和华南理工大学首创的 6DoF 姿态估计具身大模型,针对具身智能机器人操作。它可以从 RGB-D 图像中检测和估计未见过物体的 6D 姿态,助力机器人在复杂场景中精准抓取,通过 Background Token 设计能有效解决遮挡问题,提高机器人在杂乱环境中的操作成功率。

RoboMamba:由智平方、北京大学和北京智源人工智能研究院联合开发的高效端到端视觉 - 语言 - 动作(VLA)具身大模型。其结合了视觉编码器和线性复杂度的状态空间语言模型,通过协同训练赋予模型强大的视觉常识理解和机器人相关推理能力,能够处理从高层次推理到低层次精细操控的多任务场景,推理速度比现有模型快 3 倍。

ERA-42:由星动纪元发布的端到端原生机器人大模型,与自研的五指灵巧手星动 XHAND1 相结合,可驱动五指灵巧手运用多种工具,完成超过 100 项复杂精细的操作任务。该模型无需任何预编程技能,具备强泛化与自适应能力,基于少量数据收集,可在不到 2 小时即可学会新任务。

PaLM-E:由 Google 和柏林技术大学合作开发的具身多模态语言模型,结合了大规模语言模型和视觉 Transformer,将视觉、连续状态估计和文本输入编码为多模态句子,从而实现对复杂任务的理解和执行。它能够直接将现实世界的连续传感器模态融入语言模型,根据自然语言指令生成高级动作序列,并通过机器人平台执行任务。

发布于 江苏