个人理解,什么叫端到端 VLA 世界模型
端到端:视觉(激光雷达)→神经网络→输出 只了解然后决策,不知道为什么这样,不理解原因,只能模仿
VLA:视觉→语言模型→输出动作 了解为什么要这么做
缺点:需要思考时间,语言模型大吃算力
世界模型:环境时序动作模型,通过现实和仿真的模型生成,来训练世界模型的预测能力,世界模型无需接入大语言模型,但是需要了解物理世界规则,然后预测算法(这部分和ai生成视频相关)
现在的机械臂驱动层面,人们已经似乎不太纠结于rl还是vla方式了,基本都是用vla+rl的方法和世界模型进行对比,查看效果
发布于 黑龙江
