这个厉害了,一家名为 Standard Intelligence 的初创公司推出了 FDM-1。
这,是首个完全通用的计算机操作模型。
它通过创新的高压缩比视频编码,与自动数据标注技术,直接从千万小时级的屏幕录像中进行端到端学习。
结果能够以 30 FPS 的速度,自主完成诸如 CAD 建模,软件测试。
甚至在自动驾驶测试中,该模型经过不到 1 小时的数据微调后,就能利用 Web 界面在旧金山的街区完成转弯导航。
注意,是直接看录像,而不是看截图。
补充下背景信息,你就明白这事儿有多离谱了。
现在构建计算机操作智能体,主流方案是在人工标注好的屏幕截图上,微调 VLM 视觉语言模型。(人工标注不仅成本高,目前的数据集规模体量也不够。)
然后,构建强化学习环境去学习特定的下游任务。
但是,这样训练出来的智能体,无法处理超过几秒钟的上下文,也无法处理高帧率视频,执行长程任务,更别提能扩展成通用的智能体。
#HOW I AI##科技先锋官# http://t.cn/AXc5oxub
发布于 北京
