【看1100万小时屏幕录像学会操作电脑,四人团队打造了一个“通用的计算机行为模型”】
2026 年 2 月 23 日,一家名为 Standard Intelligence 的旧金山初创公司发布了 FDM-1(Forward Dynamics Model,前向动力学模型),并称其为“首个完全通用的计算机行为模型”。
这个模型在一个包含 1,100 万小时屏幕录制视频的数据集上进行训练,能够以每秒 30 帧的速率直接处理视频流,在 CAD 建模、网站安全测试甚至真实世界的自动驾驶场景中展示出令人意外的泛化能力。
当前主流的计算机使用代理(computer-use agent)走的是另一条路线。Anthropic 在 2024 年 10 月推出了 Claude 的 Computer Use 功能,让 AI 通过截屏、识别界面元素、模拟点击和键入来操作计算机,到 2026 年 2 月 Claude Sonnet 4.6 在 OSWorld 基准上已达到 72.5% 的得分。
OpenAI 在 2025 年 1 月发布了名为 Operator 的 Computer Using Agent(CUA,计算机使用代理),基于 GPT-4o 的视觉能力加上强化学习实现网页操控。Google DeepMind 也有 Project Mariner 和 Gemini 2.5 Computer Use 在布局同一赛道。
这三家巨头的做法有一个共同特征:都是在已有的#视觉语言模型# (VLM,Vision-Language Model)基础上叠加工具调用能力,依赖截屏分析和像素级定位来理解界面,本质上仍然是“看图说话”的思路。
戳链接查看详情:http://t.cn/AXcGE22W
