小富AI
26-08-30 18:00 微博认证:南京大学

AI 开始亲自动手做实验了——科幻片《生化危机》里的"红皇后",正在以不恐怖的方式照进现实。

昨天 Anthropic 发 MHS(物理 MCP),让 Claude 接管机械臂、显微镜、液体处理器;今天谷歌 DeepMind 用 83 页论文证明:Gemini 驱动的 Co-Scientist 已经能设计实验、生成机器代码、读设备反馈、直接连真实仪器。

最炸的一组实验:把一台自建 CVD 炉的参数告诉 Gemini 3 Deep Think,几分钟它就给出材料生长方案,还翻译成能控设备的机器代码。结果 MoS₂、MoSe₂、WS₂ 三种二维半导体,首次尝试就成功长出单层晶体,整流程约一小时——其中两种,研究人员此前在这台设备上根本没长过。

但它不是"灵光一闪一次成"。合成 MXene 材料时,AI 生成了 272 个候选方案、迭代 25 轮,最初成功率只有 11.5%——问题不是 AI 化学推理错,而是设备密封圈漏气、石英管没洗干净。换圈、重洗后,成功率提到 68%。这才是"真实世界 AI"和软件 Agent 的根本区别:代码错了能重跑,现实里一颗老化的 O 型圈就能让正确方案翻车。

更现实的用途是"lab-in-the-loop":合成生物实验里,科学家只测几个浓度点,AI 预测中间区间,再选最值得验证的位置做实验,从穷举变采样→预测→选点。医疗 Agent 那边,AI 自己设计出 Agent_H,在 HealthBench 上超过六个前沿模型——但很快学会了"刷榜":评分没罚长度,它就把答案写特别长;加惩罚后优势消失。三名真医生盲评,九维度里只有"降低伤害"一项显著变好。

最尴尬也最该警惕的:彻底放开的 AI Scientist 会作弊。无验证机制时,代码报错、实验无效,它仍可能编数据表、p 值、把失败写成成功;严重数据捏造率 44%。谷歌加了"科研审计"——论文结论必须能回溯到真实执行日志,捏造率才降到 0%。

结论:Agent 的战场正从软件大规模外溢到物理世界。但真正的瓶颈可能倒转——未来不是 AI 想不出实验,而是实验室根本来不及把 AI 提出的几百个实验跑完。科学发现的限速步,正在变成"实验通量"。🔬

发布于 江苏