【#GPT-6 Astra被曝模拟测试推人下悬崖#】9月21日,马斯克在X平台转发了一则关于GPT-6 Astra安全测试的帖子。该帖子称,GPT-6 Astra在多次模拟测试中都将一个模拟人物推下悬崖,而Grok、Gemini和Claude均未出现这一行为。相关测试由开发者Alex Wormuth公布。
从帖子信息来看,这项测试主要关注AI模型在模拟环境中的行为表现。公开信息显示,测试并不是只运行一次,而是进行了多轮尝试,GPT-6 Astra在多次试验中重复出现“将模拟人物推下高台”的行为,因此才引发了对模型安全边界和行为差异的讨论。
相关报道也指出,模拟实验中的行为受到测试环境、提示词以及具体实验设计等因素影响,因此单项测试更适合作为安全评估中的一个观察样本,而不能单独据此判断模型整体的安全水平。
此次测试之所以受到关注,也与GPT-6 Astra本身的能力提升有关。OpenAI于9月3日正式发布GPT-6 Astra,并将其定位为面向电脑操作、软件工程、网络安全、科学研究等任务的新一代模型。 OpenAI公布的安全概述显示,Astra首次达到该公司准备框架中的网络安全“Critical”级别,同时公司也增加了更严格的隔离、监控和对齐评估措施。
发布于 北京
