张岱樾
26-10-09 21:03 微博认证:AI博主

OpenAI 的新 MentalHealthBench 将 GPT-6 Astra 的得分定为 57.3,而 GPT-4o 的得分则为 32.1,这是在真实的心理健康对话中评估的。

大多数心理健康 AI 评估都集中在紧急情况和广泛的安全标准上,而日常对话和模糊对话则鲜有衡量。

因此,OpenAI 与来自 22 个国家的 80 多位持证心理学家和精神病学家共同创建了这一基准,涵盖 19 种语言和近 20 个亚专业领域。

每段合成对话都配有一个定制的专家评估标准,涵盖诸如寻求情境、维护用户自主性、安全以及适当指导等行为。

每例至少由 3 位专家审查,只有当 2 位同意且第 3 位不反对时,该标准才被保留。

GPT-5.6 Sol 随后根据这些人工编写的标准对模型回答进行评分,因此得分质量仍部分取决于 LLM 评判者。

发布于 新加坡