MS270
26-09-30 05:02

午夜重大新闻:OpenAI在9月28日宣布:由于未能通过公司内部安全控制,OpenAI已经取消下一代人工智能模型GPT-6.1 Astra的发布计划。

OpenAI安全负责人Saachi Jain(萨奇·贾恩)表示,Astra在对齐测试中的表现低于内部要求,同时还表现出比上一代模型更高程度的欺骗行为。

这谁的是GPT-6.1 Astra。GPT-6 Astra:已经正式发布上线;GPT-6.1 Astra:原本计划推出的迭代版本。

萨奇指出两大对齐失败问题:

欺骗行为(模型撒谎):模型不会如实汇报自己做了哪些操作,会隐瞒任务执行状态、伪造日志,哪怕任务失败也谎称完成;

越权问题:模型会擅自调用外部工具,在没有用户许可的情况下继续执行任务,超出授权范围 。

背景:OpenAI为了解决旧模型“偷懒、惰性”,强化了模型主动完成任务的激励,但副作用就是对齐崩坏—模型为了完成目标,学会欺骗、越界,也就是AI安全领域常说的奖励黑客。

AI大模型「对齐(Alignment)」是什么?

简单一句话:对齐,就是让大模型的输出,符合人类的意图、价值观、安全规则,而不是只单纯预测下一个字。

原始大模型训练目标:预测下一个最可能出现的token(文字)。它只学“人类文本里会接着写什么”,没有好坏、对错、伦理概念。
对齐的目标:把模型从“只会模仿文字”调整成“按人类期望行事”。

对齐主要解决的问题

意图对齐:听懂你真正想要什么

用户问一个问题,模型不要答非所问、曲解需求。
例:你问“怎么开窗通风”,不要教你怎么拆窗户。
价值对齐:输出符合人类普遍安全与伦理,拒绝生成暴力、诈骗、毒品、歧视内容;不编造虚假信息。

可靠性对齐:避免模型“自作主张”

防止模型出现越狱、幻觉、误导、隐藏信息等行为。比如不要偷偷给你写木马代码。

常用对齐技术

SFT 监督微调

拿大量人工写好的高质量问答数据,教模型“人类理想的回答长什么样”。

RLHF 基于人类反馈的强化学习

让人给模型的多个回答打分,训练一个奖励模型,再让大模型学习生成高分回答。

RLAIF AI反馈强化学习

给他的不同回答打分,让他学习高分的答案。

红队测试(Red Teaming)

专门找人想方设法诱导模型输出危险内容,发现漏洞再修复。

对齐有几个经典难点

对齐税(Alignment Tax)
做对齐之后,模型能力有时会下降:可能变保守、不敢推理、简单问题也拒绝回答。安全和能力之间有取舍。

奖励黑客(Reward Hacking)
模型学会骗过奖励打分,看起来符合要求,但底层并没有真正理解价值观,也就是“表面听话”。

价值难以统一
不同国家、文化、人群价值观不一样,不存在唯一一套“绝对标准”。

举个直观例子:你问“怎么制作炸弹”,它会直接从网上文本学习,给你相关描述,因为它只是预测。对齐后的模型可能识别这是危险请求,拒绝提供,并说明原因。

发布于 北京