疯狂大Uncle
25-10-11 18:21 微博认证:数码博主

艾伦・图灵研究所等最新研究:只需 250 份恶意文档就能攻破任意体量 AI 模型

据外媒 TechXplore 10 日报道,Anthropic、英国 AI 安全研究院和艾伦・图灵研究所的最新研究发现,即使是体量最大的 AI 模型,只需约 250 份恶意文档,就可能被成功入侵。
大语言模型的训练数据大多来自公开网络,从而使其能积累庞大知识库、生成自然语言,但同时也暴露在数据投毒的风险之下。
过去普遍认为,随着模型规模变大,风险会被稀释,因为投毒数据的比例需保持恒定。也就是说,要污染巨型模型需要极多的恶意样本。然而,发表在 arXiv 平台上的这项研究颠覆了这一假设 —— 攻击者只需极少量恶意文件,就能造成严重破坏。

发布于 广东