智能时刻
26-08-15 18:06 微博认证:科技博主 超话主持人(AI创造营超话) 微博解说视频博主 头条文章作者

#智能时刻的观察[超话]#

?? 剑桥大学的研究人员刚刚测试了当向人工智能的内存中填充大量无关数据时会发生什么。

他们发现现代检索增强生成(RAG)系统完全崩溃了。这并非是轻微的幻觉。这是每个企业人工智能依赖的精确检索架构的彻底失败,该架构用于访问私有数据。模型完全被噪音淹没。

研究人员测试了标准的检索增强生成(RAG)和过滤模型,如 Self-RAG。他们向这些模型输入信息,但逐渐增加干扰性、低质量文档的比例。以下是他们的发现。当前的读取时过滤完全失效。

当干扰文档的比例达到 8:1 时,标准 RAG 系统的准确率骤降至 0%。人工智能失去了寻找真相的能力。这暴露了一个巨大的架构缺陷。

我们目前存储人工智能读取的每一份文档,无论质量如何,并且在查询时强迫模型在垃圾中筛选。这极其低效且从根本上就是错误的。

生物解决方案。研究人员构建了一个名为“写入时门控”的新系统,该系统模仿了人类海马体。它并非将所有内容都保存下来,而是在数据存储之前就对其新颖性、可靠性和来源声誉进行评估。

还有一个发现改变了我们构建人工智能的方式:分层归档。当信念更新时,系统不会删除旧数据,而是降低其优先级,就像人脑一样保留版本历史。

结果如何?这种写入门控系统即使在大量干扰的情况下也能保持 100% 的准确率,同时计算成本仅为现有系统的九分之一。研究人员明确指出,当你将未经筛选的原始数据一股脑儿地塞进数据库,指望大语言模型日后自行理清头绪时,你构建的系统注定会在大规模应用时失败。

没有可靠的检索。没有成本控制。没有准确率保证。什么都没有。眼下,各公司都在构建庞大的向量数据库,将所有公司文档一股脑儿地塞进去,还指望人工智能能神奇地从杂乱中找出有用信息。别再把人工智能的记忆当作硬盘来对待了。要把它当作生物过滤器来对待。在入口处设置门控,而不是在出口处。

发布于 新加坡