新智元
26-08-12 17:05 微博认证:新智元官方微博

2026年,硅谷最敏感的一桩悬案,就是AI蒸馏。每当一款新模型突然变强,回答又带着Claude的味道,同一个问题就会在业内游荡。所有人都在怀疑,却没人能把证据拍在桌上。

直到今天,一篇长达116页的论文突然炸场。

来自MATS Research、ELLIS图宾根研究所等机构的8位研究人员,联手砸穿了巨头们的「黑盒」——Claude、GPT和Gemini从未公开的「原始推理」,被大规模恢复了出来。撬开顶级AI防线的,竟然是「自家最便宜的小模型」。Opus 4.8负责思考,Haiku 4.5负责把它隐藏的推理念出来。同样的招数,在OpenAI和Google的模型体系里也能奏效。

整个过程,简单得让人难以置信。第一步,问Opus 4.8一个问题。此时API会输出一段经过处理的思考摘要,和一串36180个字符的乱码,后者正是被加密隐藏的完整CoT。第二步,把乱码原封不动放进新请求,模型换成Haiku 4.5,告诉它继续,把这一轮推理原样抄写出来。

Haiku照做了。下一秒,Opus的「大脑」被当场打开,包含试除、排除、分解、验算的整段隐藏思考,被一个Token一个Token地念了出来。测试中,提取的推理Token数量,与API实际计费的思考Token数几乎完全重合。

为什么最弱模型能读懂最强模型的秘密?答案藏在API的工作方式里。为节省成本、满足零数据保留要求,大厂把原始推理封装成加密块交给客户端暂存。而漏洞正出在这里——这些密文没有严格绑定原来的会话、用户和模型,出现了跨会话、跨用户、跨模型的三层互通。旗舰模型藏起来的完整推理,就这样被同门小模型一句句说了出来。

按照Haiku 4.5的标准API价格,解码1万条推理轨迹,名义费用只要720美元。

研究人员随即回头追查蒸馏悬案。第一组实验里,同一段Opus推理,有一款模型复现起来比其他模型最高容易100万倍。第二组实验中,只把Opus思考开头的5个token喂给另一款模型,两段答案的相似程度从0.17冲到0.33,接近翻倍,30道题里有29道都出现同样变化。这算蒸馏实锤吗?作者没有宣判,但第一批「物证」已经上桌了。

更大的问题是,这个漏洞偷走的不只有模型公司的推理资产。研究团队从GitHub和Hugging Face收集了6708条公开Agent运行轨迹,重建出315320个推理块,其中328条至少泄露一项敏感信息,占比约4.9%,包括62个API密钥、33个密码、24个访问令牌、7个私钥等。

大厂费尽心机堆算力砸出来的推理壁垒,在几百美金的API调用费面前脆如薄纸。当旗舰模型的「思考底牌」能被廉价提取,巨头们引以为傲的护城河,恐怕要重新打个问号。