#it那些事儿# 关于蒸馏的那些事儿
你给我 CoT,但把它加密了——结果你的加密设计又让我借助另一个模型把它解出来……[期待]
如图一所示,2026 年 8 月 10 日,一组研究人员披露了一种针对部分商业大模型 API 架构的攻击方法:
当隐藏 reasoning trace 以加密块形式交给客户端并在后续请求中回传,而这些加密块又能跨模型、会话或用户兼容时,攻击者可能借助同一厂商体系中更弱、更容易被诱导的模型,将强模型的隐藏推理轨迹重新解码为明文。
研究人员称已在 Anthropic、OpenAI 和 Google 的体系中验证相关攻击,并进一步展示了由此产生的模型蒸馏、隐私泄露和 Prompt Injection 风险。
它这个逻辑是:
强模型
→ 生成隐藏 CoT
→ 厂商把 CoT 包装/加密成 reasoning block
→ 客户端保存并回传
→ 另一个模型仍然能够消费这个 block
→ 研究人员诱导这个模型
→ 把原来的 reasoning 重新吐出来
这就有点像:
“我把答案锁进保险箱,然后把保险箱交给另一个人,并要求他说:‘请根据这个保险箱里的东西继续工作。’
结果发现,这个人其实能把保险箱里的内容读出来。”[泪奔]
发布于 北京
