刘聪NLP
26-05-15 13:02 微博认证:AI博主

前几天刷到一个x,我醉了,
说DeepSeek泄露用户的聊天数据,输入\会吐一些内容,

这不就是幻觉吗?跟泄露用户的隐私数据有啥关系,

就是special token injection没做好。

不过,隐私泄露的问题,确实是大家在用LLM时比较注意的,担心被别人拿去当训练数据。

其实各家训练都会做一些敏感信息的过滤,最后工程化也会做一下校验处理。

但,还是会有一些问题,

比如前段时间简历泄露的事件,不管如何,用户还是介意的。

一些安全意识比较强的人也会比较注意,

比如说配置模型的时候,不会直接让本地的agent去配置一些api-key,就是不明文暴露出去。

上个月,openai也开源了一个privacy-filter 模型,一个轻量隐私检测模型。

1.5B 参数激活50M,支持 128K 上下文,可以检测 8 类 PII,涉及private_person、private_address、private_email、private_phone、private_url、private_date、account_number、secret等。

解决的是通用文本清洗问题。

你如果担心数据泄露,可以直接本地部署一个,把你输入,直接变成脱敏形式。

在前两天去参加百度大会的时候,跟朋友在聊天,也聊到了这个隐私问题,

他说, 记忆张量MemTensor团队开源了一个MemPrivacy,问我有了解吗?

实话实说,根本不知道,哈哈哈哈,

不过我在回家的高铁上刷了一下,还蛮有意思的,就分享一下。

MemPrivacy 做了一个有意思的事情,就是把隐私重新分层,

他设计了一个四级隐私分类树。
- PL4 是致命凭证级,比如密码、API Key。这类东西泄露以后,可能直接带来金钱损失,基本是零容忍。
- PL3 是高危敏感级,比如医疗诊断、金融记录、精准定位、生物特征。
- PL2 是身份锚定级,比如姓名、电话、邮箱、详细地址、账号 ID。
- PL1 是基础画像级,比如偏好、习惯、非诊断性情绪、交互风格。

这就很符合Agent时代,因为不管养虾、养马、还是养蛙,

核心都是让整个Agent系统更了解你,回答的内容或做的事情更符合你的期待。

所以,Agent需要记住你喜欢什么、习惯怎么写邮件、平时用什么语气沟通,

但它不能记住你的API Key、病历、银行卡等信息。

因此,隐私保护对于Agent并不是藏得越严越好,需要在安全和有用之间找到一个好的平衡点。

我一直在强调,端云结合是必然趋势,

云端的模型具有足够的智能性,

端侧模型开源快速解决简单、重复的问题。

以后个人 Agent 越强,越会记住你,越能替你做事,它就越不可能只靠一句请勿上传敏感信息来保护用户。

用户要的不只是一个更聪明的助手。

用户还需要知道,哪些东西会被记住,哪些东西不会上云,哪些东西即便参与任务,也不会以原始形态留在云端。

Agent 的长期记忆必将想成为基础能力,

隐私保护也必须成为基础能力。

详细内容,见图片。#how i ai##ai创造营##当我在DeepSeek输入think#

发布于 江苏