前几天刷到一个x,我醉了,
说DeepSeek泄露用户的聊天数据,输入\
这不就是幻觉吗?跟泄露用户的隐私数据有啥关系,
就是special token injection没做好。
不过,隐私泄露的问题,确实是大家在用LLM时比较注意的,担心被别人拿去当训练数据。
其实各家训练都会做一些敏感信息的过滤,最后工程化也会做一下校验处理。
但,还是会有一些问题,
比如前段时间简历泄露的事件,不管如何,用户还是介意的。
一些安全意识比较强的人也会比较注意,
比如说配置模型的时候,不会直接让本地的agent去配置一些api-key,就是不明文暴露出去。
上个月,openai也开源了一个privacy-filter 模型,一个轻量隐私检测模型。
1.5B 参数激活50M,支持 128K 上下文,可以检测 8 类 PII,涉及private_person、private_address、private_email、private_phone、private_url、private_date、account_number、secret等。
解决的是通用文本清洗问题。
你如果担心数据泄露,可以直接本地部署一个,把你输入,直接变成脱敏形式。
在前两天去参加百度大会的时候,跟朋友在聊天,也聊到了这个隐私问题,
他说, 记忆张量MemTensor团队开源了一个MemPrivacy,问我有了解吗?
实话实说,根本不知道,哈哈哈哈,
不过我在回家的高铁上刷了一下,还蛮有意思的,就分享一下。
MemPrivacy 做了一个有意思的事情,就是把隐私重新分层,
他设计了一个四级隐私分类树。
- PL4 是致命凭证级,比如密码、API Key。这类东西泄露以后,可能直接带来金钱损失,基本是零容忍。
- PL3 是高危敏感级,比如医疗诊断、金融记录、精准定位、生物特征。
- PL2 是身份锚定级,比如姓名、电话、邮箱、详细地址、账号 ID。
- PL1 是基础画像级,比如偏好、习惯、非诊断性情绪、交互风格。
这就很符合Agent时代,因为不管养虾、养马、还是养蛙,
核心都是让整个Agent系统更了解你,回答的内容或做的事情更符合你的期待。
所以,Agent需要记住你喜欢什么、习惯怎么写邮件、平时用什么语气沟通,
但它不能记住你的API Key、病历、银行卡等信息。
因此,隐私保护对于Agent并不是藏得越严越好,需要在安全和有用之间找到一个好的平衡点。
我一直在强调,端云结合是必然趋势,
云端的模型具有足够的智能性,
端侧模型开源快速解决简单、重复的问题。
以后个人 Agent 越强,越会记住你,越能替你做事,它就越不可能只靠一句请勿上传敏感信息来保护用户。
用户要的不只是一个更聪明的助手。
用户还需要知道,哪些东西会被记住,哪些东西不会上云,哪些东西即便参与任务,也不会以原始形态留在云端。
Agent 的长期记忆必将想成为基础能力,
隐私保护也必须成为基础能力。
详细内容,见图片。#how i ai##ai创造营##当我在DeepSeek输入think#
