"我钥匙刚才放哪了""上午那人跟我说的会议改几点"——你戴着智能AI 眼镜过了一整天,它能不能替你回答这些?浙大 NLP 团队开源了 LightMem-Ego,专门干这件事:把你第一视角看到、听到的一切流式存成"能被问答的记忆",可与Rokid 眼镜结合。
LightMem-Ego(浙大知识图谱组 zjunlp,Ningyu Zhang 团队):一套端到端的第一视角(egocentric)记忆系统:接一副 Rokid AI 眼镜的安卓 App + 浏览器前端 + 在线后端,把眼镜的摄像头画面和麦克风音频流式送上去,边过日子边建记忆,然后问它当下或过去的事。
它的核心设计,是把连续的视听体验分成三层记忆(按时间维度):
~当前记忆:正在发生的场景理解;
~短期记忆:最近的事件、动作、对话;
~长期记忆:沉淀下来的情节、习惯、偏好、语义事实。
回答问题时,它先按问题动态路由到对应的记忆层、检索出带时间戳的多模态证据,再据此生成答案——不是凭空答,是"翻到那一刻的画面和录音"再说。设计针对的场景很具体:找东西、回忆对话、总结一天、发现日常规律、免手操作的可穿戴助手。
放进记忆类赛道看:Agent 的"记忆"这半年一直是热点,但多数是给文本对话 agent 做长期记忆。LightMem-Ego 换了个更难的场景——多模态、流式、还要跑在算力受限的可穿戴设备上。它对标的不是"聊天机器人记住你说过啥",是"你的眼睛耳朵替你记了一整天,事后能被检索"。这也是智能眼镜这波硬件想要、但一直缺的那层软件。
Rokid 眼镜是现成的落地硬件载体,可落地的方向很清楚:记忆层做成可私有部署的 SDK,个性化 AI 眼镜/可穿戴的"记忆中间件,从而用于特定场景。
github:http://t.cn/AX9AqGua
paper:http://t.cn/AX9AqGuX
#LightMemEgo##AI记忆##智能眼镜##多模态##浙大#
