青稞AI
26-07-08 12:16 微博认证:AI博主

🔥技能不可靠,Agent 该信谁?中科院自动化所最新提出 UCOB:让大模型在交互中筛选、内化并演化技能

在复杂的长程交互任务中,大语言模型智能体往往需要不断观察环境、选择动作、接收反馈,并在多轮交互后完成最终目标。与普通问答任务相比,这类 agentic task 面临更加困难的训练瓶颈:奖励信号稀疏、错误动作会在长轨迹中累积,并且很难判断到底是哪一步决策导致了最终失败。

一种自然的解决思路是引入技能记忆(skill memory)。智能体可以从过去的成功或失败轨迹中反思出可复用经验,并在未来遇到相似任务或状态时检索这些技能作为额外上下文。已有工作表明,技能记忆能够提升探索效率,也能够帮助智能体在长程任务中复用已有经验。

然而,当技能被用于训练时,一个更关键的问题随之出现:检索到的技能真的总是可靠吗?

技能并不是万能答案。一个技能可能在某个状态下帮助模型做出正确动作,但换到另一个状态后,可能因为任务细节不同、环境观察不同,或者技能本身过于泛化,反而误导模型。

因此,如果训练方法默认“带技能的 prompt 一定更好”,并把 skill-conditioned prompt 固定当作 privileged teacher,就可能把错误技能行为也蒸馏进模型。

基于这一问题,我们提出一个核心视角:智能体不应该只是学会调用技能,而应该先学会判断技能、纠正技能,再把真正有用的技能内化并反哺到技能记忆中。

阅读全文:http://t.cn/AXo1hjga

#青稞社区##人工智能[超话]##Agent#

发布于 河北