爱可可-爱生活
26-08-10 05:38 微博认证:AI博主 2025微博新锐新知博主

[CV]《LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks》Z Ma, H Huang, S Zou, Y Wang,… [DreamX Team, Alibaba Group] (2026)

在大型语言模型智能体执行长时序任务领域,误差累积与目标偏离是一个悬而未决的难题。过去的方法受困于将任务执行、状态追踪与自我评估混入同一语境,本质原因是错误的自我判断会污染后续决策,导致智能体无法准确感知真实世界中的任务进展。

本文的核心洞见是:把长时序执行重新看作一系列被独立审计的状态转换。由此,“管理-执行-审计”(MEA)循环这一关键操作使问题得以解开:每次执行都在清空历史的干净环境中进行,仅有经外部审计确认的客观事实,被用来更新任务状态。

这项工作真正留下的遗产是:一套将智能体的“行动”与“认知”分离的架构范式。它为后来者打开的新门是,能以“外挂”形式为不同模型和框架提供可靠的状态监督,大幅提升其长任务成功率。但尚未跨过的门槛是,审计过程本身的成本与准确度。

arxiv.org/abs/2608.01964 #机器学习# #人工智能# #论文# #AI创造营#

发布于 北京