ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

阿里:长程任务状态管理新范式

阿里:长程任务状态管理新范式 标题LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks来源arXiv, 2608.01964v1️文章简介研究问题如何解决大语言模型智能体在执行长程任务时因上下文膨胀导致的状态追踪困难及错误自我评估传播的问题主要贡献论文提出LongHorizon-Harness框架将长程执行重构为显式任务状态管理问题通过独立审计的环境事实更新状态显著提升多基准测试性能。重点思路提出管理-执行-审计MEA循环机制管理者基于当前显式任务状态规划子任务执行者在隔离的新鲜上下文中执行单一子任务不携带历史交互轨迹审计者以只读方式独立检查环境变化验证执行结果。实现任务状态与执行解耦任务状态作为独立记录外部维护仅由经环境独立验证的事实更新而非依赖执行者的自我报告从而避免错误累积和上下文腐烂。设计轻量级AgentAdapter接口支持 interchangeable 模型和执行后端如Claude Code, Codex CLI无需修改原生智能体循环即可集成保持系统灵活性。采用新鲜上下文执行策略每轮执行后丢弃原始交互轨迹仅保留紧凑的、经审计的任务状态进入下一轮确保每个子任务都在无干扰的环境中专注完成。分析总结在WeaveBench基准上使用Qwen 3.7-Plus模型通过率从51.8%大幅提升至80.7%超越官方最佳结果近一倍证明其在混合GUI-CLI工作流中的有效性。在Terminal-Bench 2.1纯命令行任务中成功率从69.7%提升至77.2%表明该框架不仅适用于图形界面对通用长程逻辑推理和状态维护同样有效。在OSWorld 2.0桌面工作流中二元完成率从2.8%提升至8.3%部分得分从21.5%升至35.2%显示其能更好地维持长期进度并转化为最终完成。跨模型泛化能力强在使用Claude Opus 4.7时OSWorld子集完成率从20.0%提升至34.3%证明性能提升源于架构优化而非特定模型能力。案例分析显示该框架能有效从停滞的交互中恢复通过外部化失败状态并重新规划避免在无效操作中浪费预算同时防止看似正确但实际不符的执行结果被误记为完成。个人观点论文将“长程记忆”从非结构化的对话历史转变为结构化的、经第三方审计的状态机auditor不是看executor的输出报告来判断而是自己去环境里检查实际变化。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进