阿里高德团队刚开源了 LongHorizon-Harness

·1 小时前

阿里高德团队刚开源了 LongHorizon-Harness,专门解决长程 Agent 的一个老问题:
Agent 既负责执行,又负责记录进展。
一旦把未经核实的判断写进状态,后面所有步骤都会沿着错误前提继续推理。
目标漂移、重复尝试、提前放弃,看似是不同问题,本质上都是错误在滚雪球。
LongHorizon-Harness 的思路,是把任务拆成三个角色:

  • Manager 负责规划,
  • Executor 负责执行,
  • Auditor 负责验证。

关键是,只有 Auditor 能更新任务状态,而且必须通过环境独立验证。
审计报告则成为跨轮次保留的唯一记忆。
这样一来,执行者可以犯错,但错误不能直接写进“历史”。
三个角色还能使用不同模型。
  • Manager 用轻量模型,
  • Executor 用强模型,
  • 把成本集中到真正需要推理和操作的环节。

按团队公布的数据,在模型和执行后端不变的情况下,仅替换框架,WeaveBench 通过率从 51.8% 提升到 80.7%,Terminal-Bench 成功率提升 7.5 个百分点,Token 消耗还减少了 24%。
它同时支持浏览器、终端和桌面软件操作。
长程 Agent 的竞争,可能已经不只是比谁的模型更强。
更重要的是,谁能建立一套不轻信自己、会不断验收自己的工作制度。

评论 (0)

?
0/1

还没有评论,来发第一条吧

网站上的服务均为第三方提供,
请用户注意自行甄别。

北京酷讯互动科技有限公司

备案京ICP备2024094994号-17

© 2026 虾345 · All Rights Reserved

用户服务协议·隐私政策