跳到正文
热点事件观察中

AnchorLoop用历史参照改进智能体自演化

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Wenjie Liao、Liangjie Zhao和Zehong Cao提出AnchorLoop,将上一迭代Executor的冻结副本同时用于执行器训练和课程任务选择,并在无外部任务或答案监督的条件下训练工具集成智能体。 在13个推理基准上,AnchorLoop相较Agent0在数学推理和通用推理任务上分别提高2.5%和2.8%。不过,课程训练阶段执行器与锚点参数相同,因此锚点比较仅是任务选择代理,不能证明版本间能力提升或答案正确性。

AI 根据报道生成 · 41 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    AnchorLoop:以历史参照训练自演化工具集成智能体

    研究者提出AnchorLoop,将前一迭代Executor的冻结副本同时用于Executor训练和课程任务选择,以改善自演化工具集成智能体的反馈机制。在13个推理基准上,AnchorLoop相较Agent0在数学推理和通用推理任务上分别提升2.5%和2.8%,并维持较高的有效优势方差,在后期迭代中继续取得改进;其锚点比较仅作为任务选择代理,不表示版本间能力提升或答案正确性。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。