跳到正文
热点事件观察中

RELACE改进长程语言智能体动作信用估计

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

RELACE论文提出一种无需独立评论器、奖励模型或额外交互轨迹的长程语言智能体动作信用估计框架,并通过ALFWorld和WebShop上的实验进行评估。基于论文摘要,该方法在Qwen2.5-1.5B-Instruct上的成功率分别达到96.35%和79.43%,较GiGPO提升5.47和5.60个百分点。 RELACE使用教师强制似然,对比动作在原始上下文和加入结果后的上下文中的得分,以生成回溯因子并结合观测奖励构造状态条件优势;摘要称,使用Qwen2.5-1.5B和7B模型时,该方法均优于GRPO、GiGPO和HCAPO。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    RELACE提出基于回溯似然的长时程语言智能体动作信用估计方法

    RELACE是一种无需独立评论器、奖励模型或额外交互轨迹的框架,通过比较动作在原始上下文与结果增强上下文中的似然,生成回溯因子并结合观测奖励构造局部优势。论文摘要称,该方法在ALFWorld和WebShop上使用Qwen2.5-1.5B-Instruct和Qwen2.5-7B-Instruct时,相比GiGPO分别提升5.47和5.60个百分点,1.5B模型成功率达到96.35%和79.43%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。