跳到正文
arXiv · cs.AI· Sayak Chakrabarti, Sathish Reddy Indurthi·· 2 天前

RELACE提出基于回溯似然的长时程语言智能体动作信用估计方法

RELACE: retrospective likelihood-based action credit estimation for long-horizon language agents

arXiv:2610.07349v1阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Sayak Chakrabarti, Sathish Reddy Indurthi

研究任务与主要进展

RELACE是一种无需独立评论器、奖励模型或额外交互轨迹的框架,通过比较动作在原始上下文与结果增强上下文中的似然,生成回溯因子并结合观测奖励构造局部优势。论文摘要称,该方法在ALFWorld和WebShop上使用Qwen2.5-1.5B-Instruct和Qwen2.5-7B-Instruct时,相比GiGPO分别提升5.47和5.60个百分点,1.5B模型成功率达到96.35%和79.43%。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

来源:arXiv · cs.AI · arxiv.org