arXiv · cs.AI· Sayak Chakrabarti, Sathish Reddy Indurthi·· 2 天前
RELACE提出基于回溯似然的长时程语言智能体动作信用估计方法
RELACE: retrospective likelihood-based action credit estimation for long-horizon language agents
arXiv:2610.07349v1阅读论文 PDF ↗
仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。
作者:Sayak Chakrabarti, Sathish Reddy Indurthi
研究任务与主要进展
RELACE是一种无需独立评论器、奖励模型或额外交互轨迹的框架,通过比较动作在原始上下文与结果增强上下文中的似然,生成回溯因子并结合观测奖励构造局部优势。论文摘要称,该方法在ALFWorld和WebShop上使用Qwen2.5-1.5B-Instruct和Qwen2.5-7B-Instruct时,相比GiGPO分别提升5.47和5.60个百分点,1.5B模型成功率达到96.35%和79.43%。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。
来源:arXiv · cs.AI · arxiv.org