RELACE改进长程语言智能体动作信用估计
热点事件观察中
RELACE改进长程语言智能体动作信用估计
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
RELACE论文提出一种无需独立评论器、奖励模型或额外交互轨迹的长程语言智能体动作信用估计框架,并通过ALFWorld和WebShop上的实验进行评估。基于论文摘要,该方法在Qwen2.5-1.5B-Instruct上的成功率分别达到96.35%和79.43%,较GiGPO提升5.47和5.60个百分点。 RELACE使用教师强制似然,对比动作在原始上下文和加入结果后的上下文中的得分,以生成回溯因子并结合观测奖励构造状态条件优势;摘要称,使用Qwen2.5-1.5B和7B模型时,该方法均优于GRPO、GiGPO和HCAPO。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 12:00
RELACE提出基于回溯似然的长时程语言智能体动作信用估计方法报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AIRELACE提出基于回溯似然的长时程语言智能体动作信用估计方法
RELACE是一种无需独立评论器、奖励模型或额外交互轨迹的框架,通过比较动作在原始上下文与结果增强上下文中的似然,生成回溯因子并结合观测奖励构造局部优势。论文摘要称,该方法在ALFWorld和WebShop上使用Qwen2.5-1.5B-Instruct和Qwen2.5-7B-Instruct时,相比GiGPO分别提升5.47和5.60个百分点,1.5B模型成功率达到96.35%和79.43%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。