跳到正文
热点事件观察中

SORL稳定长程LLM智能体训练

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

Chenliang Li等提出并评估SORL(Stabilizing Off-policy Reinforcement Learning for Long-Horizon Agent Training)框架,用于稳定长时程LLM智能体的离策略强化学习训练。该框架采用轮次级重要性采样和裁剪触发归一化,并据此构建SO-PPO和SO-GRPO算法。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    SORL:通过轮次级重要性采样与裁剪触发归一化稳定长时程LLM智能体离策略训练

    作者提出SORL(Stabilizing Off-policy Reinforcement Learning for Long-Horizon Agent Training),通过轮次级重要性采样和裁剪触发归一化稳定LLM智能体的离策略强化学习,并据此构建SO-PPO和SO-GRPO。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。