IGRPO按信息增益优化多轮搜索训练
热点事件观察中
IGRPO按信息增益优化多轮搜索训练
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
Yijun Zhang等提出信息增益驱动的Rollout策略优化框架IGRPO;在相同rollout预算下,基于论文摘要,3B和7B骨干模型在七个搜索增强问答基准上的平均准确率高于强基线。 该方法在训练阶段生成树状多轮搜索轨迹,依据中间状态的信息量决定分支扩展概率,使信息量较高的分支获得更多计算资源。代码已公开,但材料未提供具体准确率、资源成本或独立复现结果。
AI 根据报道生成 · 31 分钟前更新
最新进展10月8日 12:00
IGRPO:面向多轮搜索 Agent 的信息增益 Rollout 策略优化报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv · cs.AIIGRPO:面向多轮搜索 Agent 的信息增益 Rollout 策略优化
研究者提出 IGRPO,通过基于中间状态信息量的预算感知树状 rollout,优化多轮搜索 Agent 的训练轨迹生成。摘要称,该方法在七个搜索增强问答基准上使用 3B 和 7B 骨干模型、且 rollout 预算可比时,平均准确率高于强基线;代码地址为 https://github.com/e3trange/IGRPO。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。