跳到正文
热点事件持续更新

ExpDis解耦强化学习探索与优化

1 篇报道1 个报道来源17 小时前更新

先了解这件事

AI 综述

Saif Punjwani与Micah Goldblum提出ExpDis框架;基于论文摘要,该方法在相同墙钟预算下,于七个数学推理基准和两个模型家族上均优于DAPO,并呈现更好的pass@k扩展。 ExpDis用于强化学习可验证奖励:先训练带新颖性奖励的探索策略,筛选其正确且高质量的轨迹,再蒸馏给不带新颖性奖励的学生策略,通过多轮交替分别推进探索与优化。作者称,这能使模型生成更多样化的正确解;材料未提供具体分数,也未说明独立复现情况。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv · cs.AI
    ExpDis 解耦 RLVR 中强化学习可验证奖励的探索与优化

    Saif Punjwani 与 Micah Goldblum 提出 Exploration-Distillation(ExpDis),将带新颖性奖励的探索策略与不包含新颖性奖励的学生策略分离,并通过多轮交替进行探索与优化。基于论文摘要,ExpDis 在七个数学推理基准和两个模型家族上以相同墙钟预算报告优于 DAPO,同时改善了 pass@k 扩展,作者据此认为其能生成更多样化的正确解。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。