跳到正文
热点事件持续更新

CERO动态分配强化学习rollout预算

1 篇报道1 个报道来源23 小时前更新

先了解这件事

AI 综述

Yiming Zong等提出CERO,一种用于组相对强化学习后训练的在线原始—对偶调度器,在有限rollout预算下动态决定提示准入、生成节奏和跨轮次回访。论文实验称,在相同训练响应预算、每个获准提示使用固定大小响应组的条件下,CERO在三个骨干模型和五个数学推理基准上均取得最高的avg@16宏平均;多种子消融还显示,自适应节奏优于均匀和预设支出调度。 研究将累计提示暴露建模为凹代理效用,并针对代理差异和速率变化给出相对于固定速率及同一路径时变基线的路径保证;这些保证针对代理目标,不等同于完整后训练性能保证。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    CERO:RL 后训练中 rollout 预算的分配位置与时机

    CERO 是一种用于组相对强化学习后训练的在线原始—对偶调度器,协调整个训练周期内有限 rollout 预算,动态决定提示选择、回访频率和每轮生成组数。实验在相同训练响应预算下,于三个骨干、五个数学推理基准上取得各自最高 avg@16 宏平均,并给出针对代理差异和速率变化的路径保证。多种子消融显示,自适应节奏优于均匀和预设支出调度。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。