arXiv · cs.AI· Michael Sullivan, Alexander Koller·· 7 天前精选
论文分析 RLVR 后训练中的语言漂移及其奖励约束
On Language Drift during RLVR Post-Training
arXiv:2610.02015v1阅读论文 PDF ↗
仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。
作者:Michael Sullivan, Alexander Koller
首次提交:2026-10-02 00:39
研究任务与主要进展
论文研究 RLVR 后训练为何导致语言漂移,并在摘要中报告 RLVR 的优化压力理论上允许语言漂移无界增长,而监督微调不具备这一条件。作者进一步报告,漂移主要出现在基础模型无法直接提取目标行为的新颖推理任务中,并指出约束语言漂移需要同时约束期望奖励,可能损害 RLVR 的性能与思维链可监控性;上述内容基于论文摘要。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。
本站判断
该研究把 RLVR 后训练中的语言漂移从现象描述推进到理论与实验分析:摘要报告,理论分析认为 RLVR 的优化压力允许语言漂移无界增长,而监督微调不具备这一条件;实验进一步将漂移定位到目标行为无法直接从基础模型得到的新颖推理任务。其关键影响是,作者报告约束语言漂移必然同时约束期望奖励,因此提升思维链可监控性与保持 RLVR 性能之间存在张力;当前依据仅为论文摘要,证明和实验细节尚未核验。
来源:arXiv · cs.AI · arxiv.org