arXiv · cs.AI· Haoxiang Zhang, Qinglin Chen, Hiroaki Hayashi, Zhuofeng Li, Siming Zhang, Jiaxin Zhang, Jixuan Chen, Fang Wu, Pan Lu, Silvio Savarese, Julian McAuley, Chien-Sheng Wu·· 1 天前
自我反思蒸馏将事后经验转化为事前预判
Self-Retrospection Distillation: Turning Post-hoc Experiences into Prior Foresight
arXiv:2610.08077v1阅读论文 PDF ↗
仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。
作者:Haoxiang Zhang, Qinglin Chen, Hiroaki Hayashi, Zhuofeng Li, Siming Zhang, Jiaxin Zhang, Jixuan Chen, Fang Wu, Pan Lu, Silvio Savarese, Julian McAuley, Chien-Sheng Wu
研究任务与主要进展
研究提出自我反思蒸馏(SRD),利用交互完成后的轨迹经验监督同一策略在行动前作出预判,以补充可验证奖励强化学习(RLVR)。基于论文摘要,SRD在10个工具集成推理和长时程智能体任务上相对RLVR与自蒸馏基线最高提升24.2个百分点。在2B设置中98%的轨迹组均为失败时,RLVR成功率为0.0%,加入SRD后在相同采样预算下达到60.6%。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。
来源:arXiv · cs.AI · arxiv.org