跳到正文
热点事件观察中

SeOPD:用自生成思维链在线蒸馏实现LLM自我进化

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Xiaoshu Chen 等在 arXiv 论文(2026-10-08,cs.AI)中提出 SeOPD 方法:让同一个大语言模型先以深度思考模式生成思维链,再以非思考模式生成回答,并用前者作为特权信息为后者提供逐 token 监督,实现在线策略蒸馏。 作者称,该方法可将推理过程中产生的新信息吸收进共享模型参数,从而同时改进非思考与深度思考能力。基于论文摘要,实验覆盖多个大语言模型和多种任务并显示方法有效,但具体实验细节未说明。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv · cs.AI
    SeOPD:通过自生成思维链在线蒸馏实现大语言模型自我进化

    SeOPD让同一个大语言模型先以深度思考模式生成思维链,再以非思考模式生成回答,并用前者作为特权信息为后者提供逐 token 监督。作者称,该方法可使推理过程中产生的新信息被共享模型参数吸收,从而同时改进非思考和深度思考能力。基于论文摘要,实验覆盖多个大语言模型和任务并显示方法有效,但具体实验细节未说明。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。