E²-OPSD抑制数学推理熵超调
热点事件观察中
E²-OPSD抑制数学推理熵超调
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
Yifei Liu等提出E²-OPSD,用于缓解在策略自蒸馏中学生模型熵持续升高的问题。论文摘要称,该方法通过示例引导教学和熵感知蒸馏调整训练过程,不增加额外前向传播或网络;在数学推理mean@16上较OPSD最高提升4.3点,域外评测相对对应基模型最高提升4.9点mean@16和5.5点pass@8。
AI 根据报道生成 · 36 分钟前更新
最新进展10月7日 12:00
E²-OPSD:通过示例引导与熵感知蒸馏抑制在策略自蒸馏中的熵超调报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AIE²-OPSD:通过示例引导与熵感知蒸馏抑制在策略自蒸馏中的熵超调
E²-OPSD提出一种不增加额外前向传播或网络的在策略自蒸馏方法,通过示例引导教学和熵感知蒸馏缓解学生模型熵持续升高的问题。基于论文摘要,该方法在数学推理mean@16上较OPSD最高提升4.3点,域外评测相对对应基模型的mean@16和pass@8最高提升4.9点和5.5点。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。