跳到正文
热点事件观察中

E²-OPSD抑制数学推理熵超调

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Yifei Liu等提出E²-OPSD,用于缓解在策略自蒸馏中学生模型熵持续升高的问题。论文摘要称,该方法通过示例引导教学和熵感知蒸馏调整训练过程,不增加额外前向传播或网络;在数学推理mean@16上较OPSD最高提升4.3点,域外评测相对对应基模型最高提升4.9点mean@16和5.5点pass@8。

AI 根据报道生成 · 36 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    E²-OPSD:通过示例引导与熵感知蒸馏抑制在策略自蒸馏中的熵超调

    E²-OPSD提出一种不增加额外前向传播或网络的在策略自蒸馏方法,通过示例引导教学和熵感知蒸馏缓解学生模型熵持续升高的问题。基于论文摘要,该方法在数学推理mean@16上较OPSD最高提升4.3点,域外评测相对对应基模型的mean@16和pass@8最高提升4.9点和5.5点。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。