跳到正文
热点事件观察中

DAR用预测分布奖励改进LLM回归

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Jungsoo Park等提出分布感知奖励(DAR),用强化学习联合评估大语言模型对同一输入的多次预测及其整体分布。基于论文摘要,DAR按各预测对分布质量的留一贡献给予奖励;在合成回归、代码和分子数据任务中,相比监督微调与逐点强化学习,改善了不确定性校准,并降低预测误差、提升排序质量。

AI 根据报道生成 · 46 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    DAR:用分布感知强化学习改进LLM回归

    Jungsoo Park等提出Distribution-Aware Reward(DAR),用强化学习联合评估大语言模型对同一输入的多次预测所形成的预测分布。基于论文摘要,DAR通过各预测对整体分布质量的留一贡献进行奖励,在合成回归任务以及代码、分子数据任务上,相比监督微调和逐点强化学习改善了不确定性校准,并降低预测误差、提升排序质量。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。