跳到正文
热点事件观察中

提出BoN策略评估框架

1 篇报道1 个报道来源2 天前更新

先了解这件事

报道摘要

基于论文摘要,作者提出面向仅有样本访问条件的 Best-of-N 策略评估与选择框架 BoN-DR,无需获取参考模型的响应似然。作者利用得分排名概率构造双稳健估计器,并据此提出最大化估计策略价值或改进置信下界两种采样预算选择规则,后者提供无伤害保证;该框架在合成实验和 GSM8K 上进行了评估。

摘自 arXiv · cs.AI

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    论文提出无需响应似然的 Best-of-N 策略评估框架 BoN-DR

    基于论文摘要,作者提出面向仅有样本访问条件的 Best-of-N 策略评估与选择框架 BoN-DR,无需获取参考模型的响应似然。作者利用得分排名概率构造双稳健估计器,并据此提出最大化估计策略价值或改进置信下界两种采样预算选择规则,后者提供无伤害保证;该框架在合成实验和 GSM8K 上进行了评估。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。