arXiv · cs.AI· Jonas Schweisthal, Yuxin Wang, Athiya Deviyani, Stefan Feuerriegel, Dennis Frauen·· 2 天前
论文提出无需响应似然的 Best-of-N 策略评估框架 BoN-DR
Efficient Best-of-N policy evaluation for inference-time alignment
arXiv:2610.09250v1阅读论文 PDF ↗
仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。
作者:Jonas Schweisthal, Yuxin Wang, Athiya Deviyani, Stefan Feuerriegel, Dennis Frauen
首次提交:2026-10-07 08:26
研究任务与主要进展
基于论文摘要,作者提出面向仅有样本访问条件的 Best-of-N 策略评估与选择框架 BoN-DR,无需获取参考模型的响应似然。作者利用得分排名概率构造双稳健估计器,并据此提出最大化估计策略价值或改进置信下界两种采样预算选择规则,后者提供无伤害保证;该框架在合成实验和 GSM8K 上进行了评估。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。
来源:arXiv · cs.AI · arxiv.org