跳到正文
热点事件观察中

LLM自我改进存在赢家诅咒

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

Litao Hu与Yutong Tang研究LLM反复利用小型评估集筛选改进方案时的“赢家诅咒”,结论是选择集上的高分会系统性高估实际收益;基于论文摘要,在Qwen改写自身指令、每轮候选用600个留出样本评估的实验中,第一代后多数提案有害,论文称最佳候选的夸大幅度可由模型给出。 预注册研究中,贪心循环最终候选的选择集得分比留出准确率高13—20个百分点(每轮用16个选择样本)和1—5个百分点(256个)。用64个从未参与选择的样本同时评估初始与当前指令,可消除循环平均收益偏差,但单次估计仍约有6点误差;TREC的留出收益随选择集增大,GSM8K则未体现这一趋势,测试的接受规则也未优于贪心接受。

AI 根据报道生成 · 34 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    LLM自我改进循环中的赢家诅咒:选择噪声、锁定与接受规则研究

    该论文研究LLM自我改进循环中反复复用小型评估集所导致的选择偏差,并将其建模为测量噪声下的选择问题。摘要称,在Qwen模型改写自身指令、每个候选用600个留出样本评估的实验中,第一代之后的大多数提案有害,最佳候选的夸大幅度可由模型给出;预注册研究显示,贪心循环的选择集得分比留出准确率高13至20个百分点,使用256个选择样本时仍高1至5个百分点。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。