CLM-v0.1-8B公开裁判评测接近随机
热点事件观察中
CLM-v0.1-8B公开裁判评测接近随机
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
论文作者Gowthamkumar Nandakishore基于论文摘要评测Contrastive-LM/CLM-v0.1-8B:在五个偏好基准和一个幻觉基准上,其得分仅为0.351—0.593,在RM-Bench和JudgeBench上与抛硬币无显著差异,并始终输出同一标签,在HaluEval上仅达到“始终选首项”的平凡基线。 同参数量的奖励模型和生成式裁判得分分别为0.764—0.976和0.611—0.778,差距经校正后均显著。基于CLM置信度的级联机制会将92.3%至100%的样本升级交给强裁判,表明其近乎随机的判断无法有效降低强裁判负荷。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 12:00
CLM-as-a-Judge:在公开裁判基准上评估 CLM-v0.1-8B报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AICLM-as-a-Judge:在公开裁判基准上评估 CLM-v0.1-8B
研究评估开放对比决策模型 CLM-v0.1-8B 作为裁判的表现。基于论文摘要,其在五个公开偏好基准和一个幻觉基准上的得分介于0.351至0.593,在 RM-Bench 和 JudgeBench 上与抛硬币无显著差异,并始终输出同一标签,达到 HaluEval 的 trivial always-first 基线。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。