跳到正文
热点事件观察中

CLM-v0.1-8B公开裁判评测接近随机

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

论文作者Gowthamkumar Nandakishore基于论文摘要评测Contrastive-LM/CLM-v0.1-8B:在五个偏好基准和一个幻觉基准上,其得分仅为0.351—0.593,在RM-Bench和JudgeBench上与抛硬币无显著差异,并始终输出同一标签,在HaluEval上仅达到“始终选首项”的平凡基线。 同参数量的奖励模型和生成式裁判得分分别为0.764—0.976和0.611—0.778,差距经校正后均显著。基于CLM置信度的级联机制会将92.3%至100%的样本升级交给强裁判,表明其近乎随机的判断无法有效降低强裁判负荷。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    CLM-as-a-Judge:在公开裁判基准上评估 CLM-v0.1-8B

    研究评估开放对比决策模型 CLM-v0.1-8B 作为裁判的表现。基于论文摘要,其在五个公开偏好基准和一个幻觉基准上的得分介于0.351至0.593,在 RM-Bench 和 JudgeBench 上与抛硬币无显著差异,并始终输出同一标签,达到 HaluEval 的 trivial always-first 基线。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。