跳到正文
热点事件观察中

LLM-as-a-Judge设计选择系统比较:模型身份是主要方差来源

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

Laurène Vaugrante和Thilo Hagendorff比较了10个推理模型在不同提示词、评分量表和模型设计下作为LLM评判器的表现,任务包括句子情感与毒性评分(每类超过500条)和问答对准确性二分类(n=600)。研究发现分类任务平均准确率为96.5%,但设计选择显著影响结果:评分量表可使测得偏差最多变化0.93分,提示词可使分类宽松度下降28.9个百分点,切换模型最多造成56.1个百分点变化,模型身份是方差的主要来源。 研究还发现降低推理强度既不影响准确率也不影响宽松度。以上结论基于论文摘要。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    LLM-as-a-Judge设计选择的系统比较:提示词、评分量表与模型的影响

    作者比较了10个推理模型在句子情感与毒性评分、问答对准确性分类两类任务中的表现,涵盖每类超过500条数据和600个问答对。基于论文摘要,研究发现模型在准确性分类任务上的平均准确率为96.5%,但评分量表可使偏差最多变化0.93分,提示词可使分类宽松度下降28.9个百分点,切换模型最多造成56.1个百分点的变化,模型身份是方差的主要来源。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。