跳到正文
热点事件观察中

LLM自评与开放行为相关性很低

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

Contreras等在arXiv报告中称,他们为25个来自17家开发者的大语言模型构建心理测量工具,发现模型自述与开放行为几乎不相关;冗长度是部分例外。研究将300个题目各重复施测30次,得到五个一致性较高的因素,并用151名人类和LLM评委评定2500份行为样本。人类与LLM评委的行为判断平均相关为r=.51,而自述与人工评级仅r=.09(95% CI[-.07,.18]);校正评价标准不可靠性后,五个因素中四个仍接近零。

AI 根据报道生成 · 1 天前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv · cs.AI
    LLM原生心理测量工具揭示25个模型的自述—行为差距

    作者用LLM专用行为构建心理测量工具,对25个来自17家开发者的模型施测,发现自述结果与人工行为评价几乎不相关,而冗长度是部分例外。300个题目各重复施测30次得到五个具有较高一致性的因素;人工与LLM评委对行为的判断平均相关为r=.51,自述与人工评级的平均相关仅为r=.09。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。