跳到正文
arXiv · cs.AI· Juan Manuel Contreras·· 2 天前

LLM原生心理测量工具揭示25个模型的自述—行为差距

An LLM-Native Psychometric Instrument Reveals a Self-Report--Behavior Gap Across 25 Models

arXiv:2606.09843v4阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Juan Manuel Contreras

研究任务与主要进展

作者用LLM专用行为构建心理测量工具,对25个来自17家开发者的模型施测,发现自述结果与人工行为评价几乎不相关,而冗长度是部分例外。300个题目各重复施测30次得到五个具有较高一致性的因素;人工与LLM评委对行为的判断平均相关为r=.51,自述与人工评级的平均相关仅为r=.09。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

来源:arXiv · cs.AI · arxiv.org