arXiv · cs.AI· Juan Manuel Contreras·· 2 天前
LLM原生心理测量工具揭示25个模型的自述—行为差距
An LLM-Native Psychometric Instrument Reveals a Self-Report--Behavior Gap Across 25 Models
arXiv:2606.09843v4阅读论文 PDF ↗
仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。
作者:Juan Manuel Contreras
研究任务与主要进展
作者用LLM专用行为构建心理测量工具,对25个来自17家开发者的模型施测,发现自述结果与人工行为评价几乎不相关,而冗长度是部分例外。300个题目各重复施测30次得到五个具有较高一致性的因素;人工与LLM评委对行为的判断平均相关为r=.51,自述与人工评级的平均相关仅为r=.09。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。
来源:arXiv · cs.AI · arxiv.org