语言模型抑郁评分反映评分者
热点事件观察中
语言模型抑郁评分反映评分者
1 篇报道1 个报道来源1 天前更新
先了解这件事
报道摘要
基于论文摘要,研究预注册了由11个开放模型、不同提示和评分设置组成的880个语言模型评分者,并用189次访谈对照八项患者健康问卷。结果显示,模型选择解释总症状评分方差的30.0%,稳定个体差异仅占10.5%;两名随机评分者在AUC≥0.70时对筛查结果有40%的分歧。对86次新访谈的锁定分析复现了主要发现,探索性校准使准确率由约60%升至75%并将分歧减半,但仍约五分之一参与者的判断不同。
摘自 arXiv · cs.AI
最新进展10月7日 12:00
语言模型对抑郁程度的评分更多反映评分者而非患者报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AI语言模型对抑郁程度的评分更多反映评分者而非患者
基于论文摘要,研究预注册了由11个开放模型、不同提示和评分设置组成的880个语言模型评分者,并用189次访谈对照八项患者健康问卷。结果显示,模型选择解释总症状评分方差的30.0%,稳定个体差异仅占10.5%;两名随机评分者在AUC≥0.70时对筛查结果有40%的分歧。对86次新访谈的锁定分析复现了主要发现,探索性校准使准确率由约60%升至75%并将分歧减半,但仍约五分之一参与者的判断不同。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。