临床LLM三动作评估框架提出
热点事件观察中
临床LLM三动作评估框架提出
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
据arXiv论文摘要,Weili Wu与Mingzhan Yang提出DECIDE/ASK/DEFER框架,用于评估临床大语言模型在证据不完整时自主决策、获取信息或转交临床人员,并以盲化协议隐藏证据完整性元数据。 研究基于DDXPlus构建200个匹配临床证据状态,评测Qwen、Gemini和GPT。相同证据下,三类模型在137个状态中的行动选择不一致;该结果目前来自摘要所述评测,尚不代表真实临床环境中的独立验证。
AI 根据报道生成 · 43 分钟前更新
最新进展10月7日 07:26
临床大语言模型研究:在证据不足时决策、询问或转交报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AI临床大语言模型研究:在证据不足时决策、询问或转交
作者提出面向证据不完整场景的 DECIDE/ASK/DEFER 框架,让临床大语言模型分别选择自主决策、获取信息或转交临床人员,并通过盲化协议隐藏证据完整性元数据。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。