发布 ArcticQA 数据集与弃答基准
热点事件观察中
发布 ArcticQA 数据集与弃答基准
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
Benjamin Wilcox 等发布 ArcticQA 数据集和 ArcticAbstain 配对基准,用于测试大语言模型在答案存在与答案缺失时是否恰当弃答。基于论文摘要,评测显示模型的弃答能力有限:答案存在时弃答率为 0.0% 至 63.0%,移除正确答案后,弃答率平均仅增加 5.05 个百分点。 ArcticQA 包含 194 个源自北极原始研究的问题,并自动检查答案支持度及干扰项与证据的矛盾;ArcticAbstain 在有答案和无答案条件下设置明确弃答选项,后者用干扰项替换正确答案。研究人员以高推理强度测试 Gemini、Claude 和 ChatGPT 系列共 8 个模型,每个条件进行 3 次试验,记录 9,312 条回答,数据集与基准已在 GitHub 发布。
AI 根据报道生成 · 35 分钟前更新
最新进展10月7日 12:58
ArcticQA与ArcticAbstain评测大语言模型在北极科学问题上的弃答能力报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AIArcticQA与ArcticAbstain评测大语言模型在北极科学问题上的弃答能力
研究者推出ArcticQA数据集和ArcticAbstain成对基准,用于评测大语言模型在答案存在与答案缺失时是否恰当弃答。基于论文摘要,八个Gemini、Claude和ChatGPT系列模型在高推理强度下共产生9,312条回答;答案存在时弃答率为0.0%至63.0%,移除正确答案后弃答率平均增加5.05个百分点,数据集与基准已发布于GitHub。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。