跳到正文
热点事件观察中

发布 ArcticQA 数据集与弃答基准

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Benjamin Wilcox 等发布 ArcticQA 数据集和 ArcticAbstain 配对基准,用于测试大语言模型在答案存在与答案缺失时是否恰当弃答。基于论文摘要,评测显示模型的弃答能力有限:答案存在时弃答率为 0.0% 至 63.0%,移除正确答案后,弃答率平均仅增加 5.05 个百分点。 ArcticQA 包含 194 个源自北极原始研究的问题,并自动检查答案支持度及干扰项与证据的矛盾;ArcticAbstain 在有答案和无答案条件下设置明确弃答选项,后者用干扰项替换正确答案。研究人员以高推理强度测试 Gemini、Claude 和 ChatGPT 系列共 8 个模型,每个条件进行 3 次试验,记录 9,312 条回答,数据集与基准已在 GitHub 发布。

AI 根据报道生成 · 35 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    ArcticQA与ArcticAbstain评测大语言模型在北极科学问题上的弃答能力

    研究者推出ArcticQA数据集和ArcticAbstain成对基准,用于评测大语言模型在答案存在与答案缺失时是否恰当弃答。基于论文摘要,八个Gemini、Claude和ChatGPT系列模型在高推理强度下共产生9,312条回答;答案存在时弃答率为0.0%至63.0%,移除正确答案后弃答率平均增加5.05个百分点,数据集与基准已发布于GitHub。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。