跳到正文
arXiv · cs.AI· Tzu-Ling Lin, Dong-Ting Yao, Teng-Fang Hsiao, Wei-Chih Chen, Hong-Han Shuai·· 2 天前

HalluPeer:面向科学同行评审幻觉检测的分类驱动基准

HalluPeer: A Taxonomy-driven Benchmark for Detecting Hallucinations in Scientific Peer Reviews

arXiv:2609.03580v2阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Tzu-Ling Lin, Dong-Ting Yao, Teng-Fang Hsiao, Wei-Chih Chen, Hong-Han Shuai

研究任务与主要进展

作者提出HalluPeer,用于检测科学同行评审中的幻觉,提供论文内容、人写评审和注入幻觉评审的对齐三元组,并标注检测、分类与定位任务。实验覆盖12K篇论文和38K篇评审,结果显示现有检测器难以区分幻觉与正常批评,真实评审中也存在HalluPeer定义的幻觉模式;项目页面为 https://github.com/Lin-TzuLing/HalluPeer.git。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

来源:arXiv · cs.AI · arxiv.org