Hugging Face Blog·· 10 天前精选
ProvenanceGuard:面向MCP智能体的来源感知事实验证方法
Getting the Source Right, Not Just the Fact: Source-Aware Verification for MCP Agents
研究任务与主要进展
ProvenanceGuard是一种面向MCP智能体的生成后验证层,通过保留工具输出来源身份,检查每个声明是否由答案所指向的来源支持,并输出逐声明来源判定和答案级放行或拦截结果。基于医疗智能体的281条真实轨迹测试,在留出的40个答案和361个声明中,专家标记的139个不应放行声明被捕获138个,来源识别准确率约86%;在相似来源测试中,阻塞判定F1为0.846,但精确来源识别率降至50.3%。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请阅读原文核验。
本站判断
ProvenanceGuard针对多工具MCP智能体中“事实存在但归因来源错误”的验证缺口,保留声明与工具输出的来源对应关系,并给出逐声明判定和答案级放行或拦截结果。医疗轨迹测试显示其在阻塞不支持声明方面接近专家判断,但相似来源下的精确来源识别仍明显较弱,修复结果也可能退化为安全回退。本站设想:可在增加来源相似度和隐含归因难度的独立测试集上,比较其逐声明拦截率、精确归因率与回退率。
来源:Hugging Face Blog · huggingface.co