跳到正文
arXiv · cs.AI· Obada Kraishan·· 1 天前

工具使用语言模型 Agent 对显式错误与静默故障的检测与恢复

Loud Failures, Quiet Failures: Fault Detection and Recovery in Tool-Using Language Model Agents

arXiv:2610.10062v1阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Obada Kraishan

首次提交:2026-10-07 21:29

研究任务与主要进展

基于论文摘要,研究人员在函数调用基准中注入四类故障,对六个模型、三类模型家族共1,920次多步任务试验进行检测、计划调整和恢复分析。Agent在显式错误下有91.3%的试验将其视为问题,但对格式正常的错误值仅有58.8%,无误时仍有26.8%报告问题;推理模型相较指令模型更少察觉错误但更常调整计划,恢复率未显著变化。故障后同一工具连续重复调用最高达22.2%,而要求检查结果的提示未改善检测。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

来源:arXiv · cs.AI · arxiv.org