arXiv · cs.AI· Obada Kraishan·· 1 天前
工具使用语言模型 Agent 对显式错误与静默故障的检测与恢复
Loud Failures, Quiet Failures: Fault Detection and Recovery in Tool-Using Language Model Agents
arXiv:2610.10062v1阅读论文 PDF ↗
仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。
作者:Obada Kraishan
首次提交:2026-10-07 21:29
研究任务与主要进展
基于论文摘要,研究人员在函数调用基准中注入四类故障,对六个模型、三类模型家族共1,920次多步任务试验进行检测、计划调整和恢复分析。Agent在显式错误下有91.3%的试验将其视为问题,但对格式正常的错误值仅有58.8%,无误时仍有26.8%报告问题;推理模型相较指令模型更少察觉错误但更常调整计划,恢复率未显著变化。故障后同一工具连续重复调用最高达22.2%,而要求检查结果的提示未改善检测。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。
来源:arXiv · cs.AI · arxiv.org