跳到正文
热点事件持续更新

评估工具代理故障检测与恢复

1 篇报道1 个报道来源1 天前更新

先了解这件事

报道摘要

基于论文摘要,研究人员在函数调用基准中注入四类故障,对六个模型、三类模型家族共1,920次多步任务试验进行检测、计划调整和恢复分析。Agent在显式错误下有91.3%的试验将其视为问题,但对格式正常的错误值仅有58.8%,无误时仍有26.8%报告问题;推理模型相较指令模型更少察觉错误但更常调整计划,恢复率未显著变化。故障后同一工具连续重复调用最高达22.2%,而要求检查结果的提示未改善检测。

摘自 arXiv · cs.AI

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    工具使用语言模型 Agent 对显式错误与静默故障的检测与恢复

    基于论文摘要,研究人员在函数调用基准中注入四类故障,对六个模型、三类模型家族共1,920次多步任务试验进行检测、计划调整和恢复分析。Agent在显式错误下有91.3%的试验将其视为问题,但对格式正常的错误值仅有58.8%,无误时仍有26.8%报告问题;推理模型相较指令模型更少察觉错误但更常调整计划,恢复率未显著变化。故障后同一工具连续重复调用最高达22.2%,而要求检查结果的提示未改善检测。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。