跳到正文
Hugging Face Blog·· 5 天前精选

ThinkingBox:用数据库终态和20次重复评测AI Agent可靠性

The Agent Said It Was Done. The Database Disagreed.

研究任务与主要进展

Microsoft与Hugging Face发布ThinkingBox,以数据库终态和实际副作用而非回复或工具调用评判AI Agent,并在507个有状态业务工作流中为每个任务独立运行20次。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请阅读原文核验。

本站判断

ThinkingBox的核心增量是把Agent评测从最终回复和工具调用转向终态数据库记录及副作用,并加入独立重复运行,区分“偶尔能做对”与“持续做对”。结果对真实记录型Agent有参考价值,但当前基准任务均为合成工作流,成本基于指定端点和公开价格估算,且重试、缩小工具面和人工审批等措施的增益尚未实测。本站设想:可在保留任务与隐藏状态变化的条件下,对比错误分类重试相较于无重试基线的pass@1、20/20率和成本变化。

来源:Hugging Face Blog · huggingface.co