跳到正文

研究主线

科研推理与 Agent 最新动态

科研推理与 Agent的成果、条件、工具和可复现方法。

21 条精选近 30 天 12 条共收录 35 条

订阅此主题 RSS 更新

精选归档 · 第 2 页

2月5日周四第 21–21 条
  1. Anthropic · Engineering Blog

    Anthropic量化智能体编码评测中的基础设施噪声

    Anthropic发现,基础设施资源配额可使Terminal-Bench 2.0成功率相差6个百分点,说明智能体编码评测分数会混入运行环境因素。实验保持同一Claude模型、评测框架和任务集,仅改变资源配置;资源余量从严格限制提升至无上限时,基础设施错误率由5.8%降至0.5%,总成功率提高6个百分点,但在3倍余量内分数变化处于噪声范围。

    本站判断:Anthropic通过Terminal-Bench 2.0和SWE-bench对照实验说明,资源配置会改变智能体编码评测结果,并给出控制评测变量的具体做法。