跳到正文
热点事件观察中

ST-Bench评测科学多智能体系统

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

Qi Cheng等人提出ST-Bench,并在统一GPT-5骨干下评测五种多智能体系统生成方法;论文摘要显示,10种配置中有9种综合得分超过最低成本的单智能体基线,但最高分配置的推理时间约为基线四倍。 该基准包含源自水文学、农业和湿地甲烷研究的100项数据科学任务,扩展为2,067个经领域专家验证的查询。研究比较了两种训练协议下的多智能体配置;其中一种成本低于单智能体基线两倍的配置,可获得最高配置的大部分收益。结果目前限于该地球科学任务集,尚不能证明多智能体在一般科研任务中的普遍优势。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    ST-Bench:面向科学研究任务的多智能体系统时空基准

    Qi Cheng等人提出ST-Bench,用于比较五种多智能体系统生成方法与同一GPT-5骨干下单智能体基线在复杂科学数据分析中的表现。基准包含100项源自地球科学研究的数据科学任务和2,067个由领域专家验证的查询;10种多智能体配置中有9种超过最便宜的单智能体基线,最强配置的综合得分接近其三倍,但推理时间约为四倍,低于两倍成本的配置可获得大部分收益。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。