跳到正文
热点事件观察中

ChartBmkAgent构建图表问答诊断基准

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Langxi Huang等提出ChartBmkAgent,用中心化工具协调多个专门智能体,把简化的图表问答错误分类扩展为完整诊断样本,并要求各阶段保留与目标错误类别对齐的验收依据。基于论文摘要,在300个覆盖分类体系的样本中,多模态大模型准确率为32.7%至84.3%,且不同模型的错误类别表现存在差异。 三次源模型对比中,定向追问得分为50.0%,低于匹配对照的82.2%(p=8.96×10^-6),六组跨模型比较方向一致;多个评估模型复核后,86.4%的样本被判定确实检验了指定错误类别。结果表明该方法能够生成具有针对性的诊断数据,但相关结论仅来自论文摘要。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    ChartBmkAgent:基于多智能体治理构建图表问答基准

    ChartBmkAgent通过中心化 harness 管理专门智能体,依据稀疏错误分类规范构建图表问答诊断样本,并记录各阶段与原始错误类别的对齐依据。基于论文摘要,在300个覆盖分类体系的样本中,MLLM准确率为32.7%至84.3%;三次源模型对比中,定向追问得分低于匹配对照,分别为50.0%和82.2%,p=8.96×10^-6,六组跨模型比较方向一致。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。