跳到正文
热点事件观察中

DUDA-Bench评测城市诊断智能体

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Yizhi Song等提出并发布DUDA-Bench,用于评测大语言模型智能体完成多模态数据驱动城市诊断的能力。该基准覆盖12个城市、五类城市问题,包含四个分析阶段的86个原子任务和22个工作流任务。 基于论文摘要,对7个骨干模型和5个智能体系统的评测显示,单项分析能力与端到端诊断表现存在明显差距,且系统带来的提升因骨干模型而异。轨迹分析进一步发现,未解决的证据缺口会跨阶段传播;智能体根据反馈修正假设和行动,有助于恢复任务,但自适应规划、证据整合与验证仍是主要短板。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    DUDA-Bench:评测多模态数据驱动城市诊断中的大语言模型智能体

    作者提出DUDA-Bench,将多模态数据驱动的城市诊断形式化为多阶段智能体工作流,包含12个城市、五类城市问题、86个原子任务和22个工作流任务。基于对7个骨干模型和5个智能体系统的评测,作者发现单项分析能力与端到端诊断之间存在明显差距,未解决的证据缺口会跨阶段传播,反馈下的假设和行动调整则有助于恢复任务。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。