VisualNoiseQA评估噪声视觉反馈下的主动推理
热点事件观察中
VisualNoiseQA评估噪声视觉反馈下的主动推理
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
论文作者提出 VisualNoiseQA 基准,用于评估纯文本大语言模型能否在固定现成视觉语言模型返回噪声视觉反馈时,主动完成视觉问答推理。作者在涵盖感知、图表理解和知识密集型推理的1000个实例上评测了多个大语言模型推理器。 推理器需对同一查询多次采样,以自一致性获得经验不确定性信号,再决定后续查询角度及停止时机。基准从多种视觉问答来源和两个噪声视觉语言模型自动构建,仅保留视觉传感器回答不一致、但人类可解决的问题;当前材料未提供各模型的具体性能结果。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 12:00
VisualNoiseQA:评估大语言模型在噪声视觉证据下的主动视觉推理能力报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AIVisualNoiseQA:评估大语言模型在噪声视觉证据下的主动视觉推理能力
作者提出 VisualNoiseQA 基准,用于评估纯文本大语言模型在噪声视觉反馈下的主动视觉推理能力。该基准让模型将现成视觉语言模型作为随机视觉传感器,通过多次采样和自一致性提供经验不确定性信号,迭代选择下一次查询并决定何时停止;作者在涵盖感知、图表理解和知识密集型推理的1000个实例上评估了多个大语言模型推理器。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。