跳到正文
arXiv · cs.AI· Rafael Teixeira Sousa, Vinícius Paulo Lopes de Oliveira, Elisa Ayumi Masasi de Oliveira, Luiza Martins de Freitas Cintra, Fernanda Bufon Färber, Igor Dias Aguiar, Julia Yasmim de Almeida Nobre, Arlindo Rodrigues Galvão Filho·· 3 天前精选

SpatialChain:审计视觉语言模型空间推理忠实性的基准

SpatialChain: A Benchmark for Auditing Spatial Reasoning Faithfulness in VLMs

arXiv:2610.06413v1阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Rafael Teixeira Sousa, Vinícius Paulo Lopes de Oliveira, Elisa Ayumi Masasi de Oliveira, Luiza Martins de Freitas Cintra, Fernanda Bufon Färber, Igor Dias Aguiar, Julia Yasmim de Almeida Nobre, Arlindo Rodrigues Galvão Filho

首次提交:2026-10-05 22:29

研究任务与主要进展

作者提出SpatialChain基准,用28,350条训练样本和899条测试样本,将空间问题与基于场景图的推理链配对,以审计视觉语言模型是否存在语言捷径。对九个思考型视觉语言模型的评估显示,部分模型问答准确率达到79%及以上但捷径率超过39%;对Qwen3-VL-8B进行SFT后,域内准确率提升6.2个百分点,捷径率降至22%。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

本站判断

SpatialChain将空间问题与场景图推理链配对,并通过链条重叠指标和场景图感知的LLM评审,分别评估答案正确性之外的忠实性与完整性。基于论文摘要,九个思考型视觉语言模型中部分模型在保持较高问答准确率的同时存在超过39%的捷径率,说明单纯准确率不足以判断空间推理质量;SFT虽改善Qwen3-VL-8B的域内表现,但其外部基准上的风格化效应仍需区分。当前材料仅为论文摘要,具体实验设置和完整结果尚未核验。

来源:arXiv · cs.AI · arxiv.org