跳到正文
arXiv · cs.AI· Dheeraj Varghese, Anna Vettoruzzo, Walter Simoncini, Michelle Lorena Acevedo Callejas, Mohammad Mahdi Derakhshani, Kristof Meding, Joaquin Vanschoren, Cees G. M. Snoek·· 2 天前

PlaySuite:用于交互式视觉智能的大规模评测基准

PlaySuite: A Large-Scale Benchmark for Interactive Visual Intelligence

arXiv:2610.07127v1阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Dheeraj Varghese, Anna Vettoruzzo, Walter Simoncini, Michelle Lorena Acevedo Callejas, Mohammad Mahdi Derakhshani, Kristof Meding, Joaquin Vanschoren, Cees G. M. Snoek

研究任务与主要进展

作者提出 PlaySuite,一个覆盖超过5K款开源电子游戏的大规模交互式视觉智能评测基准,覆盖多种类型与游戏引擎,并构建适用于异构游戏的统一闭环交互框架和 Video-LLM 评审协议。基于论文摘要,作者评测了14个近期开源模型,发现模型虽具备较强推理能力,却难以持续推进目标,并在空间定位、动作执行和自我纠错方面反复失败。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

来源:arXiv · cs.AI · arxiv.org