Humanity's Sixth Sense:多模态模型直觉视觉推理基准 HSS
Humanity's Sixth Sense: Benchmarking Intuitive Visual Reasoning in Multimodal Models
仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。
作者:Xingang Guo, Jing Gu, Brian Jang, Renxiong Wang, Utkarsh Tyagi, Daniel Quigley, Steven Li, David Yan, Daniel Yue Zhang, Darvin Yi, Forrest Huang, HiJae Kim, Tianyi Zhang, Jared Lichtarge, Jihua Huang, Le Xue, Manan Tomar, Qiuyi Richard Zhang, Ruofei Yu, Seth Neel, Yaning Hu, Marcella Valentine, Xinzhe Jiang, Daniel Evans, Chenguang Wang, Dustin Tran, Tong Zhao, Yinfei Yang, Yunzhong He
首次提交:2026-10-07 02:31
论文作者提出 Humanity's Sixth Sense(HSS)基准,用于评测多模态模型从图像和视频中推断隐含时间、空间、社会与抽象结构的能力。基于论文摘要,参与者准确率为 93.1%,而最强模型 GPT-6-astra 在最高推理强度下达到 53.6%;作者探索的动态视觉操控 Agentic setup 缩小了差距,但未完全弥合。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。
来源:arXiv · cs.AI · arxiv.org