HSS评测多模态模型直觉视觉推理
热点事件观察中
HSS评测多模态模型直觉视觉推理
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
Xingang Guo等作者基于论文摘要提出HSS基准,用图像和视频测试模型推断隐含时间、空间、社会及抽象结构的能力;初步结果显示,参与者准确率为93.1%,而受测模型中最强的GPT-6-astra在最高推理强度下为53.6%。 HSS为每项材料配有人工编写的提示,并按结构化分类组织。作者还探索了通过动态视觉操控处理任务的Agentic方案,其结果缩小了模型差距,但未完全弥合。该测试目前依据论文摘要,尚不代表独立复现。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 02:31
Humanity's Sixth Sense:多模态模型直觉视觉推理基准 HSS报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AIHumanity's Sixth Sense:多模态模型直觉视觉推理基准 HSS
论文作者提出 Humanity's Sixth Sense(HSS)基准,用于评测多模态模型从图像和视频中推断隐含时间、空间、社会与抽象结构的能力。基于论文摘要,参与者准确率为 93.1%,而最强模型 GPT-6-astra 在最高推理强度下达到 53.6%;作者探索的动态视觉操控 Agentic setup 缩小了差距,但未完全弥合。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。