GroundingPI:面向物理智能的视觉原语定位基础模型
GroundingPI: A Grounding Foundation Model towards Physical Intelligence with Visual Primitives
仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。
作者:Qize Yu, Lianrui Fan, Boyu Chen, Jiaqi Liang, Xini Ding, Yue Chen, Zetian Song, Yuran Wang, Yi Zou, Kaixuan Wang, Tianxing Chen, Wenxuan Song, Bohan Zhou, Mingleyang Li, Siqiao Huang, Yuqi Ye, Caigao Jiang, Wei Wei, Ruihai Wu, Hang Zhang, Yixiao Ge, Shuchang Zhou, Shilong Liu, Xianming Liu, Ping Luo, Shiyu Huang
首次提交:2026-09-30 20:20
GroundingPI 是一种 4B 定位基础模型,将点框表示为共享词表中的量化坐标,以支持精确目标定位。作者基于论文摘要报告,该模型在覆盖 11 项感知能力的 34 个基准、44 个基线上取得平均 73.68% 的表现,并超过更大规模的 GPT-6 Astra(71.54%)。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。
基于论文摘要,GroundingPI 将面向物理智能的精确定位作为基础能力,并在多模态预训练、监督微调和 GRPO 强化学习后用于机器人操作与自动驾驶。作者报告其在 34 个基准、44 个基线上的平均表现为 73.68%,但当前材料仅提供摘要,尚不足以核验数据规模、实验细节或下游结果的具体条件。
来源:arXiv · cs.AI · arxiv.org