FineART:面向双臂操作的高密度标注轨迹数据集与视觉-语言-动作模型
FineART提出一个面向复杂双臂操作的高密度标注数据集,包含40,543个 episode、1,718小时、533,913个子任务并覆盖151项任务;配套的FineART-VLA可预测下一步子任务以指导动作。
动态展示门槛:AI 前沿与应用 ≥ 65 分,量子方向 ≥ 60 分;已确认精选照常展示。
FineART提出一个面向复杂双臂操作的高密度标注数据集,包含40,543个 episode、1,718小时、533,913个子任务并覆盖151项任务;配套的FineART-VLA可预测下一步子任务以指导动作。
CSWAM在FastWAM中加入基于V-JEPA 2.1的因果语义专家,利用稀疏观测历史学习语义状态变化与运动,并通过因果注意力共享给视频流和动作流,同时保留仅动作推理。
研究团队提出 DepthWorld,一种基于 Stable Video Diffusion、通过空间潜变量分块联合预测多视角 RGB 与深度分布的机器人操作三维世界模型。