arXiv · cs.AI· Kaixi Feng, Guoheng Sun, Ziyao Wang, Yexiao He, Zheyu Shen, Ang Li·· 2 天前
DIVA提出面向视觉-语言-动作策略的双空间意图感知视觉衰减
DIVA: Dual-Space Intent-Aware Visual Attenuation for Vision-Language-Action Policies
arXiv:2610.09144v1阅读论文 PDF ↗
仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。
作者:Kaixi Feng, Guoheng Sun, Ziyao Wang, Yexiao He, Zheyu Shen, Ang Li
首次提交:2026-10-07 05:37
研究任务与主要进展
DIVA是一种面向视觉-语言-动作策略的双空间意图感知视觉衰减模块,通过先估计视觉Token相关性再进行衰减来调节其对决策的影响。该方法在LIBERO上将OpenVLA-OFT平均成功率从96.6%提升至98.0%,并将零样本LIBERO-Plus得分从69.6提升至72.6;真实环境实验还显示其在任务无关视觉扰动下保持一致增益。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。
来源:arXiv · cs.AI · arxiv.org