跳到正文
热点事件观察中

DIVA提升视觉语言动作策略抗扰表现

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

Kaixi Feng等在arXiv论文摘要中提出DIVA双空间意图感知视觉衰减模块,用于调节视觉Token对视觉—语言—动作策略的影响。摘要称,该方法先估计Token相关性再进行衰减,保留完整视觉Token序列,且不需要外部定位监督。 在LIBERO基准上,DIVA使OpenVLA-OFT平均成功率从96.6%升至98.0%,零样本LIBERO-Plus得分从69.6升至72.6;作者还报告了真实环境任务无关视觉扰动实验中的一致增益,体现出超越仿真场景的抗扰潜力。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    DIVA提出面向视觉-语言-动作策略的双空间意图感知视觉衰减

    DIVA是一种面向视觉-语言-动作策略的双空间意图感知视觉衰减模块,通过先估计视觉Token相关性再进行衰减来调节其对决策的影响。该方法在LIBERO上将OpenVLA-OFT平均成功率从96.6%提升至98.0%,并将零样本LIBERO-Plus得分从69.6提升至72.6;真实环境实验还显示其在任务无关视觉扰动下保持一致增益。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。