Selective-RL:迁移RL更新方向以提升视觉语言模型推理
热点事件观察中
Selective-RL:迁移RL更新方向以提升视觉语言模型推理
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
Suxin Ji、Hungtao Wan、Mingjun Liu、An Zhang等提出Selective-RL,从语言模型强化学习阶段的参数更新中提取具有幅度保持的主导矩阵方向,并迁移到视觉语言模型的语言模块,以提升视觉推理能力。 基于论文摘要,在三个模型家族和五个视觉推理基准的15组比较中,该方法有12组优于完整更新插值,其中Qwen接收模型上MathVision提升8.55个百分点。匹配对照显示,仅更新幅度或任意低秩本身不能复现这些收益。代码已开源(https://anonymous.4open.science/r/selective-rl)。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 12:00
Selective-RL选择性迁移强化学习更新以提升视觉推理能力报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AISelective-RL选择性迁移强化学习更新以提升视觉推理能力
论文提出Selective-RL,从语言模型的强化学习阶段更新中提取并保留具有幅度保持的主导矩阵方向,再迁移到视觉语言模型的语言模块。基于论文摘要,该方法在三个模型家族和五个视觉推理基准的15组比较中有12组优于完整更新插值,Qwen接收模型上的MathVision提升8.55个百分点;匹配对照显示,更新幅度或任意低秩本身不能复现这些收益。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。