跳到正文
arXiv · cs.AI· Suxin Ji, Hungtao Wan, Mingjun Liu, An Zhang·· 2 天前

Selective-RL选择性迁移强化学习更新以提升视觉推理能力

Selective Transfer of RL Updates for Visual Reasoning

arXiv:2610.08659v1阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Suxin Ji, Hungtao Wan, Mingjun Liu, An Zhang

研究任务与主要进展

论文提出Selective-RL,从语言模型的强化学习阶段更新中提取并保留具有幅度保持的主导矩阵方向,再迁移到视觉语言模型的语言模块。基于论文摘要,该方法在三个模型家族和五个视觉推理基准的15组比较中有12组优于完整更新插值,Qwen接收模型上的MathVision提升8.55个百分点;匹配对照显示,更新幅度或任意低秩本身不能复现这些收益。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

来源:arXiv · cs.AI · arxiv.org