跳到正文
热点事件持续更新

SQAM以标量伴随微调流策略

1 篇报道1 个报道来源19 小时前更新

先了解这件事

AI 综述

Yonghoon Dong等提出标量伴随匹配的Q学习(SQAM),用于流策略的离策略强化学习微调;论文摘要显示,该方法在OGBench四个最难领域的成功率较各领域最强基线高18至35个百分点,并在三个真实双臂机器人任务中超过监督微调。 作者称,预训练流策略的批量平均速度雅可比集中于对角线,据此推导出闭式标量伴随,将最终动作处的价值梯度按流时间缩放,从而避免逐流步骤计算向量—雅可比积。当前证据仅来自论文摘要。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv · cs.AI
    标量伴随匹配的Q学习(SQAM)提升流策略离线强化学习性能

    Yonghoon Dong等人提出Q-Learning with Scalar Adjoint Matching(SQAM),将标量伴随与策略生成动作上的价值惩罚结合,用于微调流策略的离策略强化学习。基于论文摘要,该方法避免了每个流步骤的向量—雅可比积;在四个最难的OGBench领域,成功率分别较各领域最强基线高18至35个百分点,并在真实双臂机器人三个任务中超过监督微调。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。