Guided Action Flow用动作价值引导冻结视觉语言动作策略
Guided Action Flow通过学习紧凑的观测条件动作价值评论器,在冻结视觉语言动作策略的情况下用动作梯度引导反向流采样。基于论文摘要,物理机器人六项操作任务的总成功率从60.0%提升至82.5%,六种改变光照和加入物体干扰条件下、涉及其中三项任务的总成功率从34.2%提升至49.2%;方法使用约273.5万可训练评论器参数,并配合0.45B参数VLA。
动态展示门槛:AI 前沿与应用 ≥ 65 分,量子方向 ≥ 60 分;已确认精选照常展示。
Guided Action Flow通过学习紧凑的观测条件动作价值评论器,在冻结视觉语言动作策略的情况下用动作梯度引导反向流采样。基于论文摘要,物理机器人六项操作任务的总成功率从60.0%提升至82.5%,六种改变光照和加入物体干扰条件下、涉及其中三项任务的总成功率从34.2%提升至49.2%;方法使用约273.5万可训练评论器参数,并配合0.45B参数VLA。
论文摘要介绍 NeMo-DCR,用于在训练与 rollout 分离的智能体强化学习中同步 30B 至 1T 参数模型。作者称该方法仅传输变化,并通过 XOR 掩码、覆写、原地应用、重试和联合提交实现与完整检查点一致的参数位与缓冲区位;跨 AWS 区域完整 1T 重拟合需 87.5 分钟,而 3% 变化率下采用 relay tree 的 1T 重拟合用时 150 秒。
研究提出自我反思蒸馏(SRD),利用交互完成后的轨迹经验监督同一策略在行动前作出预判,以补充可验证奖励强化学习(RLVR)。基于论文摘要,SRD在10个工具集成推理和长时程智能体任务上相对RLVR与自蒸馏基线最高提升24.2个百分点。在2B设置中98%的轨迹组均为失败时,RLVR成功率为0.0%,加入SRD后在相同采样预算下达到60.6%。
基于论文摘要,研究团队为十英雄 MOBA 建立包含206个单位的多智能体世界模型,并用最长6000个时间步的游戏训练策略。策略在1400步自由运行梦境中训练后,通过连续异步 Dyna 循环在真实游戏中取得70.2%胜率,为421/600局,95%置信区间为66.4%至73.7%,高于循环前的33.7%。
OpenAI研究团队发现,在真实场景有益特质数据中加入少量强化学习训练,可使模型在53项内外部基准中的44项上超过同算力基线。训练于单一健康领域时,模型仍能改善非健康领域的欺骗、奖励投机和一般失配表现;去除健康与科学数据后,健康评测也获得提升。模型在对抗性提示和有害微调下表现出更强的行为持久性,但该结果仍属初步证据,尚需进一步区分有益特质训练与常规后训练强化学习的作用。
本站判断:文章给出训练数据、对比基线与跨域评测,显示有益特质强化学习可改善多类安全相关行为并增强抗对抗引导能力。