跳到正文

动态展示门槛:AI 前沿与应用 ≥ 65 分,量子方向 ≥ 60 分;已确认精选照常展示。

今天10月8日周四4 条
  1. arXiv · cs.AI

    Guided Action Flow用动作价值引导冻结视觉语言动作策略

    Guided Action Flow通过学习紧凑的观测条件动作价值评论器,在冻结视觉语言动作策略的情况下用动作梯度引导反向流采样。基于论文摘要,物理机器人六项操作任务的总成功率从60.0%提升至82.5%,六种改变光照和加入物体干扰条件下、涉及其中三项任务的总成功率从34.2%提升至49.2%;方法使用约273.5万可训练评论器参数,并配合0.45B参数VLA。

  2. arXiv · cs.AI

    NeMo-DCR:面向万亿参数规模智能体强化学习的位精确增量压缩重拟合

    论文摘要介绍 NeMo-DCR,用于在训练与 rollout 分离的智能体强化学习中同步 30B 至 1T 参数模型。作者称该方法仅传输变化,并通过 XOR 掩码、覆写、原地应用、重试和联合提交实现与完整检查点一致的参数位与缓冲区位;跨 AWS 区域完整 1T 重拟合需 87.5 分钟,而 3% 变化率下采用 relay tree 的 1T 重拟合用时 150 秒。

  3. arXiv · cs.AI

    自我反思蒸馏将事后经验转化为事前预判

    研究提出自我反思蒸馏(SRD),利用交互完成后的轨迹经验监督同一策略在行动前作出预判,以补充可验证奖励强化学习(RLVR)。基于论文摘要,SRD在10个工具集成推理和长时程智能体任务上相对RLVR与自蒸馏基线最高提升24.2个百分点。在2B设置中98%的轨迹组均为失败时,RLVR成功率为0.0%,加入SRD后在相同采样预算下达到60.6%。

6月19日周五
  1. OpenAI · Alignment Research Blog

    OpenAI:有益特质强化学习促进模型对齐泛化与持久性

    OpenAI研究团队发现,在真实场景有益特质数据中加入少量强化学习训练,可使模型在53项内外部基准中的44项上超过同算力基线。训练于单一健康领域时,模型仍能改善非健康领域的欺骗、奖励投机和一般失配表现;去除健康与科学数据后,健康评测也获得提升。模型在对抗性提示和有害微调下表现出更强的行为持久性,但该结果仍属初步证据,尚需进一步区分有益特质训练与常规后训练强化学习的作用。

    本站判断:文章给出训练数据、对比基线与跨域评测,显示有益特质强化学习可改善多类安全相关行为并增强抗对抗引导能力。