长目标重标注削弱策略泛化
热点事件观察中
长目标重标注削弱策略泛化
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
John L. Zhou、Yuxuan Dong和Jonathan C. Kao在预印本中报告,受控实验显示,训练时增加目标重标注时域,会显著降低目标条件行为克隆策略的泛化与性能;即使测试目标只是邻近子目标,训练时域较长的策略仍会退化,强化学习目标可缓解这一影响。 研究使用预言机规划器分离训练时采用的目标时域与测试时要求达到的目标。作者将该现象解释为动作与事后重标注目标之间的条件互信息随时域增加而下降;输入Jacobian实验还显示,长时域训练使行为克隆和强化学习策略更依赖状态信息、而非目标信息。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 08:20
目标条件策略学习中的目标时域信息诅咒:长时域行为克隆性能下降报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AI目标条件策略学习中的目标时域信息诅咒:长时域行为克隆性能下降
研究识别出目标条件策略学习中的“目标时域信息诅咒”:目标重标注时域增加会显著降低策略泛化与性能,即使测试目标仅为邻近子目标。控制实验显示,长时域行为克隆策略更容易从目标信息转向状态信息,强化学习目标和短时域策略输入 Jacobian 蒸馏可带来性能改善。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。