强化学习策略的尾部成本安全评估
热点事件观察中
强化学习策略的尾部成本安全评估
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
Samuel Tetteh与Cody Fleming研究了强化学习策略在极端回合成本下的安全性,提出以最差10%回合平均成本(CVaR$_{0.1}$)衡量尾部风险,并将该指标不超过安全预算的策略定义为尾部安全。研究在Safety-Gymnasium的导航任务上评估5种标准算法,识别平均成本看似安全但尾部违规的策略,并在密集危险导航中考察4类约束,覆盖4个导航任务和4个运动任务。输入材料未说明各算法或约束方法的最终性能比较,因此尚不能据此判断哪种尾部控制方法更有效。
AI 根据报道生成 · 33 分钟前更新
最新进展10月7日 14:07
安全强化学习的回合成本尾部:何时可控?报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AI安全强化学习的回合成本尾部:何时可控?
安全强化学习研究使用 CVaR$_{0.1}$衡量最差10%回合的平均成本,并将成本低于安全预算的策略定义为尾部安全。研究评估了5种标准算法和3个 Safety-Gymnasium 导航任务,并在密集危险导航中考察4类约束,覆盖4个导航任务与4个运动任务,以分析尾部违规能否在保持回报的同时得到控制。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。