[2017] [CPO] [Constrained Policy Optimization]
Constrained Policy Optimization, 2017CPO 是 SafeRL 领域一篇奠基性的工作,它首次将“安全约束”系统性地、有理论保证地融入到了现代深度强化学习的策略优化框架中。它定义了问题的核心范式:CPO 将安全强化学习形式化为一个约束马尔可夫决策过程(CMDP),其目标是在满足安全约束(如期望累积成本低于某个阈值)的前提下,最大化任务奖励。它提供了实用的算法基础:CPO 基于信赖域方法,通过在每次策略更新时求解一个带约束的优化问题,来保证新策略的安全性和性能。这为后续大量 SafeRL 算法提供了理论基础和实现思路。它的影响深远:CPO 是 SafeRL 领域被引用最多、最常被用作基线的算法之一。理解 CPO,就理解了 SafeRL 的核心挑战和主流解决思路神经网络策略:Atari games: DQN, A3Crobot locomotion and manipulation: DDPG,
上一篇/下一篇内容由系统自动关联
返回资讯列表 →