RL-10-TD算法-ActorCritic02-离线算法04-赵:Off-Policy AC【与On-Policy AC的唯一区别:分母用β(aₜ|sₜ)代替π(aₜ|sₜ,θₜ), 没有了探索性】
4、off-policy actor-critic 算法同样地,TheOff-Policy Policy Gradient减去一个baselineb ( s ) b(s)
上一篇/下一篇内容由系统自动关联
返回资讯列表 →
留下联系方式,顾问免费为您做建站诊断,把文章干货落地为可执行方案。