RL-算法演进史05:Model-Based强化学习算法演进路线02
下一节:5.6 E2C(Embed to Control):深度Latent Dynamics路线重点分析:为什么PILCO无法处理视觉输入;E2C如何将高维图像压缩到latent空间;Latent Dynamics如何成为Dreamer路线基础;E2C、PlaNet、Dreamer之间的数学关系。继续5.6 E2C(Embed to Control):深度 Latent Dynamics 路线上一节介绍了:Dyna−Q→PILCO Dyna-Q \rightarrow PILCO
上一篇/下一篇内容由系统自动关联
返回资讯列表 →