RL-07-无模型2-TD算法03:TD算法在强化学习中的定位【当前估计⇽当前估计+α(TD Target−当前估计)】【TD Error =TD Target−当前估计】
1. TD算法在强化学习中的核心定位1.1 TD到底是什么TD,全称Temporal-Difference Learning,时序差分学习。理解 TD 最重要的一点是:TD并不是一个与DQN、PPO、SAC完全同层级的单一现代强化学习算法,而是一类利用“当前估计 + 下一时刻估计”构造学习目标的价值学习方法。它回答的核心问题是:如何利用一段尚未结束的经验,更新当前的价值估计? \boxed{\text{如何利用一段尚未结束的经验,更新当前的价值估计?}}
上一篇/下一篇内容由系统自动关联
返回资讯列表 →