在 DQN 的代码中,计算 q_target 时没有考虑 done 为 true 的情况。
作者: ananasfl创建于 2022年4月20日更新于 2024年5月31日
Morvan,在DQN的代码中,计算q_target时,是否没有考虑done为True的情况,即q_target = Reward?存储在Replay memory中的经验中也未包含done。为什么会这样?
内容来源: MorvanZhou/Reinforcement-learning-with-tensorflow
Morvan,在DQN的代码中,计算q_target时,是否没有考虑done为True的情况,即q_target = Reward?存储在Replay memory中的经验中也未包含done。为什么会这样?
内容来源: MorvanZhou/Reinforcement-learning-with-tensorflow