ch06 random_walk td 方法
作者: Perseus1993创建于 2022年12月13日更新于 2022年12月29日
为什么所有状态的奖励都为 0? 应该是 reward = 1 如果 cur_state == 6,否则为 0
内容来源: ShangtongZhang/reinforcement-learning-an-introduction
为什么所有状态的奖励都为 0? 应该是 reward = 1 如果 cur_state == 6,否则为 0
内容来源: ShangtongZhang/reinforcement-learning-an-introduction