百科.dev
全部条目AI 编程趋势榜开源项目技术资讯提交条目
登录
返回工具页/返回 Issues 列表
#157·reinforcement-learning-an-introduction

ch06 random_walk td 方法

作者: Perseus1993创建于 2022年12月13日更新于 2022年12月29日

为什么所有状态的奖励都为 0? 应该是 reward = 1 如果 cur_state == 6,否则为 0

内容来源: ShangtongZhang/reinforcement-learning-an-introduction

查看 GitHub 原文在 GitHub 查看讨论