Baike.dev
All toolsAI codingTrendingOpen sourceNewsSubmit
Log in
Back to tool/Back to issues
#157·reinforcement-learning-an-introduction

ch06 random_walk td method

Author: Perseus1993Created Dec 13, 2022Updated Dec 29, 2022

why reward = 0 in all state?

should be reward = 1 if cur_state == 6 else 0

Source: ShangtongZhang/reinforcement-learning-an-introduction

View original on GitHubView discussion on GitHub