10 armed testbed.py/7/图2 3 x“样本-平均值”

作者: A-Pai创建于 2021年7月8日更新于 2021年7月8日

根据书中的介绍,使用固定的步长是因为非平稳,当时代码中的摇臂设置是平稳的,为什么不用“sample_averages”来估计各个摇臂的值?这两种方法的差异很大,上图是固定步长,可以看出“sample_averages”法收敛得更快,但为什么这两种方法收敛的结果却不一样?

内容来源: ShangtongZhang/reinforcement-learning-an-introduction