A3C 程序中奖励函数权重的问题

作者: Kaysenc0703创建于 2020年7月26日更新于 2022年11月1日

对于奖励函数的设定是否有什么要求呢?在A3C算法中使用的是状态值而不是动作值,那么奖励函数中是否与状态变量直接相关?另外还有一个很奇怪的问题,为什么在相同权重的条件下,两次运行的结果差异很大?目前我的累积奖励值虽然有收敛趋势,但波动还是很大!

内容来源: MorvanZhou/Reinforcement-learning-with-tensorflow