A3C程序中奖励函数的权重问题

Author: Kaysenc0703Created Jul 26, 2020Updated Nov 1, 2022

对于奖励函数的设定是不是有什么要求啊?在A3C算法中使用的是状态值而不是动作值,那么奖励函数中的是不是要跟状态变量直接相关?而且还有个很迷奇的问题,为什么在相同权重的条件下,两次运行的结果差别很大?目前我的累积奖励值虽然有收敛趋势,但是波动还是很大! total_reward

Source: MorvanZhou/Reinforcement-learning-with-tensorflow