ppo中出现NAN
Author: xxx-007Created Nov 9, 2020Updated Mar 8, 2024
你好,莫烦老师,我在运行simple_ppo算法中,,根据当前状态选择一个动作 a=self.sess.run(self.sample_op,{self.tfs:s})[0],,选择出来的动作为nan,,我应该如何修改,才能在运行代码过程中不在出现nan值,
Source: MorvanZhou/Reinforcement-learning-with-tensorflow