ppo中出现NAN

Author: xxx-007Created Nov 9, 2020Updated Mar 8, 2024

你好,莫烦老师,我在运行simple_ppo算法中,,根据当前状态选择一个动作 a=self.sess.run(self.sample_op,{self.tfs:s})[0],,选择出来的动作为nan,,我应该如何修改,才能在运行代码过程中不在出现nan值,

Source: MorvanZhou/Reinforcement-learning-with-tensorflow