BUG: Atari 环境默认每集不使用 108K 帧 (27K 步骤)
作者: rajdeepsh创建于 2024年8月1日更新于 2024年8月2日
在测试 PPO 算法在 56 个 Atari 环境中后,我注意到某些环境存在不一致性。特别是,在 9 个环境中,各实现所获得的平均奖励与 Stable Baselines3 和 CleanRL 的 PPO 实现所获得的平均奖励存在差异。下表显示了 9 个环境,其中对每个(实现,环境)排列进行了 5 次试验,然后进行了一次环境依赖的单因素 ANOVA 以确定实现来源对平均奖励的影响。对于 Baselines(不是 108 个变体),可以观察到各实现的平均值存在显著差异。
内容来源: openai/baselines