#429·cleanrl[BUG] Atari 实现中最终 ε 和评估 ε 不同作者: pseudo-rnd-thoughts创建于 2023年11月15日更新于 2026年4月3日问题描述 在用于 Atari 的 Q 学习实现(DQN、C51 和 QDAgger DQN,无论是 jax 还是 pytorch 实现),训练期间使用的最终 ε 值不同(示例为 0.01),而评估期间使用的 ε 值与训练期间使用的 ε 值不同(示例为 0.05) 内容来源: vwxyzjn/cleanrl查看 GitHub 原文在 GitHub 查看讨论