#429·cleanrl

[BUG] Atari 实现中最终 ε 和评估 ε 不同

作者: pseudo-rnd-thoughts创建于 2023年11月15日更新于 2026年4月3日

问题描述

在用于 Atari 的 Q 学习实现(DQN、C51 和 QDAgger DQN,无论是 jax 还是 pytorch 实现),训练期间使用的最终 ε 值不同(示例为 0.01),而评估期间使用的 ε 值与训练期间使用的 ε 值不同(示例为 0.05

内容来源: vwxyzjn/cleanrl