如何在标准 TF 训练中使用 adafactor?

作者: gai1995创建于 2020年1月14日更新于 2022年11月1日

描述

你好,我想使用 adafactor 来替换代码中的 Adam;但是我没有使用 T2T 框架;基于 Google 发布的 BERT fine-tune 框架,我只是复制了您实现 adafactor 的源代码,并调用如下: optimizer = AdafactorOptimizer() tvars = tf.trainable_variables() grads, = blabla ... train_op = optimizer.apply_gradients(list(zip(grads, tvars)), name='train_op') 但是似乎不起作用;损失没有降低,准确性很低;此外,我注意到内存使用量几乎与 Adam 相同; 这有什么问题吗?有没有人能解释给我听吗?或者我只能在 T2T 框架下使用 adafactor 吗?

内容来源: tensorflow/tensor2tensor