无法学习时序信息
作者: slippersman创建于 2025年10月17日更新于 2025年10月17日
您好,我阅读了您的 ICLR '24 论文《AnimateDiff》—无论是其创新的方法还是令人印象深刻的结果都非常出色。目前我正在尝试用 Stable 3.5 的 Transformer 替换其基础模型进行训练,但遇到了一些问题。我很欢迎您的建议。
- 由于硬件限制,我使用 Megatron/DeepSpeed 修改了模型,以减少 GPU 内存使用。使用 100 个训练片段(测试集:来自训练的随机样本),损失最初会收敛,但随着训练次数的增加,输出会变成纯色图像(请参阅 epoch5-60)。没有学习到任何时间动态。
- 在官方 AnimateDiff 的图像微调阶段,代码直接使用 diffusers 的 UNet,没有显示域适配器逻辑(如您论文中所述)。这个组件是否在其他地方实现了呢?
内容来源: guoyww/AnimateDiff