在使用少量训练视频时,动作模块无法学习时序信息。

作者: slippersman创建于 2025年9月25日更新于 2025年9月25日

我开发了一个项目,将 animatediff 中的 unet 替换为 Transformer 块,使用 Stable Diffusion 3.5。考虑到硬件资源,我只使用 20 个视频作为训练集。为了验证过拟合能力,我从训练集中抽取了三个视频作为验证集。在训练阶段,首先,我使用 sd 3.5 中预训练的 Transformer 权重初始化 Transformer 块,然后 Transformer 块被冻结。我只从头开始训练运动模块。问题在于,在验证阶段,模型生成的视频似乎是从许多缺乏时序一致性的帧拼接而成。此外,我还使用相同的训练集来训练官方的 animatediff,并将 unet 冻结,同样的问题再次出现。

内容来源: guoyww/AnimateDiff