关于文本到图像预训练的问题
作者: Shuaizhang7创建于 2025年2月6日更新于 2025年2月7日
你好,在论文的训练过程中,介绍了先在 256*256 的图像数据集上训练全 3D 注意力。我想知道如何使用图像数据来训练 3D 注意力?因为图像数据比视频数据少了一维。
内容来源: PKU-YuanGroup/Open-Sora-Plan
你好,在论文的训练过程中,介绍了先在 256*256 的图像数据集上训练全 3D 注意力。我想知道如何使用图像数据来训练 3D 注意力?因为图像数据比视频数据少了一维。
内容来源: PKU-YuanGroup/Open-Sora-Plan