[功能] 为 MIM 预训练研究提供统一的 `embed` 接口,适用于 Vision Transformer 模型

作者: ryan-minato创建于 2025年7月9日更新于 2025年7月10日
标签enhancement

此功能请求与使用 `timm` 中的视觉 Transformer 模型进行 Masked Image Modeling (MIM) 预训练相关。目前,嵌入和特征提取在 `forward_features` 中紧密耦合,使得在初始嵌入和位置编码之后,但在 Transformer 阶段之前,很难注入掩码操作,这是 MIM 的一个常见要求。研究人员需要在传递给后续 Transformer 层之前,访问嵌入的标记进行掩码处理。

内容来源: huggingface/pytorch-image-models