随着 GPU 数量的扩展, SigLip 的内存消耗也会增加
作者: khalidsaifullaah创建于 2024年9月26日更新于 2025年2月25日
从 SigLip 论文中,我的理解是,它不需要任何 `all_gather`,并且始终以迭代的方式执行本地 `b x b` 计算,其中 b 是 `micro_batch_size`(参见论文中的此部分)。 所以如果我可以将 `micro_batch_size` 设置为 10(在 8 个 GPU 中),然后将 GPU 的数量增加到 16、32、64、128 等,我的内存消耗应该(或多或少)保持不变(就像正常的 DDP 那样)。 或者简单地说,我们应该能够通过保持 `micro_batch_size` 不变来扩展 `world_batch_size` 或节点数(理论上是这样的)。
内容来源: mlfoundations/open_clip