关于映射层的设计

作者: ZKCCZ创建于 2024年12月16日更新于 2025年1月14日

正如您所说的那样,“更简单的Projection的跨模态特征对齐方式,相较于Cross-Attention会带来更大的性能损失”。我认为Q-Former甚至可以被视为一种更复杂的映射方式,然而LLaVA系列仅使用了MLP实现图文映射,没有探讨更多的实现方式。您为什么认为Cross-Attention会带来增益呢?您可能可以提供一些论文参考。刚刚接触LLM和VLLM,问题会比较基础,感谢您的解答!

内容来源: jingyaogong/minimind-v