关于mapping层的设计

Author: ZKCCZCreated Dec 16, 2024Updated Jan 14, 2025

正如您所说”更简单的Projection的跨模态特征对齐方式,相较于Cross-Attention会带来更大的性能损失“。我认为Q-Former甚至也可以理解为一个更复杂的mapping方式,然而LLaVA系列仅使用了MLP实现图文映射,没有探讨更多的实现方式。请问您为什么会认为Cross-Attention会带来增益呢?您或许可以提供一些论文参考。 刚入门LLM和VLLM,问题会比较基础,提前感谢您的解答!