[问题] 更改视觉塔。
作者: ronaldAlvxs创建于 2025年10月29日更新于 2026年5月7日
问题
如果我用一个较小的“视觉塔”取而代之——例如,一个输出577个特性的CLIP模型被输出200个特性的模型所取而代之——那么仅仅重新训练投影仪是否就足够了,或者LLM是否还需要微调? LLM最初受过577维可视嵌入式训练,这是否会影响其推论能力(例如通过不匹配的注意力预测)?
内容来源: haotian-liu/LLaVA
问题
如果我用一个较小的“视觉塔”取而代之——例如,一个输出577个特性的CLIP模型被输出200个特性的模型所取而代之——那么仅仅重新训练投影仪是否就足够了,或者LLM是否还需要微调? LLM最初受过577维可视嵌入式训练,这是否会影响其推论能力(例如通过不匹配的注意力预测)?
内容来源: haotian-liu/LLaVA