关于视觉编码器部分的小问题

作者: wrsnice创建于 2024年10月9日更新于 2024年10月10日

大佬,请问:CLIP 模型是由一个图像编码器和一个文本编码器组成的多模态模型,那么在 minimind-v 中的 LLM 部分接收的是来自 CLIP 的图像编码器信息还是文本编码器信息呢?

内容来源: jingyaogong/minimind-v