关于visual encoder部分的小问题

Author: wrsniceCreated Oct 9, 2024Updated Oct 10, 2024

大佬,

请问:CLIP模型是由一个图像编码器和一个文本编码器组成多模态模型,那么在minimind-v中llm部分接收的是来自CLIP的图像编码器信息呢还是文本编码器信息呢?

谢谢