关于visual encoder部分的小问题
Author: wrsniceCreated Oct 9, 2024Updated Oct 10, 2024
大佬,
请问:CLIP模型是由一个图像编码器和一个文本编码器组成多模态模型,那么在minimind-v中llm部分接收的是来自CLIP的图像编码器信息呢还是文本编码器信息呢?
谢谢
Source: jingyaogong/minimind-v
大佬,
请问:CLIP模型是由一个图像编码器和一个文本编码器组成多模态模型,那么在minimind-v中llm部分接收的是来自CLIP的图像编码器信息呢还是文本编码器信息呢?
谢谢
Source: jingyaogong/minimind-v