关于效果预期
Author: jingyaogongCreated Oct 7, 2024Updated Oct 7, 2024
minimind-v是一个不错的「玩具」用于学习VLM结构和训练流程。
从效果来看,受LLM本身能力的限制,minimind-v目前离「可用生产力」还差得很远,虽然它能粗粒度识别场景和画面对象,但在理解上还存在明显的偏差和幻觉。
在此基础上,期待minimind-v可以发挥其抛砖引玉的作用,成为一块有用的「砖」为大家深入研究铺路
Source: jingyaogong/minimind-v