关于效果预期

Author: jingyaogongCreated Oct 7, 2024Updated Oct 7, 2024

minimind-v是一个不错的「玩具」用于学习VLM结构和训练流程。

从效果来看,受LLM本身能力的限制,minimind-v目前离「可用生产力」还差得很远,虽然它能粗粒度识别场景和画面对象,但在理解上还存在明显的偏差和幻觉。

在此基础上,期待minimind-v可以发挥其抛砖引玉的作用,成为一块有用的「砖」为大家深入研究铺路