用于您手机上超有效图像和视频理解的口袋化 MLLM
MiniCPM-V和MiniCPM-o是多式LLM系列,旨在增强性能并高效地部署在设备上. MiniCPM-V侧重于在图像、视频和文本投入方面对视觉语言的有效理解。 MiniCPM-o将家庭扩展到与流媒体视频和音频输入以及文本和语音输出的实时端到端的全模式互动。 目前系列中最显著的模型包括: - MiniCPM-V 4.6: 🔥🔥🔥. MiniCPM-V系列的最新和最有效的模型. 其总参数为1.3B,在性能上超过了Gemma4-E2B-it等更大型的模型,同时表现出优于Quen3.5-0.8B等更小型的模型的效率(实现1.5x令牌吞吐量). 由LLaVA-UHD v4中最新的ViT内部早期压缩技术提供动力,MiniCPM-V 4.6将视觉编码计算成本降低50%以上,并支持混合4x/16x视觉toke..