#4778·MNN

[功能请求]: Gemma 4 12B

作者: enderdragonenforcer-source创建于 2026年8月16日更新于 2026年9月11日
标签module:llmtype:model-request

支持这种模型对于移动设备上的 12GB 内存来说可能是非常有用的。据报道,MNN 是与 ik_lcpp / lcpp 相比最快的解码后端(可能是启用了 OpenCL)。它具有统一的多模态架构,模型可以在没有编码器模块的情况下处理原始音频。每秒音频可能需要 ~25 个 token,因此在 GPU/NPU 后端加速的预填充对于音频来说非常有价值。lcpp 的"Q4_0"权重格式中包含了一个 QAT 版本,如果可能的话,它将是最适合用于感知保真度的目标。