#990·gemma.cpp

功能请求/建议:"E12B"(有效 12B) Gemma 5 模型类(针对 12GB VRAM/台式机用户优化)

作者: ozelturktarkan创建于 2026年8月26日更新于 2026年8月26日

Hi Gemma 团队,

首先,感谢你对 Gemma 4 系列的出色工作! E2B 和 E4B 模型为轻型/移动工作负载带来了革命性的变化。 然而,桌面消费者领域存在着巨大的差距: 12GB VRAM 版本 (例如 RTX 4070/3060 12GB 版本),这代表了大量本地 LLM 爱好者和独立开发者。 虽然标准的 12B 密集型模型运行良好,但它们通常会牺牲推理能力,与 27B-35B 模型相比。 另一方面,在本地运行 27B+ 模型需要卸载或严重量化,这会严重降低速度。 Gemma 5 的建议: 推出 E12B (有效 12B) 架构 (例如稀疏/MoE 或主动参数架构,可实现 27B-35B 的智能,同时保持 12B 的主动 VRAM/RAM 占用)。 这将为桌面硬件带来绝对的 "最佳平衡",允许实现高速、高上下文生成,而不需要在当前硬件/RAM 市场约束下迫使用户进行大规模 VRAM 升级。 在 Gemma 5 中将 "有效" 架构扩展到 12B 级别,将为数百万的本地部署用户提供支持。 感谢您考虑此反馈!

内容来源: google/gemma.cpp