16GB Macmini上的本地 LLM: 以 Ollama + Quen 取代 GitHub 副驾驶

2026年8月14日1 次浏览来源:Dev.to阅读原文

我不停地支付每月订阅 云码助理 而16GBM4Mac迷你 坐在我的桌子上 大部分的一天。

所以我做了一个显而易见的实验:一个16GB的Mac迷你能够运行一个完全离线的编码助理——没有离开机器的代码,没有订阅——并且它实际上可以用于真正的工作吗?

短答:是,有一个硬约束(RAM)和一个软约束(context长度).

这篇文章是上面的视频的书面版本,包含每个命令,配置文件,以及基准号,以便您复制.

目录 何必费劲跑到本地去?

硬件约束 没人提到步骤1:安装 Ollama步骤2: 选择一个适合16GB步骤3的模型 跑并验证步骤4: 将它接入 VS 代码 第5步: Tune Ollama 为16GB 框基准 你该取消副驾驶吗?

为何要费劲在本地跑步, 三个原因, 对我来说, 客户端代码,内部重置,NDA下的任何一款——都没有离开机器.

这是主机助理无法以任何价位提供的东西 费用。

编码助理订阅费约为100-240美元/年,视等级而定。

麦克迷你已经买了 离线 飞机,坏的酒店wifi, 咖啡店死区。

助理刚刚工作。

不这样做的原因:原始能力。

边疆托管模型在多文件大推理上较好,并不相近.

下面更多关于这一点。

在Apple Silicon上无人提及硬件约束,GPU和CPU共享一池统一内存.

一个模型必须与macOS,你的浏览器,VS代码, 以及任何你运行的容器一起装入那个池.

在16GB机上,macOS + 一个正常的dev环境在装入任何东西之前会吃到6–8GB.

给模型留了7到9GB个现实的房头 这个单数决定了其他一切,这也是为什么人们在64GB机器上"只是运行30B模型"的建议不会转移.

默认的macOS允许GPU使用大约75%的总RAM作为VRAM.

步骤1:安装奥拉马 两个选择。

Homebrew更方便脚本和更新:或直接从ollama.com下载应用程序.

无论如何,验证守护进程是: 如果返回 JSON, 本地 API 服务器将在端口上实时 。

这个端点是VS代码将与之交谈的——它足以兼容大多数工具.

如果它没有运行: LM Studio 替代品:如果你宁愿有一个带有模型浏览器和内置聊天窗口的GUI, LM Studio 做同样的工作,也暴露出一个OpenAI相容的服务器(默认端口).

下方的每件事物都与两者相通——互换港口.

步骤2:选择一个适合16GB的模型 这是大多数本地LLM写错的地方.

以下是Qwen编码器家族在磁盘上的实际大小(大致为内存): 模型下载大小适合16GB?. 986 MB QQ Trivially Autocomplete only 1.9 GB QQ Easy Autocomplete,光聊天 4.7 GB QQ甜点聊天+编辑+自动完成 9.0 GB QQ Tight – 关闭其他应用 最佳品质 您可以获得20 GB QQ 否 (a3b) 19 GB QQ 不需要 32GB+ 16GB建议:用于聊天和编辑,用于内置自動完成.

与更大的聊天模式一起运行一个小型的专用自動完成模型,是让整个事情感到响应的把戏——自动完成需要在毫秒内回答,一个7B不能.

拉他们: 如果您有RAM 头室, 想要尝试 14B, 绘制一个明确的量化 而不是默认 —— 是最佳质量 – gigabyte 的取舍 : Step 3: 运行和验证 然后,用动词模式来查看实际的时机而不是气氛:每一次反应之后的指纹,和(tokens/sec).

这就是你的基准仪器——不需要额外的工具.

当它生成时,在另一个终端监视记忆: 栏子应该说。

如果上面写了什么,模型从统一的记忆中溢出,而你的活物/秒刚刚从悬崖上掉下——倒入更小的模型或被量化.

第4步:将其接入VS代码 安装 Cont

分享