我不停地支付每月订阅 云码助理 而16GBM4Mac迷你 坐在我的桌子上 大部分的一天。
所以我做了一个显而易见的实验:一个16GB的Mac迷你能够运行一个完全离线的编码助理——没有离开机器的代码,没有订阅——并且它实际上可以用于真正的工作吗?
短答:是,有一个硬约束(RAM)和一个软约束(context长度).
这篇文章是上面的视频的书面版本,包含每个命令,配置文件,以及基准号,以便您复制.
目录 何必费劲跑到本地去?
硬件约束 没人提到步骤1:安装 Ollama步骤2: 选择一个适合16GB步骤3的模型 跑并验证步骤4: 将它接入 VS 代码 第5步: Tune Ollama 为16GB 框基准 你该取消副驾驶吗?
为何要费劲在本地跑步, 三个原因, 对我来说, 客户端代码,内部重置,NDA下的任何一款——都没有离开机器.
这是主机助理无法以任何价位提供的东西 费用。
编码助理订阅费约为100-240美元/年,视等级而定。
麦克迷你已经买了 离线 飞机,坏的酒店wifi, 咖啡店死区。
助理刚刚工作。
不这样做的原因:原始能力。
边疆托管模型在多文件大推理上较好,并不相近.
下面更多关于这一点。
在Apple Silicon上无人提及硬件约束,GPU和CPU共享一池统一内存.
一个模型必须与macOS,你的浏览器,VS代码, 以及任何你运行的容器一起装入那个池.
在16GB机上,macOS + 一个正常的dev环境在装入任何东西之前会吃到6–8GB.
给模型留了7到9GB个现实的房头 这个单数决定了其他一切,这也是为什么人们在64GB机器上"只是运行30B模型"的建议不会转移.
默认的macOS允许GPU使用大约75%的总RAM作为VRAM.
步骤1:安装奥拉马 两个选择。
Homebrew更方便脚本和更新:或直接从ollama.com下载应用程序.
无论如何,验证守护进程是: 如果返回 JSON, 本地 API 服务器将在端口上实时 。
这个端点是VS代码将与之交谈的——它足以兼容大多数工具.
如果它没有运行: LM Studio 替代品:如果你宁愿有一个带有模型浏览器和内置聊天窗口的GUI, LM Studio 做同样的工作,也暴露出一个OpenAI相容的服务器(默认端口).
下方的每件事物都与两者相通——互换港口.
步骤2:选择一个适合16GB的模型 这是大多数本地LLM写错的地方.
以下是Qwen编码器家族在磁盘上的实际大小(大致为内存): 模型下载大小适合16GB?. 986 MB QQ Trivially Autocomplete only 1.9 GB QQ Easy Autocomplete,光聊天 4.7 GB QQ甜点聊天+编辑+自动完成 9.0 GB QQ Tight – 关闭其他应用 最佳品质 您可以获得20 GB QQ 否 (a3b) 19 GB QQ 不需要 32GB+ 16GB建议:用于聊天和编辑,用于内置自動完成.
与更大的聊天模式一起运行一个小型的专用自動完成模型,是让整个事情感到响应的把戏——自动完成需要在毫秒内回答,一个7B不能.
拉他们: 如果您有RAM 头室, 想要尝试 14B, 绘制一个明确的量化 而不是默认 —— 是最佳质量 – gigabyte 的取舍 : Step 3: 运行和验证 然后,用动词模式来查看实际的时机而不是气氛:每一次反应之后的指纹,和(tokens/sec).
这就是你的基准仪器——不需要额外的工具.
当它生成时,在另一个终端监视记忆: 栏子应该说。
如果上面写了什么,模型从统一的记忆中溢出,而你的活物/秒刚刚从悬崖上掉下——倒入更小的模型或被量化.
第4步:将其接入VS代码 安装 Cont