两年前,"在当地运行一个语言模型"意味着一个汇编的周末,一个CUDA错误的墓地,以及一个回答像它有脑震荡的模型.
在2026年,你可以安装一个工具,类型一命令,并且有一个真正有用的助手运行在一台没有互联网连接的笔记本电脑上.
这里有一张诚实的地图,说明什么是可行的,什么不是的,以及尖锐的边缘仍然在哪里.
为何要费劲在本地跑步, 电源永远不离开你的机器。
对于代码,你不能粘入云盒, 或个人数据, 这是不可谈判的。
成本和离线。
没有按键的账单,没有利率限制, 它在飞机上工作。
缓而相控.
没有网络回合,你永远固定准确的模型版本——没有静默的升级来改变你的输出.
渔获量一直是每瓦的质量。
这是移动的号码。
硬件级, 老实说, 8 GB RAM / 集成 GPU : 您可以运行 3–4B 参数模型, 以 4- 位量化 。
适合自动完成,总结,简单的QQA.
别指望有深刻的推理 16 GB RAM:大多数开发者的甜点. 7-9B型号运行舒适并真正有助于编码协助和起草。 32 GB+或有16–24 GB VRAM的离散GPU:现在你运行着20–30B模型,或者在有攻击性的量化时运行更大的模型,具有真正的推理能力.
苹果硅 (统一内存):活活塞超过其重量.
一个拥有32–64 GB统一内存的机器运行的模型需要在其他平台上一个昂贵的离散GPU,因为CPU和GPU共用同一个内存池.
量子化:使之可能的把戏 7B型号与16GB相适应的原因是量化——以4比特而不是16来存储重量.
常见格式为GGUF,常见的食谱为4位(常被标注为Q4).
从全精度到4位的质量损失对于大多数任务来说都出乎意料地很小,而内存的节省是4x. 4-位(2–3比特)以下的模型开始明显地降解;在它上方(5–8比特),您会为递减的返回支付内存.
对于大多数人来说,4-位是仅仅起作用的默认.
工具奥拉玛——"一指令"体验.
你在和它说话 最好的起点 lama.cpp – 生态系统的大部分引擎都是以所建为主.
当您想要控制,自定义定量, 或将推论嵌入到自己的应用中时, 请联系它.
LM Studio — 一个GUI, 如果您宁可点击而不是输入, 并且容易的模型浏览.
哪些小模型其实是好的,而不给一个单一的"赢家"命名——因为它会因月度变化而改变——今年小等级中强大的开放重量家庭是通常的被怀疑者:Quen线,Google's Gemma线,Meta's Llama small 变体,和微软的Phi系列.
实用建议:不要娶模特.
在同一个大小的班级下载出2到3个,通过它们运行真正的提示,并保留取胜的作品.
领导板无法告诉你哪个型号在你的代码库中最好;你的代码库可以.
尖锐的边缘没人会警告你 背景长度会花费RAM 一个模型所广告的上下文窗口并不是免费的——用长文件填充它可以吹过你的内存预算并爬行.
从谦卑上下文起起而种之.
冷起步时先敲后门 模型必须装入内存.
反复调用时保持保温,或闲后的第一个请求会感觉被打破.
小型模型的配置更多。
它们在变换(简写,重写,取出)方面表现优异,在无限制的事实召回方面更加摇摆.
用来作外形,而不是地面的真理.
速度是"好的",而不是"即时".
在中层笔记本电脑上,预计可读快流,而不是云旗快活.
对于交互用途,它完全可以使用;对于批量的工作,计划它. 2026年取走的"地方LLM"从"印象式演示"到"每日驾驶",为许多日常任务——总结,起草,编码援助,私人QQA.
但你会惊讶的