我运行一个本地推论服务器,每天处理上千名特工的请求.
它在旧零件上花费了大约2000美元,其中最新的硅在2016年左右被胶了出来.
这个系列是站立起来的故事, 更老实说,我所知道的这个故事 到底有多错。
我选这个硬件不是为了证明一点 我选它是因为我买得起它 原来是我买的最好的老师 企业盈余市场使用的材料的帐单(eBay收据,2026年1月);案件,PSU,以及Newegg的新冷却器:组件成本 AMD EPYC 7302P + Supermicro H11SSL-i (16个核心/32个线) 555 128 GB DDR4-2666 ECC (8x16 GB) 551 2x NVIDIA Tesla P40 (24 GB) 403 1 TB DC P4510 U.2 NVMe 100 U.2 适配器和动力电缆 63 Case,PSU,CPU, CPU 冷却器 (Newegg, 约) ~ 330 总计~ 2 000美元 从上下文看,这大概是两个月的 总是在代理的工作量 将花费我在前沿API法案。
机器在我完成调音之前就自己付钱了 P40是建筑的核心,也是大部分疼痛的来源.
这是从2016年开始的Pascal Datacenter卡:24GB的VRAM,计算能力6.1,没有Tensor Cores,没有NVLink.
其中两人在纸上给你48GB的VRAM.
我笔记中最早的硬教训之一, 驾驶员预留了约6%,所以可用为45GiB.
在光谱表编号OOMs中编制预算.
这些硬件不能做的 知道"不"名单 前面会节省我几周的时间 这里:没有vLLM.
计算能力6.1太老了.
我没有听从文件上的话,我有一个实验目录来证明它。
排除了真实的。
没有Tensor Cores表示FP16是一个陷阱.
在Pascal上,FP16的数学运行速度为FP32的1/64.
该卡的强度为INT8通过指令,约47个TOPS.
所有关于工作帕斯卡的配置 都来自这样一个事实: 量化模型,整数子内核, 对为新卡写的任何建议持怀疑态度。
没有并行的GPU模型.
一次一个大模特 交换需要30秒左右通过波尔泰纳API.
你绕着它设计,不然就永远打下去 没有快感冒开始。 20到40秒装入一个模型,视大小而定.
多数建议不适用.
这只花我最大的钱。
互联网的LLM性能指导是写在"安佩尔"和"更新"上.
有的转让给帕斯卡尔,有的则无关紧要,有的则具有积极的破坏性.
我发现一个卖家博客推荐的"快40%"分拆模式, 把这些类别分开是大部分的作品,这是整个系列的主题.
这些限制其实是从我自己的日志里买到的,而不是估计的:一种26B的混合专家模型(Gemma 4 26B-A4B,Q8)以41个令牌/秒来解码.
这是快速路径。
日活马是Q6 K的27B稠密型号,以投机解码为主跑出13-17个令牌/秒单流,大约为15个令牌/秒总和,跨越了4个平行槽.
同一堆栈在大约23GB的VRAM中为262k-token上下文窗口服务,使用已定量的KV缓存.
在CPU方面,小4B型以15-25个符/sec处理分类和路由,在少数核心上,总是在上,从不与GPU相竞争.
超过一个测得的40小时生产窗口处理8 129个请求,故障率为0.17%,零人工干预。
十二个不同的GPU模型堆栈在今天这个机器上编译,部署和基准,在一个单一的OpenAI兼容端点后按需求互换.
特工们整天都在和它说话 多数请求都从未触及过已支付的API 。
这一切都不需要现代硬件。
这需要了解你的机器。
为什么老旧的硬件 教你更多在H100上, 很多错误只是花费你一点点 吞吐量你从来没有注意到。
在P40上,错误大叫失败.
错误的分割模式崩溃 。
错误的精确度