2千元推论服务器:站在本地AI上10年老硬件

2026年9月8日1 次浏览来源:Dev.to阅读原文

我运行一个本地推论服务器,每天处理上千名特工的请求.

它在旧零件上花费了大约2000美元,其中最新的硅在2016年左右被胶了出来.

这个系列是站立起来的故事, 更老实说,我所知道的这个故事 到底有多错。

我选这个硬件不是为了证明一点 我选它是因为我买得起它 原来是我买的最好的老师 企业盈余市场使用的材料的帐单(eBay收据,2026年1月);案件,PSU,以及Newegg的新冷却器:组件成本 AMD EPYC 7302P + Supermicro H11SSL-i (16个核心/32个线) 555 128 GB DDR4-2666 ECC (8x16 GB) 551 2x NVIDIA Tesla P40 (24 GB) 403 1 TB DC P4510 U.2 NVMe 100 U.2 适配器和动力电缆 63 Case,PSU,CPU, CPU 冷却器 (Newegg, 约) ~ 330 总计~ 2 000美元 从上下文看,这大概是两个月的 总是在代理的工作量 将花费我在前沿API法案。

机器在我完成调音之前就自己付钱了 P40是建筑的核心,也是大部分疼痛的来源.

这是从2016年开始的Pascal Datacenter卡:24GB的VRAM,计算能力6.1,没有Tensor Cores,没有NVLink.

其中两人在纸上给你48GB的VRAM.

我笔记中最早的硬教训之一, 驾驶员预留了约6%,所以可用为45GiB.

在光谱表编号OOMs中编制预算.

这些硬件不能做的 知道"不"名单 前面会节省我几周的时间 这里:没有vLLM.

计算能力6.1太老了.

我没有听从文件上的话,我有一个实验目录来证明它。

排除了真实的。

没有Tensor Cores表示FP16是一个陷阱.

在Pascal上,FP16的数学运行速度为FP32的1/64.

该卡的强度为INT8通过指令,约47个TOPS.

所有关于工作帕斯卡的配置 都来自这样一个事实: 量化模型,整数子内核, 对为新卡写的任何建议持怀疑态度。

没有并行的GPU模型.

一次一个大模特 交换需要30秒左右通过波尔泰纳API.

你绕着它设计,不然就永远打下去 没有快感冒开始。 20到40秒装入一个模型,视大小而定.

多数建议不适用.

这只花我最大的钱。

互联网的LLM性能指导是写在"安佩尔"和"更新"上.

有的转让给帕斯卡尔,有的则无关紧要,有的则具有积极的破坏性.

我发现一个卖家博客推荐的"快40%"分拆模式, 把这些类别分开是大部分的作品,这是整个系列的主题.

这些限制其实是从我自己的日志里买到的,而不是估计的:一种26B的混合专家模型(Gemma 4 26B-A4B,Q8)以41个令牌/秒来解码.

这是快速路径。

日活马是Q6 K的27B稠密型号,以投机解码为主跑出13-17个令牌/秒单流,大约为15个令牌/秒总和,跨越了4个平行槽.

同一堆栈在大约23GB的VRAM中为262k-token上下文窗口服务,使用已定量的KV缓存.

在CPU方面,小4B型以15-25个符/sec处理分类和路由,在少数核心上,总是在上,从不与GPU相竞争.

超过一个测得的40小时生产窗口处理8 129个请求,故障率为0.17%,零人工干预。

十二个不同的GPU模型堆栈在今天这个机器上编译,部署和基准,在一个单一的OpenAI兼容端点后按需求互换.

特工们整天都在和它说话 多数请求都从未触及过已支付的API 。

这一切都不需要现代硬件。

这需要了解你的机器。

为什么老旧的硬件 教你更多在H100上, 很多错误只是花费你一点点 吞吐量你从来没有注意到。

在P40上,错误大叫失败.

错误的分割模式崩溃 。

错误的精确度

分享