为你的模型选择正确的 GPU — 一个缩放方法, 而不是猜测

2026年8月19日2 次浏览来源:Dev.to阅读原文

为你的模型选择正确的GPU——一个尺寸方法,不是猜得到,你是一个高级的SRE,你一直不断听到AI模型,但不确定如何确定正确的节点大小来容纳你的模型. - 如果是的话...

你来对地方了 AKS上运行 vLLM 的系列的一部分.

伴奏出品:如何避免相扑.

GPU基础设施的设置——即将到来.

这部作品从模型的参数计数或同时请求的要求中走过GPU内存要求的估计.

阅读了这篇文章后,您将有足够的知识来自信地选择一个GPU家庭.

免责:这个过程是thumb规则的过滤器,而不是精确的计算——最后一步涵盖了模型实际运行后如何获得准确的数字.

背景:什么实际消耗GPU内存AI模型活在了GPU内存中——VRAM,而vLLM等引擎为有效管理该内存提供了新颖的技术[纸],但该模型并非唯一消耗它的东西.

下面是消耗我们珍贵的VRAM的事物的简短列表:模型权重——参数本身.

巨大的固定成本:装入一次,永不收缩.

KV缓存——飞行中请求的工作内存.

每个主动请求的每个符号在这里都有它的注意键/值.

这是决定吞吐量的一个:更多的KV缓存=更多的同时请求.

其它一切——激活(前行通行证的临时取号)外加CUDA/框架起落架.

你不能用手来计算这些;vLLM在启动时用剖面卡来测量激活,并打印出来供我们消费.

规模问题其实是:在重量和间接费用之后,KV缓存还剩多少钱——这是否足够你的交通量?

OK, 让我们开始第一步 —— 选择一个模型指导 选择的模型不在文章的界限之内 。

这里重要的是:一旦你有一个候选人,下面的一切都可以从它的光谱表上读出——然后你可以在你短名单的每个模型上运行这个方法,去掉那些不符合你要求的.

为演示目的,我将使用Hugging Face的 Quen2.5-7B-Instruct-AWQ 模式卡, Cfig Card 步骤 2 —— 在 spec平面图中查找什么 取名值 Quen2.5-7B-Instruct-AWQ 参数计数模型卡 / 帕雷米特 ~ 7.6 B ("7B") 量子化 AWQ, 4位层 28 KV 头部 4 头尺寸 3584 / 28 = 128 前二相相相相相相相相重相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相 最后三个大小的 KV 缓存每个符号 。

这是整个购物清单。

第3步 — 为权重计算 VRAM Rule of tompt:而许多模型都有不同的精密提供: 精密字节/param 7.6 B params fp16 / bf16 2 ~15.2 GB int8 1~7.6 GB AWQ / 4-bit ~0.5~3.8 GB 关于重量和分量的注释:上表比较了同一种模型,只是不同的分量:分量是将每个分量储存在所训练的比分数上.

型号为16位浮点数的列车,因此每个参数需要2个字节(16位);将重编码为8位或4位整数.

因此上表显示了相同的模型,相同的参数计数.

只有模型的记忆脚印会改变 每一个不花在权重上的GB都是为KV缓存而留下的GB,这允许服务更多的并行请求,从而带来更快乐的客户.

这已经有助于指导决定:fp16模型变体(~15 GB)外加工作空间在满足单一请求前几乎会填充24GB GPU.

AWQ变体(~5.6 GB)为KV缓存留下了大多数VRAM自由.

相同的型号,相同的GPU——与服务容量大相径庭.

说实话,AWQ实际上消耗了~5.6 GB,而不是上面的广告~3.8 GB.

这可以通过查看repo文件上的文件大小和版本标签上的文件大小的总和来看到. . . . . . . . .

这些是加权数本身——在启动时文件vLLM下载并加载到VRAM中——所以它们的综合大小是权重fo

分享