FP8让模特更蠢了吗? 以每秒一次的回归检查进行定量服务

2026年8月25日3 次浏览来源:Dev.to阅读原文

FP8在Qune3-8B上给了我们一个干净的1.5x,在RTX Pro 6000 Blackwell上提供吞吐量(1,725至2,597克/秒,以32相通币计算,vLLM)。

不舒服的问题总是一样:模特儿是不是更笨了.

这个帖子是我们在推荐开关之前 进行的确切检查,有数字,所以你可以运行同样的一个。

为什么"运行一个eval套接字"通常是错误的首个答案标准基准(MMLU和好友),是8B尺度分量三角形的吵闹乐器.

错误栏内的分数移动不会告诉你 你的提示是否改变了行为。

你真正想知道的是狭义的:关于你所服务的工作量,FP8检查站是否产出与BF16有实质上的差异,是其中任何差异的错误.

这是直接的,廉价的,而且每快。

两种配置都运行相同的固定工作量:20个提示,包括推理、代码、归纳、翻译、提取、分类、数学和以下的教学。

贪取解码,气温为0,256-token盖,流出.

贪婪之事:它能去除取样噪声,因此任何输出差异都归因于数.

然后进行三阶段比较:字节平等.

任何相同的都解决了 相类分相.

对于非同样的对子,一些几乎相同的措辞从真正的分歧中漂移出.

以正文为题作边评.

每一个非同样的对子都会被读取.

标题提出一个问题:是否存在一个事实或数字说法,即一个精度得到正确,另一个得到错误。

文字变化,重排,和等辨读被记录,但不被算作回归.

核心循环小:在20个输出字节-等同的Qwen3-8B FP8 7上发现的. 9 只在措辞或格式上有所不同;审查时的内容相同。 3个小回归:一首诗中反复出现一个单词,一个列表项目漂移出话题,一个可疑的工具建议. 1出取出快取的提示模棱两可,产生了两种可辨读.

FP8给出了BF16正确回答错误的事实或数字答案的零个案例.

最后一行是验收栏 从数值变化中可以预期到轻微的形而上学;被翻转的事实是一个阻塞.

这个简介已经过去,所以1.5x可以免费完成这个工作量.

二诚实戒.

首先,这验证了一个即时的剖面,而不是一般的模型:不同的域,更长的上下文,或被抽样的解码需要他们自己的通关.

第二,贪婪-解码平等是一个严格的信号,但不是完整的信号;如果服务于采样,也会在被采样的对子上运行审查阶段,并期望得到更多的(本能)差异.

几乎屏蔽了整件事的皱纹 让FP8完全运行在工作站-Blackwell(sm 120)级上,需要在默认的FP8路径中绕出内核断言.

如果你在相同的硅上和vLLM上拒绝加载FP8检查站,这是已知的一类问题,而不是你的设置有问题.

完整报告 本检查属于 原始 CSV , 环境表, 以及单指令复制脚本 https://conatus.jahn.ai/ai-engineering/ sample-report

分享