#17800·tinygrad

Q8_0 Qwen 27B 解码速度比孤立的 GEMV 带宽低 ~85 倍

作者: PKD667创建于 2026年8月28日更新于 2026年8月28日

tinygrad 引擎从 Qwen3.8-27B 中解码 token,速度为 1 < tok/s,带宽为 19.4 GB/s(流式传输)。在相同的空闲 GPU(GH200)上,纯粹的 f16 串流加法的带宽约为 2.7 TB/s,而 M=1 的 GEMV 与最大层(lm_head,5120×248320)的带宽为 1.6 TB/s。集成解码的速度大约是 GEMV 内核单独运行时的 85 倍,每个步骤的每次内核启动都重新执行了 Q8_0→f16 的扩展。

内容来源: tinygrad/tinygrad