[ROCm][AMD] gfx950/MI355X 上的 GLM5.2/5.3 性能优化
作者: amd-sriram创建于 2026年9月16日更新于 2026年9月17日
标签feature requestrocmquantization
本功能页跟踪 [amd/GLM-52-MXFP4] (https://huggingface.co/amd/GLM-5-MXFP4) / [amd/GLM-5.3-Quark-MXFP4-AttnFP8] (https://huggingface.co/amd/GLM-53-Quark-MXFP4-AtnFP8) 在gf950/MI35X上的变相. 以下PRs列表在vllm-project/vllm主机上作为堆放的PR登陆.
CC 代码 : @tjtanaa, @jhartika-amd, @maeehart, @nholmber.
Nvidia 等值
- [审查中]指数共享特性(1%的E2E TTFT改进)-vllm-project/vllm#51309
- [回顾] 删除在预填 MQA 日志中填充 functor (1% E2E TTFT 改进) - vllm- project/vllm # 51314
内核优化 :
- [审查中] 使用 AITER 内核进行
cp gather indexer k quant cache'和indexer k quant 和 cache',而不是`top k per row decode' - vllm-project/vllm#46172 - [回顾] 用于 K 正常化的 Sparse 索引器内核聚变, Q/K RoPE, FP8 等分数, 和 K- cache 写入 - `inder qk rope quant and cache' (1% E2E 吞吐量改进) - vllm-project/vllm#51315
- [审查中] MLA 已装入内核用于绳索,查询 concat, KV concat, fp8 缓存写入 - ' fild qk rope concat and cache mla' - vllm-project/vllm#47757
- [审查中]取而代之的ATEN宝石取而代之的是ATER宝石 "aiter.tuend gemm.tgemm.mm " (3% E2E 吞吐量改进) - vllm-project/vllm#50535
- gfx950 [闭] fMoE调制(5% E2E 吞吐量改进) - ROCm/aiter#4629
- [在aiter中打开] 向 FlyDSL MQA 发送“ flydsl fp8 mqa logits” 预填记录(1.5% E2E 吞吐量改进)
其他优化
- [准备]FP8型起重机-vllm-project/vllm#53792
ARTER 需要合并的依赖关系
- FlyDSL在解码中呼号MQA记录器 - ROCm/aiter#4221
- FlyDSL MQA 预填记录 - ROCm/aiter# 4538
- FlyDSL上层 -- -- ROCm/aiter# 4355
计划任务
- [在aiter中打开] 向FlyDSL发送的指令在解码 " flydsl fp8 paged mqa logits " (1周ETA,预期E2E吞吐量改善1.5%)中呼出MQA记录器.
- 中期计划能力:
- 支持下一个 n > 2
- 内核支持
- FlyDSL 内核,用于快速削减(INT4) - ROCm/aiter#4970
内容来源: vllm-project/vllm