#32496·onnxruntime

[功能请求] 为 WebNN EP 分解的 LM 运算器添加融合变换器

作者: Yuhengwe1创建于 2026年9月9日更新于 2026年9月16日
标签feature requestmodel:transformerplatform:webep:WebNNep:WebGPU

描述特性请求

我们提议增加聚变器,以重建WebNN EP图处理过程中分解的LM操作器:GroupQueryAttenty, MatmulNBits, RMSNorm和GatherBlockQuantized.

这些高层次的运营商已经出现在了最初的ONNX模型中,但WebNN EP将其分解为原始操作以满足WebNN API的限制. 这种分解会影响性能和数值准确性:WebGPU等本土EP不能再为这些高层次操作员利用它们的专业内核.

描述情景使用情况

目标情景是通过WebNN进行device LM推论,使用WebNN的ORT后端与原生的WebGPU EP. 在phi4-mini演示中,重建这些运算符会降低图表的复杂性:

++操作员 ++ 节点还原 +++ |-|-|-. GroupQueryAttention 大约3,030 GQA相关的原始节点 ~ 32 GQA节点 ~ 马特穆尔尼比茨 644 — 161个节点

  • RMSNorm = 390 = 65个节点 * QQ GatherBlock Quantized QQ2 ~ 1个节点, 避免每次引用时约 1. 145 个 GiB 的平分嵌入表 QQ

而这些聚变改进了IPOT的解码从2000ms/take到60ms/take. 上游路径也显示了准确性问题;用FP32统计恢复RMSNorm解决了我们演示中观察到的生成正确性问题.

内容来源: microsoft/onnxruntime