在一个小型嵌入模型上,WASM 比 WebGPU 快了 ~9.6 倍 - 我们建立了一个开放的基准,以寻找其他哪些地方也是如此
作者: Sallamhamza创建于 2026年8月17日更新于 2026年8月20日
标签enhancement
特性请求
我一直在构建WebAI Bench,这是一个开源的浏览器端基准测试,用于测试 WebGPU/WASM AI 推理。它完全在客户端运行(除非您选择提交结果,否则不会从您的设备中发送任何数据),目标是通过众包的方式回答一个我无法在任何地方找到好的数据的问题:对于给定的模型 + 量化 + 运行时,实际在真实硬件上运行的是什么,而不仅仅是库维护者在测试的机器上运行的结果?**
为什么我现在发布而不是等待一个“完成”的产品:在进行此项工作时,我通过 @huggingface/transformers 在 WebGPU 和 WASM 执行提供者上运行了 Xenova/all-MiniLM-L6-v2(一个小型,约 22M 参数的嵌入模型),相同的设备,相同的输入。 WASM 赢得了很大的优势 - 初始化快 3.5 倍,嵌入快 9.6 倍。这与我之前在自己的项目词汇中所做的“WebGPU 是快速路径,WASM 是回退路径”的假设恰恰相反。可能的原因是:在此模型大小下,WebGPU 的固定每次调用开销(着色器/管线编译,内核调用,主机 ↔ 设备传输)永远不会得到平均化 - WASM 更低的固定成本取得了完全胜利。完整的撰写:docs/spikes/sp3-findings.md。
这个结果正是为什么我认为需要测量,而不是假设,并且需要在许多真实设备上进行测量,而不仅仅是我的设备上。
内容来源: huggingface/transformers.js