功能请求
作者: Sallamhamza创建于 2026年8月17日更新于 2026年8月17日
我一直在构建 WebAI Bench,这是一个开源的浏览器端基准测试,用于 WebGPU/WASM AI 推理。它完全在客户端运行(除非您选择提交结果),目标是通过众包的方式回答一个我无法在任何地方找到好的数据的问题:对于给定的模型 + 量化 + 运行时,实际在真实硬件上运行的是什么,而不仅仅是库维护者在其测试的机器上运行的结果?为什么我现在发布而不是等待一个“完成”的产品:在进行此项工作时,我通过 @huggingface/transformers 在 WebGPU 和 WASM 执行提供者上运行了 Xenova/all-MiniLM-L6-v2(一个小型,约 22M 参数的嵌入模型),相同的设备,相同的输入。 WASM 赢得了很大的优势 - 初始化快 3.5 倍,嵌入快 9.6 倍。这与我之前在自己的项目词汇表中所做的假设相反,“WebGPU 是快速路径,WASM 是回退路径”,在运行数字之前我就已经将其纳入了。可能的原因是:在此模型大小下,WebGPU 的固定每次调用开销(着色器/管线编译,内核调用,主机 ↔ 设备传输)永远不会得到平均化 - WASM 的较低固定成本取得了完全胜利。完整的撰写:docs/spikes/sp3-findings.md。
内容来源: mlc-ai/web-llm