A100 PCIE GPU 中的低推论速度
作者: thangld201创建于 2026年6月20日更新于 2026年6月20日
Hi @GeeeekExplorer, 非常感谢您的作品! 我尝试在 A100 80GB PCIE GPU 上运行 bench.py, 但使用 nano-vllm 时, 所得到的吞吐量与您在 RTX4070 上报告的数值相比仅为 10% (132.27 tok/s):
Total: 133966tok, Time: 1012.83s, Throughput: 132.27tok/s当我使用 vllm (v0.21.0) 时, 结果如下:
Total: 133966tok, Time: 14.06s, Throughput: 9530.43tok/s参考一下库的版本:
>>> torch.__version__
'2.11.0+cu130'
>>> transformers.__version__
'5.7.0'
>>> vllm.__version__
'0.20.1rc1'
您有什么想法吗?内容来源: GeeeekExplorer/nano-vllm