#8375·server

[问题] vLLM 服务器和 Triton 推理服务器的性能不同

作者: AnyangAngus创建于 2025年9月7日更新于 2026年7月30日

我使用了 vLLM 服务器和 Triton 推理服务器 VLLM 后端部署了 Qwen-7B-VL 模型。我使用了相同的模型、GPU 资源、数据集和压力测试参数,但获得了不同的性能结果。

内容来源: triton-inference-server/server