#100·Omost

使用 vLLM 将 LLM 部署为 API 以加速推理

作者: fx-hit创建于 2024年6月21日更新于 2025年4月2日

根据实际测试,在使用 torch==2.3.0+cu118、vllm==0.5.0.post1+cu118 和 xformers==0.0.26.post1+cu118 的 A100 上部署 omost-LLaMA-3-8b 运行效果良好。如果想加快进程速度,可以参考此设置。

内容来源: lllyasviel/Omost