#225·nano-vllm

推出量化推理技术用于 Nano-vLLM - 一个用于 Qwen 模型的轻量级 FP8 运行时

作者: cuber726579创建于 2026年5月7日更新于 2026年5月7日

大家好, 我想分享一个与之相关的项目,该项目将 Nano-vLLM 扩展到量化推理: https://GitHub.com/cuber726579/Nano-vLLM-Quant **Nano-vLLM-Quant** ⚡ 是一个用于运行密集型 Qwen 模型的轻量级推理运行时,该模型具有量化的权重。 目前的重点是 **FP8 推理**,同时保持 Nano-vLLM 的精神: - 规模小、代码可读 - 可直接控制推理路径 ️ - 易于实验和修改 - 适用于学习和调试的紧凑型运行时 当前功能包括 ✨: - FP8 检查点加载 - 动态和静态激活缩放 ⚖️ - 矩阵并行 FP8 线性层 ⛓️ - FP8 KV 缓存 ️ - 分块预填充 ⚡ - 扩展采样选项 - 适用于 Qwen 变体的 RoPE 兼容性 该项目目前支持以下家族的密集型文本模型: - Qwen2 - Qwen3 - Qwen3.5 我已经用它测试了: - `Qwen3-0.6B-FP8` - `Qwen3-4B-Thinking-2507-FP8` - `RedHatAI/Qwen2-0.5B-Instruct-FP8` - `Qwen/Qwen3.5-9B` 这个项目对于想要探索量化 Qwen 模型的任何人都很有用。 反馈、测试结果、问题和贡献都非常欢迎!

内容来源: GeeeekExplorer/nano-vllm