#228·nano-vllm

[更改] Int8 KV 缓存 + 异步流程 + 头部重排,提高 22% 的吞吐量

作者: naalo2创建于 2026年5月8日更新于 2026年5月8日

我想分享一个在纳诺-vLLM上方所构建的下游项目,该项目优化了KV缓存IO模式并重叠了KV缓存回写,通过Aync管线计算注意力:Nano-vLLM-kv-compression.

** Repo**:https://GitHub.com/naalo2/nano-vLLM-kv-compression.

新特点包括:

  • Int8 KV Cache 压缩 — 通过动态每头量化减少50%的内存
  • ** 混凝土布局** — 为曲幅内存重排主序
  • GQA-平分快取注意-群Q-头CTA映射消除了冗余克V负载.
  • ** Async KV Store 管道** —多流架构相重叠 KV 量化和缓存回写与注意力计算

绩效

Setup:RTX 3090,Qune3-0.6B,256项请求,随机100-1024输入/输出符号

QQ 引擎 QQ 时间 (s) QQ 通量 (tok/s) QQ 速度 QQ |:相去也. -==YTET -伊甸园字幕组=- 翻译: #######################27.00##########4,962.21#######################################################################################################################################################################################################################

内容来源: GeeeekExplorer/nano-vllm