[更改] Int8 KV 缓存 + 异步流程 + 头部重排,提高 22% 的吞吐量
作者: naalo2创建于 2026年5月8日更新于 2026年5月8日
我想分享一个在纳诺-vLLM上方所构建的下游项目,该项目优化了KV缓存IO模式并重叠了KV缓存回写,通过Aync管线计算注意力:Nano-vLLM-kv-compression.
** Repo**:https://GitHub.com/naalo2/nano-vLLM-kv-compression.
新特点包括:
- Int8 KV Cache 压缩 — 通过动态每头量化减少50%的内存
- ** 混凝土布局** — 为曲幅内存重排主序
- GQA-平分快取注意-群Q-头CTA映射消除了冗余克V负载.
- ** Async KV Store 管道** —多流架构相重叠 KV 量化和缓存回写与注意力计算
绩效
Setup:RTX 3090,Qune3-0.6B,256项请求,随机100-1024输入/输出符号
QQ 引擎 QQ 时间 (s) QQ 通量 (tok/s) QQ 速度 QQ |:相去也. -==YTET -伊甸园字幕组=- 翻译: #######################27.00##########4,962.21#######################################################################################################################################################################################################################
内容来源: GeeeekExplorer/nano-vllm