nano-vllm · Issues· 96 开放
在 GitHub 打开本地同步的开放议题(评论请到 GitHub 查看)
- #274
[错误] 计划器: `assert scheduled_seqs` 在解码耗尽 KV 缓存块时会导致引擎崩溃
更新于 2026年9月14日 - #261
[错误] nano-vllm 在 Windows 上无法启动
更新于 2026年9月1日 - #187
潜在的 TP 正确性问题: BlockManager 的容量可能依赖于每个排名的本地 KV 缓存估计
更新于 2026年8月26日 - #246
Tensor 并行共享内存 RPC 缺乏工作进程确认,且可能损坏命令
更新于 2026年6月25日 - #245
A100 PCIE GPU 中的低推论速度
更新于 2026年6月20日 - #244
用于 nano-vllm 的轻量级 Go 负载均衡代理
更新于 2026年6月17日 - #240
[错误] may_append 分配新区块时延迟了一个令牌,导致 KV 缓存写入未分配的区块
更新于 2026年6月9日 - #230
文件增强建议
更新于 2026年5月12日 - #228
[更改] Int8 KV 缓存 + 异步流程 + 头部重排,提高 22% 的吞吐量
更新于 2026年5月8日 - #225
推出量化推理技术用于 Nano-vLLM - 一个用于 Qwen 模型的轻量级 FP8 运行时
更新于 2026年5月7日 - #220
[功能请求] 支持无重量的 RMSNorm(用于 FlashNorm 权重折叠技巧)
更新于 2026年5月6日 - #221
[讨论] 由于 vLLM-Omni 也很复杂,我尝试根据 nano-vllm 构建一个最小版本(约 1k 行代码)
更新于 2026年5月1日 - #219
[讨论] 同一步骤前缀共享的重复块
更新于 2026年4月28日 - #206
执行对 Quen3.5 的支持
更新于 2026年4月20日 - #114
[BUG] 当提示长度与 kvcache_block_size 相等时发生崩溃
更新于 2026年4月13日