百科.dev
全部条目AI 编程趋势榜开源项目技术资讯提交条目
登录
返回工具页

nano-vllm · Issues· 96 开放

在 GitHub 打开

本地同步的开放议题(评论请到 GitHub 查看)

  • #274

    [错误] 计划器: `assert scheduled_seqs` 在解码耗尽 KV 缓存块时会导致引擎崩溃

    更新于 2026年9月14日
  • #261

    [错误] nano-vllm 在 Windows 上无法启动

    更新于 2026年9月1日
  • #187

    潜在的 TP 正确性问题: BlockManager 的容量可能依赖于每个排名的本地 KV 缓存估计

    更新于 2026年8月26日
  • #246

    Tensor 并行共享内存 RPC 缺乏工作进程确认,且可能损坏命令

    更新于 2026年6月25日
  • #245

    A100 PCIE GPU 中的低推论速度

    更新于 2026年6月20日
  • #244

    用于 nano-vllm 的轻量级 Go 负载均衡代理

    更新于 2026年6月17日
  • #240

    [错误] may_append 分配新区块时延迟了一个令牌,导致 KV 缓存写入未分配的区块

    更新于 2026年6月9日
  • #230

    文件增强建议

    更新于 2026年5月12日
  • #228

    [更改] Int8 KV 缓存 + 异步流程 + 头部重排,提高 22% 的吞吐量

    更新于 2026年5月8日
  • #225

    推出量化推理技术用于 Nano-vLLM - 一个用于 Qwen 模型的轻量级 FP8 运行时

    更新于 2026年5月7日
  • #220

    [功能请求] 支持无重量的 RMSNorm(用于 FlashNorm 权重折叠技巧)

    更新于 2026年5月6日
  • #221

    [讨论] 由于 vLLM-Omni 也很复杂,我尝试根据 nano-vllm 构建一个最小版本(约 1k 行代码)

    更新于 2026年5月1日
  • #219

    [讨论] 同一步骤前缀共享的重复块

    更新于 2026年4月28日
  • #206

    执行对 Quen3.5 的支持

    更新于 2026年4月20日
  • #114

    [BUG] 当提示长度与 kvcache_block_size 相等时发生崩溃

    更新于 2026年4月13日