server · Issues· 895 开放
在 GitHub 打开本地同步的开放议题(评论请到 GitHub 查看)
- #8979
k8s-onprem 自动调整规模指标 avg_time_queue_us 会低估队列时间,大致相当于加载的模型数量
更新于 2026年9月18日 - #8978
python_backend: 在父进程在 is_ready() 准备性检查中读取之前,shm 发生了错误字符串释放 -> 分配器损坏 -> 永久卡死
更新于 2026年9月18日 - #8969
在模型初始化失败后,TensorRT 后端会泄露 GPU 资源;卸载无法恢复内存
更新于 2026年9月11日 - #8947
在新 pod 创建后, L40S 节点上的随机延迟回归 – 节点持续"不良"
performance更新于 2026年9月11日 - #8301
[服务器] 支持 numpy2.x
更新于 2026年9月8日 - #8882
在并发 BLS 加载情况下,Python 后端发生间歇性服务器崩溃(`boost::interprocess::lock_exception`/`std::bad_alloc`/`SIGSEGV`) — 25.02 (2.55.0)
更新于 2026年9月6日 - #8945
Triton TRT-LLM 多模导航器已过时
更新于 2026年8月31日 - #8853
PyTorch 后端文档中的不准确之处
documentation issueDocumentation更新于 2026年8月30日 - #8117
[问题] 重新加载模型和延迟异常
更新于 2026年8月19日 - #8922
InferenceRequest.async_exec(decoupled=True) 在并行运行的 BLS 中定期抛出 `RuntimeError: Invalid argument` 到解耦模型
更新于 2026年8月15日 - #8924
vLLM 后端将过时的原始提示传递给 InputProcessor
更新于 2026年8月10日 - #8841
Python 子进程因 glibc 堆内存损坏而终止,导致 gRPC 服务线程的 RPS 为 0
更新于 2026年8月9日 - #8919
测试: L0_lifecycle 使用 blind.time.sleep(5) 来加载和卸载模型,导致 CI 失败不稳定
更新于 2026年8月6日 - #8894
[vLLM 后端][功能请求] 支持 vLLM-Omni 用于原生音频/视频输入
更新于 2026年8月4日 - #8375
[问题] vLLM 服务器和 Triton 推理服务器的性能不同
更新于 2026年7月30日