百科.dev
全部条目AI 编程趋势榜开源项目技术资讯提交条目
登录
返回工具页

server · Issues· 895 开放

在 GitHub 打开

本地同步的开放议题(评论请到 GitHub 查看)

  • #8979

    k8s-onprem 自动调整规模指标 avg_time_queue_us 会低估队列时间,大致相当于加载的模型数量

    更新于 2026年9月18日
  • #8978

    python_backend: 在父进程在 is_ready() 准备性检查中读取之前,shm 发生了错误字符串释放 -> 分配器损坏 -> 永久卡死

    更新于 2026年9月18日
  • #8969

    在模型初始化失败后,TensorRT 后端会泄露 GPU 资源;卸载无法恢复内存

    更新于 2026年9月11日
  • #8947

    在新 pod 创建后, L40S 节点上的随机延迟回归 – 节点持续"不良"

    performance更新于 2026年9月11日
  • #8301

    [服务器] 支持 numpy2.x

    更新于 2026年9月8日
  • #8882

    在并发 BLS 加载情况下,Python 后端发生间歇性服务器崩溃(`boost::interprocess::lock_exception`/`std::bad_alloc`/`SIGSEGV`) — 25.02 (2.55.0)

    更新于 2026年9月6日
  • #8945

    Triton TRT-LLM 多模导航器已过时

    更新于 2026年8月31日
  • #8853

    PyTorch 后端文档中的不准确之处

    documentation issueDocumentation更新于 2026年8月30日
  • #8117

    [问题] 重新加载模型和延迟异常

    更新于 2026年8月19日
  • #8922

    InferenceRequest.async_exec(decoupled=True) 在并行运行的 BLS 中定期抛出 `RuntimeError: Invalid argument` 到解耦模型

    更新于 2026年8月15日
  • #8924

    vLLM 后端将过时的原始提示传递给 InputProcessor

    更新于 2026年8月10日
  • #8841

    Python 子进程因 glibc 堆内存损坏而终止,导致 gRPC 服务线程的 RPS 为 0

    更新于 2026年8月9日
  • #8919

    测试: L0_lifecycle 使用 blind.time.sleep(5) 来加载和卸载模型,导致 CI 失败不稳定

    更新于 2026年8月6日
  • #8894

    [vLLM 后端][功能请求] 支持 vLLM-Omni 用于原生音频/视频输入

    更新于 2026年8月4日
  • #8375

    [问题] vLLM 服务器和 Triton 推理服务器的性能不同

    更新于 2026年7月30日