百科.dev
全部条目AI 编程趋势榜开源项目技术资讯提交条目
登录
返回工具页

vllm · Issues· 8061 开放

在 GitHub 打开

本地同步的开放议题(评论请到 GitHub 查看)

  • #57406

    [功能]: GLM 5.3 性能优化

    feature requestglm更新于 2026年9月17日
  • #57230

    [ROCm][AMD] gfx950/MI355X 上的 GLM5.2/5.3 性能优化

    feature requestrocmquantization更新于 2026年9月17日
  • #50587

    [功能]: Kimi K3 性能优化

    feature requestkimik3更新于 2026年9月17日
  • #52167

    [RFC]: 扩展的在线量化路线图

    RFCquantization更新于 2026年9月17日
  • #43501

    [Feature]:将 " 活性量聚变 " 移植到手动聚变中

    feature request更新于 2026年9月17日
  • #48895

    [错误]: moe_wna16_marlin_gemm 在 gpt-oss NVFP4 MoE 形状中应用了错误的每行 topk 权重 (mul_topk_weights=True) — 导致输出损坏

    bug更新于 2026年9月17日
  • #43224

    [RFC]: 将编译器融合移植到手动融合

    RFCstale更新于 2026年9月17日
  • #57346

    [功能]: [CPU][GLM5Next][KDA] 为 GLM-5.3-Flash 添加 CPU KDA 后端

    feature requestkimiglm更新于 2026年9月17日
  • #57383

    [RFC]: DeepSeek-V4.1 闪存的非对称 P/D 部署

    RFCdeepseekDSv4.1更新于 2026年9月17日
  • #57200

    [RFC] 将控制台日志配置模型转换为 CLI/服务配置

    更新于 2026年9月17日
  • #38175

    [RFC]: 支持 ViT 全 CUDA 图 (追踪器)

    help wantedRFCmulti-modalitykimi更新于 2026年9月17日
  • #54207

    [功能]: 为可重复使用的多模态和推理状态添加明确的缓存 ID

    feature requestmulti-modality更新于 2026年9月17日
  • #55578

    [功能]: [vllm_gguf_plugin] 添加 --gguf-dequant-on-load 选项,为预填量大的工作负载解锁 cuBLAS 矩阵核心

    feature requestquantization更新于 2026年9月17日
  • #57324

    [错误]: Claude 代码工具搜索: 每个会话的第一个请求都以 400 状态码被拒绝 (/v1/messages 不接受 tool_addition 内容块)

    tool-calling更新于 2026年9月17日
  • #56851

    [RFC]: 在 /inference/v1/generate 上请求文本和重新渲染输出

    RFC更新于 2026年9月17日