vllm · Issues· 8061 开放
在 GitHub 打开本地同步的开放议题(评论请到 GitHub 查看)
- #57406
[功能]: GLM 5.3 性能优化
feature requestglm更新于 2026年9月17日 - #57230
[ROCm][AMD] gfx950/MI355X 上的 GLM5.2/5.3 性能优化
feature requestrocmquantization更新于 2026年9月17日 - #50587
[功能]: Kimi K3 性能优化
feature requestkimik3更新于 2026年9月17日 - #52167
[RFC]: 扩展的在线量化路线图
RFCquantization更新于 2026年9月17日 - #43501
[Feature]:将 " 活性量聚变 " 移植到手动聚变中
feature request更新于 2026年9月17日 - #48895
[错误]: moe_wna16_marlin_gemm 在 gpt-oss NVFP4 MoE 形状中应用了错误的每行 topk 权重 (mul_topk_weights=True) — 导致输出损坏
bug更新于 2026年9月17日 - #43224
[RFC]: 将编译器融合移植到手动融合
RFCstale更新于 2026年9月17日 - #57346
[功能]: [CPU][GLM5Next][KDA] 为 GLM-5.3-Flash 添加 CPU KDA 后端
feature requestkimiglm更新于 2026年9月17日 - #57383
[RFC]: DeepSeek-V4.1 闪存的非对称 P/D 部署
RFCdeepseekDSv4.1更新于 2026年9月17日 - #57200
[RFC] 将控制台日志配置模型转换为 CLI/服务配置
更新于 2026年9月17日 - #38175
[RFC]: 支持 ViT 全 CUDA 图 (追踪器)
help wantedRFCmulti-modalitykimi更新于 2026年9月17日 - #54207
[功能]: 为可重复使用的多模态和推理状态添加明确的缓存 ID
feature requestmulti-modality更新于 2026年9月17日 - #55578
[功能]: [vllm_gguf_plugin] 添加 --gguf-dequant-on-load 选项,为预填量大的工作负载解锁 cuBLAS 矩阵核心
feature requestquantization更新于 2026年9月17日 - #57324
[错误]: Claude 代码工具搜索: 每个会话的第一个请求都以 400 状态码被拒绝 (/v1/messages 不接受 tool_addition 内容块)
tool-calling更新于 2026年9月17日 - #56851
[RFC]: 在 /inference/v1/generate 上请求文本和重新渲染输出
RFC更新于 2026年9月17日