llama.cpp · Issues· 2476 开放
在 GitHub 打开本地同步的开放议题(评论请到 GitHub 查看)
- #28798
Eval 错误: `ggml_compute_forward_flash_attn_ext_tiled`(CPU) 在长提示中发生 SIGSEGV – 在多个模型/提交中都可重现,解决方法是 `--flash-attn off`
更新于 2026年9月17日 - #29022
功能请求: 通过预填 Logit 切片实现快速工具分割和单步选择
enhancement更新于 2026年9月17日 - #29028
Eval 错误: qwen4exp / DeepSeek-v4 在 Vulkan (RADV, gfx1151) 上在首次解码时中止
更新于 2026年9月17日 - #28860
Eval 问题: 当启用 ngram-mod 时, SYCL 需要极大的临时存储空间分配 (2GB+)。
bug-unconfirmed更新于 2026年9月17日 - #29023
其他错误: UI 错误。在空闲聊天屏幕上,聊天消息框会增长到窗口顶部(在 b10824 中出现回退)
bug-unconfirmed更新于 2026年9月17日 - #29021
Eval 问题: 在关闭 Vulkan GPU 卸载的情况下,Gemma 4 E4B 在加载模型时出现卡死
bug-unconfirmed更新于 2026年9月17日 - #29017
Misc. bug: 启用 mTP 的 “ 存在 惩罚 > 0” 时, 大量生成的吞吐量下降
bug-unconfirmed更新于 2026年9月17日 - #27329
[CUDA][Blackwell] Qwen3.8-27B-NVFP4 解码卡死, CPU 运转, 没有 GPU 工作
bug-unconfirmed更新于 2026年9月17日 - #27364
其他错误: 每秒令牌指标出现问题
bug-unconfirmed更新于 2026年9月17日 - #28939
Eval 错误: DeepSeek-v4-flash-vision exp. DSpark 和 Dflash 没有提高令牌生成速度。
bug-unconfirmed更新于 2026年9月17日 - #27455
功能请求: 在服务器端展示推理工作级别,并在 LLaMA 界面中使用这些级别
enhancement更新于 2026年9月17日 - #9289
更改日志: `libllama` API
documentationroadmap更新于 2026年9月17日 - #26409
Eval 问题: SYCL `--split-mode tensor` 比单个 GPU 速度慢 3 倍,并且使用量化 KV 缓存时会卡死
bug-unconfirmed更新于 2026年9月17日 - #28153
功能请求: 添加对 Xing4.0-29B-A4B 的支持
enhancement更新于 2026年9月17日 - #29011
功能请求: MoE 浏览器专家
enhancement更新于 2026年9月17日