#27329·llama.cpp

[CUDA][Blackwell] Qwen3.8-27B-NVFP4 解码卡死, CPU 运转, 没有 GPU 工作

作者: shimingzhe-7878778创建于 2026年8月18日更新于 2026年9月17日
标签bug-unconfirmed

名称和版本

LLaMA.cpp主分支,承诺:169e4a7ff201e666c2325bcd35afb64573e39d09 构建旗: -DGGML CUDA=ON GPU: RTX 5090D( Blackwell sm 100) (英语). 型号: Qune3. 8-27B-NVFP4-清洁, MTP 层被移除

操作系统

链接

QQ GML 后端

库达

硬件

Ultra 7 265K + RTX 5090D V2(布莱克威尔 sm 100)

++ 型号

Qune3.8--27B,NVFP4 定量,MTP层被去除

QQ 问题描述和复制步骤

当使用NVFP4四分数的Quen3.8‐27B型号运行LLaMA‐server时,自递解码会被挂在短提示上. 模型负载完全,所有地层被卸载到GPU成功. 用有效的 GPU 负载预填充效果良好 。 但解码相被卡住:单CPU线程自旋,没有真正的GPU推论运行,产生0个令牌,HTTP请求出站出站. 进程不会崩溃或断层 。

重现命令:./建立/bin/LLaMA-服务器 -m~/qwen3.8-27b-nvfp4-高精度.gguf. --mmproj/home/shimingzhe/mmproj-BF16.gguf

  • 不 - gpu - layers 全部 --ctx-尺寸 262144 --cache-type-k q4 nl 数据 --cache-type-v q4 nl 数据 -- 批量大小 512 --ubatch 大小 512 -- 第12行 -- 线- 批次 12 -- flash-attn 自动 -- spec-type 无
  • 不 - mmproj - 自动 -五号 --东道主 0.0. 0 8 000个端口 测试工作,没有固定的悬挂:
  • `GGML DISED GDN=1'
  • “GGML CUDA BLOCKING-SYNC=1”

测试工作,没有固定的悬挂:

  • `GGML DISED GDN=1'
  • “GGML CUDA BLOCKING-SYNC=1”

第一次失败的提交

无回复( N)

QQ 相关日志输出

[log.txt] (https://GitHub.com/user-attachments/files/31184552/log.txt) (中文(简体) ).

< 细节> <摘要>日志</摘要>

内容来源: ggml-org/llama.cpp