#13320·ipex-llm

在使用可移植的 LLaMA.cpp 进行 qwen3 32b 推理时,无法为 matmul 原语创建原语描述符

作者: XCRobert创建于 2025年10月17日更新于 2026年1月7日
标签user issue

**描述错误** 1. 安装最新的驱动程序并安装最新的 Windows 版本 LLaMA.cpp 从 https://GitHub.com/ipex-LLM/ipex-LLM/releases/tag/v2.3.0-nightly 下载 Qwen3-32B-Q8_0.gguf 模型 3. 为具有 Intel GPU 的 64GB 机器准备好 4. 修改注册表项: [HKEY_LOCAL_MACHINE\System\CurrentControlSet\Control\GraphicsDrivers\MemoryManager] "SystemPartitionCommitLimitPercentage" 将其设置为 0x4b,这意味着使用 75% 内存作为共享 GPU 内存 6. LLaMA-cli.exe -m ..\models\Qwen3\Qwen3-32B-Q8_0.gguf -p "如何成为 GPU 驱动程序专家" -n 2048 -e -ngl 999 --color -c 2500 --temp 0 -no-cnv 然后将遇到以下问题: llama_context: SYCL_Host 输出缓冲区大小 = 0.58 MiB llama_kv_cache_unified: SYCL0 KV 缓冲区大小 = 632.00 MiB llama_kv_cache_unified: 大小 = 632.00 MiB (2528 个单元,64 层,1 个序列),K (f16): 316.00 MiB,V (f16): 316.00 MiB llama_context: SYCL0 计算缓冲区大小 = 1497.80 MiB llama_context: SYCL_Host 计算缓冲区大小 = 73.54 MiB llama_context: 图形节点 = 2054 llama_context: 图形分支 = 2 common_init_from_params: 将 dry_penalty_last_n 设置为 ctx_size = 2528 common_init_from_params: 正在使用空运行对模型进行预热 - 请稍候 ... (--no-warmup 可禁用) **无法为 matmul 原语创建原语描述** **在文件 D:\actions-runner\release-cpp-oneapi_2024_2\_work\LLM.cpp\LLM.cpp\LLaMA-cpp-bigdl\ggml\src\ggml-sycl\ggml-sycl.cpp 行 3552,函数 operator() 中捕获了异常** SYCL 错误: CHECK_TRY_ERROR(op(ctx, src0, src1, dst, src0_dd_i, src1_ddf_i, src1_ddq_i, dst_dd_i, dev[i].split_dim_low, dev[i].split_dim_high, src1_ncols, src1_padded_col_size, stream)): 在此代码行中捕获了异常。** 在函数 ggml_sycl_op_mul_mat 中,在 D:\actions-runner\release-cpp-oneapi_2024_2\_work\LLM.cpp\LLM.cpp\LLaMA-cpp-bigdl\ggml\src\ggml-sycl\ggml-sycl.cpp:3552