llama-cpp-python · Issues· 678 开放
在 GitHub 打开本地同步的开放议题(评论请到 GitHub 查看)
- #2231
对 Gemma 3 4B 和 Gemma 4 与 LLaMA-cpp-Python 的集成支持的请求
更新于 2026年9月6日 - #2362
长的空白标记会被解析为空字节,从而中断 tokenize/detokenize 的往返过程
更新于 2026年9月4日 - #2361
[错误] 由于缺少 ctx_other 和非自回归图执行, DFlash 2 的推测解码在 Python 中崩溃并失败
更新于 2026年8月20日 - #2013
无法在使用 Cuda 工具包 12.9 和 Cuda 12.9 的情况下安装支持 GPU 的版本
更新于 2026年8月16日 - #2352
对于版本高于 0.3.30 的系统,uv add LLaMA-cpp-Python 会失败
更新于 2026年7月31日 - #1169
Docker LLaMA-cpp libcuda.so.1: 无法打开共享对象文件: 找不到此文件或目录
更新于 2026年7月22日 - #2341
支持 CUDA 预构建的 sm100 和 sm120
更新于 2026年7月16日 - #2029
使用 pyinstaller 创建的 exe 文件遇到访问违规问题
更新于 2026年7月10日 - #2211
LLaMA.embed() 调用 LlamaBatch.add_sequence 方法,使用旧的 3 个参数签名;缺少 logits_array 参数
更新于 2026年7月7日 - #635
记录服务器命令行参数。
documentation更新于 2026年6月14日 - #2175
如何使用"Gemma-4-E4B-it-heretic-GGUF"?
更新于 2026年6月11日 - #463
CUBLAS 和 CLBLAST 在 Windows 上进行构建
documentationduplicatewindows更新于 2026年5月24日 - #450
OpenBLAS blas_thread_init 错误 - Linux Centos 7 使用 LLaMA-cpp-Python == 0.1.67
wontfix更新于 2026年5月24日 - #409
无法找到 nvcc,请设置 CUDAToolkit_ROOT
duplicatebuildhardwarellama.cppwindows更新于 2026年5月24日 - #383
提示要在服务器中使用的指令模型
modelquality更新于 2026年5月24日