num_gpu 选项混淆
作者: RemainIndoors1创建于 2025年11月21日更新于 2026年8月17日
这其实不是问题或错误,但也许可以增加清晰度。我在 Docker Desktop 上运行了两个 ollama 实例,分别在两个独立的 GPU 上运行,一直无法弄清楚为什么每当我从 Python 调用这些实例时,它总是将大部分的 LLM 加载到我的 CPU 上,而不是与每个容器关联的 GPU 上。 最终的问题在于,我在调用聊天端点时尝试使用了选项。其中一个选项是 num_gpu,从名称上看,似乎是指你希望它使用的 GPU 数量。显然,这只是我没有阅读 Ollama 文档中的每个选项的作用,而对 num_gpu 的了解是不够的,但 num_gpu 实际上是指你希望将多少层移动到 GPU 上,对于 gpt-oss:20b 来说,大约是 25 层,因此如果 num_gpu=1,假设这是你希望它使用的 GPU 数量,那么它将在 GPU 上放置大约 1.1GiB 的模型,在 CPU/内存上放置 11.8GiB 的模型。 总之,就像软件开发中常常发生的那样,我既是问题,也是无知,但如果在本仓库的某个 README 文件中记录了选项参数,会很有帮助。或者更清楚地在 Ollama 的 GitHub 仓库 中记录。但就算有人遇到类似的问题,这里至少也能提供一些参考。
内容来源: ollama/ollama-python