OpenAI API: 自动切换不会冷加载下载的 GGUF,因此当没有加载任何内容时,/v1/chat/completions 会返回 400 "没有加载模型"
作者: kpulik创建于 2026年9月16日更新于 2026年9月17日
□ 总结
启用了“ openai api auto switch model ” 后, OpenAI 的兼容请求将命名为 完全下载的本地 GGUF 在 * some* 型号已经装入时被正确服务, 但是 返回 `400。 拨打 POST / 推导/ 装入。 ” 都说吧 环境本身的文件说,
openai api auto switch model':当启动时,一个v1'请求,其`model'名称被下载 本地型号不同于已装入型号, 在服务前透明加载 (LLaMA- swap-tyle).
和 {no model load detail> 描述为:
自动开关( 默认关闭) 冷载请求下载的 GGUF
在实际操作中,一个冷的服务器从不加载,所以每个与 Studio 说话的外部代理 `/v1' 在工作室启动后的第一个请求中失败, 直至用户手工加载一个模型 在UI。
□ 环境
unsloth' 2026.9.4(PyPI,install source: pypi'),Usloth.app 6.1.808-β- macOS 26 (达尔文27.0.0), Apple M4 Pro, 24 GB
- 工作室绑定在‘127.0.0.1:8888',‘没有钥匙的 api access scope:"完全"
□再现.
- 退出Unsloth工作室,重新启动,不装入模型。 确认没有载入 :
卷曲-本地主机:8888/v1/型号
{"对象":"列表","数据": [{'id':"unsloth/Quen3.8-27B-GGUF" "对象":"模型","装入":"等量":"UD-Q4 K S",.}}}
- 确认自动开关,运行中的服务器看到:
卷曲-本地主机:8888/api/设置/OpenAI-自动开关
{"启用":真"自发 卸载 idle seconds":0,"默认 启用":假"idle unload active":假":
"自动卸载 保持 kv":真"自"自"下载" 模型":假"自"自动卸载 api 只":假".
- 在OpenAI兼容路线上请求该型号:
美元卷起 - 本地主机 : 8888/v1/ 聊天/ 完成 ?
-H'Content-Type:应用程序/json'\
-d"{"型号":"unsloth/Qune3.8-27B-GGUF","消息":[{"作用":"用户","内容":"hi"],"max tokens":8}"
{"错误":{"消息":"没有装入模型. 先叫POST/推论/装入",
"类型":"无效 request error",param":null",code":null}}"
HTTP 400,以~150毫秒的速度返回. 未尝试负载 。
□ 预期
自动开关装入`unsloth/Qune3.8-27B-GGUF'并满足请求,如同当一个 已经装入不同的模型 。
□ 实际
400 " 未装入型号。 先拨POST/推论/装入. " 提示后缀( 或启用模型) 自动开关...)被正确省略,这证实了服务器将自动开关视为 启用 。 开关根本没开
□ 更多细节
- 与后缀相同:`unsloth/Qune3.8-27B-GGUF:UD-Q4 K S'。
- 不是冷指数效应:用 " GET/v1/型号 " (该型号记录)使解析器升温 `经过检查的模型扫描:检查=7...返回=2')和再试验给予同样的400个。
- 模型解决的很好。 在工作室自己的视频:
出自 Core. inference.local model resolver导入解析 local gguf,索引 已建
QQ 索引 is 已建()
虚假
解析 local uguf ('unsloth/ Quen3. 8- 27B- GGUF')
. . . . . . .
内容来源: unslothai/unsloth