[错误]: Linux, 兄弟引擎: `--auto-tier` 会默默地删除 `coli plan`/`coli doctor` 所宣传的 VRAM 层 (qwen36 CUDA 构建, 11.8 → 21 tok/s 使用 `--gpu auto`)
QQ 提交或版本
v1.11.0- a8f2ca6的"主". " dev " (b5968eb, " c/coli " 第579行)的代码路径不变。
环境
Ubuntu 26.04.1, i7-1700K (8C/16T), 62 GB RAM, RTX 4060 Ti 8 GB (driver 595.91.07), CUDA工具包 12.4(Ubuntu套件, `NVCC=/usr/bin/nvcc NVCC CCBIN=g++-13'), gcc 15.2, 三星 980 PRO NVMe. Model: ' Kreuzzelg/qwen36-35b-a3b-colibri-i4-gs64'.
- 复制步骤
{\fn黑体\fs22\bord1\shad0\3aHBE\4aH00\fscx67\fscy66\2cHFFFFFF\3cH808080}你觉得呢? make -C c qwen36 CUDA=1 CUDA ARCH=native NVCC=/usr/bin/nvcc NVCC CCBIN=g++-13 make-C c colibri CUDA=1 CUDA ARCH=native NVCC=/usr/bin/nvcc NVCC CCBIN=g++-13# 所以cuda binary ()通过主干.
#1. 策划者和医生都广告VRAM级别,不需要旗帜 python3 c/ coli 平面图 - 型号为 python3 c/ coli 医生-模型
2. 实施计划
COLI MODEL QQQQQqwen36 i4 gs64> python3 c/coli service --auto-tier -- id qwen36 (中文(简体) ).
在解码时在API, nvidia-smi 上一个聊天完成
3. 相同,有 -- gpu 自动
COLI MODEL qwen36 i4 gs64> python3 c/coli service --auto-tiel --gpu autu -- model-id qwen36
预期行为
‘-自发'被记录为"自动应用RAM/VRAM计划". 其适用的计划是 " coli plan " 打印,其中包含一个VRAM级:
^ 0: NVIDIA GEFORCE RTX 4060 Ti 限制 CPU 专家尾巴和 GPU 计算
和`coli doctor ' 报告`[好]加速器.gpu GPU引擎和设备可用'(医生检查qwen36 二进制本身)。 我期望第二步开始 或至少说它不会。
实际行为和记录
第二步只启动CPU,无声. 引擎横幅上没有"[CUDA]"/"[qtier]"一行,VRAM在解码时会停留在桌面的897 MiB上,服务日志上根本没有"[PLAN]"一行(兄弟-引擎路径的打印没有),因此没有任何信息告诉用户计划中的VRAM部分被放弃:
================== ======================================================================================================================================================================= 载荷后装入6.7s的常住重量: 9.23 GB OpenAI-兼容API收听 http://127.0.0.1:8000/v1
第3步如意:
[CUDA]设备 0: NVIDIA GeForce RTX 4060 Ti, 8.2 GB VRAM, sm 89 [位置]自动:dev 0持有1207.4 MB干线(lmhead yes,30 dnproj 层),4.05 GB留给专家使用. [qtier] CUDA VRAM 专家级活动:1个设备,1.80 MB/专家
相同的 115- token 补全, “ 温度=0 ” , 相同的输出文本 :
QQ 启动 QQ 请求( 温暖) QQ ‘ 工具/ 数据点. py' 旋转中位数 QQ TTFT QQ
|.
* * * * * * * * * * * * * * * *
" -- -- -- -- -- -- -- -- -- -- -- -- -- -- -- -- -- -- -- -- -- -- -- -- --
因此,Linux的用户用一个兄弟式引擎来做`coli Plan'建议的东西,就能得到一半的吞吐量,而没有任何暗示。 我找到它只是因为我在看"nvidia-smi"。
从哪里来?
在“env for()”中,两种途径有分歧:
- GLM(`c/coli'~主线767):`has cuda=cuda binary();
. . . . . . .
内容来源: JustVugg/colibri