GLM5.2 int8: 'AMXMoEWrapper' 对象没有属性 'submit_write_weight_scale_to_buffer'
作者: AGenchev创建于 2026年7月27日更新于 2026年9月11日
QQ 提醒
- 我读过上述规则,并研究了现有的问题。
QQ 系统信息
系统:GPU:4xA100/80 CPU:2xAMD EPYC 9254,平台:Linux 7.0.11-arch1-1 KMD版本:610.43.02 CUDA UMD版本:13.3 康达风道3.11: 库多12.8 软件包 : kt-内核0.6.4 sglang-kt 0.6.3.后1 (sglang-kt) 缩写
- 复制
- 编写 conda venv(安装编译器,与 CUDA 12.8 相匹配的库, nvcc 为 12.8 编译 ktransfers, 设置 env vars 与 venv 编译器并链接 w v 库)
- 下载GLM 5.2 FP16
- 转换CPU重量: `Python转换-cpu 重量.py-输入-路径 '/home/user/LLMs/重量/GLM-5.2-FP16'-输入-类型fp16-输出-home/user/LLM/重量/GLM-5.2-int8-CPU'-quant-method int8-cpuinfer-threads 48-threadpoll-counter 8-no-merge-safensor'
- 使用原始 BF16 GPU 权重(因为转换失败,但主题不同)
- 发射:
Python - m sglang. 发射 server?
- 型号-路径 '/家用/用户/LLMS/重量/GLM-5.2-FP16'\?
--kt-重量-路径 '/家用/用户/LLM/重量/GLM-5.2-int8-CPU'\?
{\fn黑体\fs22\bord1\shad0\3aHBE\4aH00\fscx67\fscy66\2cHFFFFFF\3cH808080}请说...
--kt-threadpool -- counter 8 \
...kt-num-gpu-专家 30\
——kt-方法 AMXINT8
-kt -gpu - 预补 - 键 - 第 512 个
- Kt - enable - 动态 - 专家 - 更新
- Kt - 专家安置 - 战略制服
-kt -max -deerred - 专家 - /token 1\
装满了预装机的16384
... enable- p2p- check\
-可以混入 -可以混入
睡觉吧 睡觉吧
观察者时间3000?
--tp -- small 4\
- 库达 - 地图 - max - bs 4 \
- 信任 - 远程代码 \
——mem-fraction- static 0.95 (英语).
-- kv- cache- dage 自动 \
-192000年最大总音响
...最大运行 - 请求 4\
- 注意后端的三进制
--fp8-gem-后端自动 \
- 工具呼叫- parser glm47 \
- 解释 - parser glm45\
-- serviced-model-name GLM5.2i \
主持人 127.0.0.1 o
--port 1027 -- dtype 自动-结果:模式运行
- 发送请求
- 结果:崩溃 + 长期追踪(附后)
[log.log] (https://GitHub.com/user-attachments/files/30427310/log.log) (中文(简体) ).
其他
闪光法为0.6.3
GLM5.2 w BF16 - 工作~ 6.6 tk/s
内容来源: kvcache-ai/ktransformers