常见问题 | FAQs
[注]
请**避免就下列问题提出问题,因为这些问题可能在没有答复的情况下得到解决。 QQ问题,gall问题
[!TIP] (中文(简体) ). 文件:https://kvcache-ai.ZGitHub.io/ktransfers/
- 说说看 QQ 大部分问题/QQ QQ 如何安装 kt- 内核 / kt- 内核
请在以下链接后更新存储器并再次安装 : 校对:Soup https://GitHub.com/kvcache-ai/ktransfers/blob/main/kt-内核/README.md. Kt- 内核+ 推论 Sglang/ 12. kt-内核 + Sglang + QQ
- 安装SGLang
{\fn黑体\fs22\bord1\shad0\3aHBE\4aH00\fscx67\fscy66\2cHFFFFFF\3cH808080}你觉得呢? git 克隆 https://GitHub.com/sgl-project/ sglang.git cd sglang (英语). pip 安装 -e"Python[全]"
2. 准备重量
您既需要GPU权重, 也需要CPU权重 来进行不同的推断 :
** GPU 重量:** 使用原/已定量模型加权.
** CPU 重量:** 使用转换脚本量化到 AMX 优化格式 :
{\fn黑体\fs22\bord1\shad0\3aHBE\4aH00\fscx67\fscy66\2cHFFFFFF\3cH808080}你觉得呢?
Python 脚本/转换 cpu 重量.py \
- 输入-路径/路径/到/模式?
-- input-type bf16\\# 取决于您的 GPU 重量类型: fp8, fp16, 或 bf16
产出/路径/到/重量?
--quant- method int8 # 或 int4 组合键** 支持的输入格式:** FP8、FP16、BF16、INT4/INT8。
详情见:
** 注:** LLAMAFILE后端直接支持GGUF格式,但此功能仍在预览中.
- 启动SGLang服务器
以正常的 SGLang 参数启动 SGLang 服务器, 并添加以下 KT- Kernel 特定参数, 以允许 CPU- GPU 的多样推论 :
** KT-Kernel 参数需要添加:**
-kt-方法':后端方法(AMXINT4、AMXINT8或LAMAFILE)-kt-重量-路径':转换后的CPU重量路径-kt-cpuinfer':CPU推论线程数量(设定为物理核心)-kt-线圈-计数':线圈数目(设置为NUMA节点计数)- `-kt-num-gpu-专家':保留GPU的专家人数
- `-kt-max-deferred-experters-per-token': 延迟执行的专家
示例
{\fn黑体\fs22\bord1\shad0\3aHBE\4aH00\fscx67\fscy66\2cHFFFFFF\3cH808080}你觉得呢?
Python - m sglang. 发射 服务器?
[你的普通SGLang参数...]
——kt-方法 AMXINT8
-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克-克
...kt-cpuinfer 64\\ n
-kt-threadpool - Count 2
-kt -num -gpu -专家 32
--kt-max- deferred-experts-per-token 2 (英语).
- - - - - 说说看
++ 支持模式/+++
QQ 型号 名称 / QQ 已经 测试 / QQ
|--------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------
GLM- 4.5-Air : white check mark: |:
GLM- 4.5 : 白色 检查 标记:
^ Quen3-30B-A3B ^ : 白-检查-标记: ^
* Qwen3-235B-A22B-思维2507
. . . . . . .内容来源: kvcache-ai/ktransformers