turboquant_plus · Issues· 47 开放
在 GitHub 打开本地同步的开放议题(评论请到 GitHub 查看)
- #99
CUDA vec FA 内核: turbo4 V 缓存分支每次迭代消耗 4 个元素中的 8 个元素 - 在批量-1 解码中,每个头的 V 输出中有一半为零 (附有补丁)
更新于 2026年9月3日 - #97
uv pip install turboquant 也需要
更新于 2026年7月26日 - #92
是否可以与 MTP 草稿模型一起使用?
更新于 2026年5月21日 - #27
上游: TurboQuant 讨论 + LLaMA.cpp 的贡献要求
type:portP2更新于 2026年5月4日 - #86
[ROCm] 在加载 Gemma 4 期间,扩展操作出现"设备功能无效"错误
更新于 2026年4月23日 - #85
功能请求: 仅适用于 Windows CPU 的预构建二进制文件
更新于 2026年4月23日 - #84
诊断: [RTX 3090]
更新于 2026年4月20日 - #82
关于 QJL 切除研究的问题
更新于 2026年4月16日 - #80
量化和解量化的时间和性能开销
更新于 2026年4月13日 - #79
QJL 复活问题的可重复性
更新于 2026年4月13日 - #74
它运行着
更新于 2026年4月9日 - #72
在 CPU 上使用 --cache-type turbo4 进行端到端推理测试时失败
更新于 2026年4月9日 - #70
从源码构建时出错
更新于 2026年4月3日 - #69
极坐标转换操作
更新于 2026年4月3日 - #68
在使用 --tensor-type-file 或 --tensor-type 时,LLaMA-quantize 会崩溃,原因是 ios_base::failbit (来自 #20503 的回归问题)
更新于 2026年4月3日