Qwen3.8-Flash-Next: qwen38 引擎是否计划支持 GPU 后端 (CUDA/HIP)? (优惠: gfx1151/ROCm 7.2.4 验证和基准测试)
作者: simongonzalezdc创建于 2026年8月31日更新于 2026年9月17日
感谢 colibri — 在您已拥有的硬件上运行 frontier MoE 正是正确的想法,而 v1.10.1 在第一天就在这里运行了 Flash-Next。 ** 设置: Qwen3.8-Flash-Next-FP8 (官方检查点), colibri v1.10.1 linux-x86_64 版本, Strix Halo (Ryzen AI Max 395, gfx1151 iGPU, 96 GB 统一存储), ROCm 7.2.4, 模型位于外部存储。 ** 测量结果 (根据 CONTRIBUTING 中的基准条目):
coli serve --ram 20 --auto-tier --policy experimental-fast- 冷启动: 248.6 秒内生成 49 个完成标记 (约 0.20 个标记/秒); 热启动: 215.3 秒内生成 47 个标记 (约 0.22 个标记/秒); 每个请求一次 (小型规模,不是基准测试)
- 占用内存 10.88 GiB,加载 15.3 秒,答案正确,医生报告 "GPU 已检测到,但引擎仅为 CPU 版本" 和 "RAM 预算无法容纳每个稀疏层一个专家槽"
- 该机器同时运行其他常驻服务,因此上述 RAM 预算是安全的,专家常驻率实际上为 0%,解码受限于磁盘,这与医生的位置警告完全一致
内容来源: JustVugg/colibri