对 #978 的后续工作: 将 fa_helpers 的多架构支持扩展到 AVX-512F 之外
作者: aittalam创建于 2026年5月24日更新于 2026年5月24日
**Follow-up to PR #978** (which resolves #975 — CPU flash-attention regression). PR #978 添加了三个 flash-attention 协助程序的 AVX-512F 变体(`llamafile_fa_vec_dot_f16`,`llamafile_fa_fp16_to_fp32_row`,`llamafile_fa_simd_gemm`),通过 `sgemm.cpp` 中的 `GemmFuncs` 进行运行时调度。目前没有 AVX-512F 的 CPU 并没有受益 — 它们会通过到上游的协助程序(这正是它们之前的行为,因此这不是回退,只是没有优势)。
内容来源: mozilla-ai/llamafile