#2897·flash-attention[CuTe, SM80] 前向模型默认忽略 `block_sparse_tensors` 并返回稠密注意力作者: nien-hui创建于 2026年9月18日更新于 2026年9月18日问题 内容来源: Dao-AILab/flash-attention查看 GitHub 原文在 GitHub 查看讨论