flash-attention · Issues· 1308 开放
在 GitHub 打开本地同步的开放议题(评论请到 GitHub 查看)
- #2897
[CuTe, SM80] 前向模型默认忽略 `block_sparse_tensors` 并返回稠密注意力
更新于 2026年9月18日 - #2832
使用 CUDA 13.4 时,Windows 编译失败:缺少 /Zc:preprocessor、/std:c++17 限定 (此外没有 sm_121 gencode)
更新于 2026年9月17日 - #2456
[RFC] FA4 — head_dim=256 & head_dim=512
更新于 2026年9月14日 - #2581
在 SM89 (Ada) 上支持 head_dim=512,用于 Gemma 4 全局注意力层
更新于 2026年9月9日 - #1786
如果令牌数量过大,则会发生 RuntimeError
更新于 2026年9月9日 - #2729
[FA4/B200] return_lse=True 使 D64 向前运行速度提高了约 19%
更新于 2026年9月6日 - #2861
无法在 Windows 上安装 - Aiter 路径太长
更新于 2026年9月5日 - #2860
[FA4][SM120] flash_attn_varlen_func/flash_attn_func 在实际工作负载内存布局下,在 >=4 个可变长度段中发生非法内存访问 (b26/b29, GeForce Blackwell)
更新于 2026年9月5日 - #2852
FA4 SM103 逆向预处理谓词形状不匹配,原因是填充头的尺寸不正确
更新于 2026年9月4日 - #2842
splitkv 早期退出路径忽略了未填充的 LSE,将 -inf 写入错误的 LSE 插槽
更新于 2026年9月2日 - #2413
FA4 对 RTX 6000 Pro Blackwell 的支持
更新于 2026年8月31日 - #1926
在 Google Colab A100 上使用最新环境安装 pip install flash-attn 会卡死
更新于 2026年8月28日 - #2818
使用 `torch.library.wrap_triton` 会在 `rotary` 中引入可衡量的 CPU 开销
更新于 2026年8月27日 - #2801
[FA4] max_seqlen_q 向量在 varlen 前向传递时导致参数标注不匹配
更新于 2026年8月23日 - #2811
测试/ test flash attn.py 不使用 einops 收集失败
更新于 2026年8月20日