百科.dev
全部条目AI 编程趋势榜开源项目技术资讯提交条目
登录
返回工具页

flash-attention · Issues· 1308 开放

在 GitHub 打开

本地同步的开放议题(评论请到 GitHub 查看)

  • #2897

    [CuTe, SM80] 前向模型默认忽略 `block_sparse_tensors` 并返回稠密注意力

    更新于 2026年9月18日
  • #2832

    使用 CUDA 13.4 时,Windows 编译失败:缺少 /Zc:preprocessor、/std:c++17 限定 (此外没有 sm_121 gencode)

    更新于 2026年9月17日
  • #2456

    [RFC] FA4 — head_dim=256 & head_dim=512

    更新于 2026年9月14日
  • #2581

    在 SM89 (Ada) 上支持 head_dim=512,用于 Gemma 4 全局注意力层

    更新于 2026年9月9日
  • #1786

    如果令牌数量过大,则会发生 RuntimeError

    更新于 2026年9月9日
  • #2729

    [FA4/B200] return_lse=True 使 D64 向前运行速度提高了约 19%

    更新于 2026年9月6日
  • #2861

    无法在 Windows 上安装 - Aiter 路径太长

    更新于 2026年9月5日
  • #2860

    [FA4][SM120] flash_attn_varlen_func/flash_attn_func 在实际工作负载内存布局下,在 >=4 个可变长度段中发生非法内存访问 (b26/b29, GeForce Blackwell)

    更新于 2026年9月5日
  • #2852

    FA4 SM103 逆向预处理谓词形状不匹配,原因是填充头的尺寸不正确

    更新于 2026年9月4日
  • #2842

    splitkv 早期退出路径忽略了未填充的 LSE,将 -inf 写入错误的 LSE 插槽

    更新于 2026年9月2日
  • #2413

    FA4 对 RTX 6000 Pro Blackwell 的支持

    更新于 2026年8月31日
  • #1926

    在 Google Colab A100 上使用最新环境安装 pip install flash-attn 会卡死

    更新于 2026年8月28日
  • #2818

    使用 `torch.library.wrap_triton` 会在 `rotary` 中引入可衡量的 CPU 开销

    更新于 2026年8月27日
  • #2801

    [FA4] max_seqlen_q 向量在 varlen 前向传递时导致参数标注不匹配

    更新于 2026年8月23日
  • #2811

    测试/ test flash attn.py 不使用 einops 收集失败

    更新于 2026年8月20日