百科.dev
全部条目AI 编程趋势榜开源项目技术资讯提交条目
登录
返回工具页

FlashMLA · Issues· 128 开放

在 GitHub 打开

本地同步的开放议题(评论请到 GitHub 查看)

  • #220

    [可移植性][MSVC] SM90 设备 lambda 上的 GNU always_inline 属性无法编译

    更新于 2026年9月6日
  • #218

    [可移植性][MSVC] 在密集 MLA 解码中替换复合字面式依赖类型初始化

    更新于 2026年8月30日
  • #217

    [可移植性][MSVC] 在共享内存加载/存储路径中替换 __int128_t 3

    更新于 2026年8月30日
  • #212

    稀疏 MLA 解码不是批量不变的: 行的输出取决于其批量成员 (1-2 ULP), 在接近相等的标记处会翻转 argmax

    更新于 2026年8月21日
  • #211

    PyBind11 接口: 如何处理已注册内核的函数签名和 CUDA 错误处理?

    更新于 2026年8月18日
  • #210

    10轮手写的融合注意力,从未击败过3个内核的cuBLAS堆栈 - 其中每一轮都失败,并且存在正确性陷阱

    更新于 2026年8月7日
  • #206

    DeepSeek-Coder-V2-Lite-Instruct 16B 在搭载 RTX 2050 的笔记本电脑上本地运行

    更新于 2026年8月3日
  • #204

    flashmla 密集解码测试缺少 fp8 kv 缓存案例

    更新于 2026年8月3日
  • #169

    双 GEMM

    更新于 2026年7月13日
  • #172

    使用 `pyproject.toml`

    更新于 2026年7月9日
  • #192

    稀疏 MLA 解码 (V3.2 / FP8 KV): B200 精度修复 (5aa668c) 的吞吐量成本与 topk 成正比

    更新于 2026年6月26日
  • #190

    flash mla kernal 是否支持同一批中不同查询的动态 token 数量?

    更新于 2026年6月22日
  • #179

    您是否开放添加 SM80 支持

    更新于 2026年6月15日
  • #66

    Ampere 架构 FlashMLA 启动

    更新于 2026年6月1日
  • #180

    将 FlashMLA 变为 libtorch 和 cpython 的稳定扩展

    更新于 2026年4月27日