FlashMLA · Issues· 128 开放
在 GitHub 打开本地同步的开放议题(评论请到 GitHub 查看)
- #220
[可移植性][MSVC] SM90 设备 lambda 上的 GNU always_inline 属性无法编译
更新于 2026年9月6日 - #218
[可移植性][MSVC] 在密集 MLA 解码中替换复合字面式依赖类型初始化
更新于 2026年8月30日 - #217
[可移植性][MSVC] 在共享内存加载/存储路径中替换 __int128_t 3
更新于 2026年8月30日 - #212
稀疏 MLA 解码不是批量不变的: 行的输出取决于其批量成员 (1-2 ULP), 在接近相等的标记处会翻转 argmax
更新于 2026年8月21日 - #211
PyBind11 接口: 如何处理已注册内核的函数签名和 CUDA 错误处理?
更新于 2026年8月18日 - #210
10轮手写的融合注意力,从未击败过3个内核的cuBLAS堆栈 - 其中每一轮都失败,并且存在正确性陷阱
更新于 2026年8月7日 - #206
DeepSeek-Coder-V2-Lite-Instruct 16B 在搭载 RTX 2050 的笔记本电脑上本地运行
更新于 2026年8月3日 - #204
flashmla 密集解码测试缺少 fp8 kv 缓存案例
更新于 2026年8月3日 - #169
双 GEMM
更新于 2026年7月13日 - #172
使用 `pyproject.toml`
更新于 2026年7月9日 - #192
稀疏 MLA 解码 (V3.2 / FP8 KV): B200 精度修复 (5aa668c) 的吞吐量成本与 topk 成正比
更新于 2026年6月26日 - #190
flash mla kernal 是否支持同一批中不同查询的动态 token 数量?
更新于 2026年6月22日 - #179
您是否开放添加 SM80 支持
更新于 2026年6月15日 - #66
Ampere 架构 FlashMLA 启动
更新于 2026年6月1日 - #180
将 FlashMLA 变为 libtorch 和 cpython 的稳定扩展
更新于 2026年4月27日