#190·FlashMLA

flash mla kernal 是否支持同一批中不同查询的动态 token 数量?

作者: echo-timeless创建于 2026年6月17日更新于 2026年6月22日

问: (batch_size, seq_len_q, num_heads_q, head_dim) 这个 seq_len_q 是固定的, 那么是否不支持不同的 seq_len_q 进入内核计算?

内容来源: deepseek-ai/FlashMLA