flash mla kernal 是否支持同一批中不同查询的动态 token 数量?
作者: echo-timeless创建于 2026年6月17日更新于 2026年6月22日
问: (batch_size, seq_len_q, num_heads_q, head_dim) 这个 seq_len_q 是固定的, 那么是否不支持不同的 seq_len_q 进入内核计算?
内容来源: deepseek-ai/FlashMLA
问: (batch_size, seq_len_q, num_heads_q, head_dim) 这个 seq_len_q 是固定的, 那么是否不支持不同的 seq_len_q 进入内核计算?
内容来源: deepseek-ai/FlashMLA