flash mla kernal是否支持同一batch下不同query的动态token数?
Author: echo-timelessCreated Jun 17, 2026Updated Jun 22, 2026
q: (batch_size, seq_len_q, num_heads_q, head_dim) flash mla算子的输入这个seq_len_q是定死的,那么是否不支持不同的seq_len_q进入kernal计算?
Source: deepseek-ai/FlashMLA
q: (batch_size, seq_len_q, num_heads_q, head_dim) flash mla算子的输入这个seq_len_q是定死的,那么是否不支持不同的seq_len_q进入kernal计算?
Source: deepseek-ai/FlashMLA