在 B200 上训练 MiniMax-H3 LoRA 时,静默地降低注意力内核速度
作者: TarzanZhao创建于 2026年9月11日更新于 2026年9月11日
我在 8x B200 上运行了 repo 的 MiniMax-H3 LoRA 训练示例(`examples/minimax_h3/model_training/lora/MiniMax-H3-FL2VA.sh`, 第 2 阶段),按照安装 README 进行操作,每个训练步骤耗时 6.32 秒。一个配置文件显示了注意力运行在 FA2 内核上,这是一个 sm80 时代的设计,在该 GPU 上比 torch SDPA 的 cuDNN 后端慢得多。在切换内核后,同一步骤耗时 3.80 秒。日志中没有说明选择了哪种实现,因此我只通过配置文件才找到了。正如 @mi804 在 #1680 中指出的那样,设置 `DIFFSYNTH_ATTENTION_IMPLEMENTATION=torch` 可以避免此问题。在安装文档中的一行或在导入时选择的实现的一个行日志可以帮助我节省配置文件。
内容来源: modelscope/DiffSynth-Studio