#48718·transformers在 8x B200 上使用 run_clm.py 进行 Qwen3.5-9B 微调时,由于未安装 flash-linear-attention,因此在 fp32 torch 块循环中运行了带门的 DeltaNet 层作者: TarzanZhao创建于 2026年9月11日更新于 2026年9月17日系统信息 内容来源: huggingface/transformers查看 GitHub 原文在 GitHub 查看讨论