FlashAttention 训练不稳定
作者: yash98创建于 2025年11月11日更新于 2026年2月21日
标签help wanted
检查
- 此模板仅针对错误报告, 使用问题与“ 帮助通缉犯” 有关 。
- 我彻底审查了项目文件 但找不到信息来解决我的问题。
- 我搜索了现有的问题, 包括关闭的问题, 找不到解决办法。
- 我用英语来提交这个问题以促进社区交流。
环境细节
在 Docker 容器中运行 - ghcr.io/swivid/f5-ts:主 我在8xH200开机
- 重现步骤
- 设置培训配置并加速配置如下:
- 开始Docker和开始培训脚本的步骤与Repo README中提及的相同
- 仅就Emilia的英语子集开展培训,在损失159克之后的第二纪元/开始增加。 `加速发射-混合-精度= bf16 src/f5 tts/train/train.py -- config-name F5TTS v1 Base.yaml' (英语).
F5TTS v1 Base.yaml (英语).
湿道:
运行 :
dir: ckpts/${model.name}{model.mel spec type}{model.tokenizer}{${datasets.name}/${现在:%Y-%m-%d}/${现在:%H-%M-%S}
数据集 :
名称: Emilia EN full # 数据集名称
批量 大小 per gpu:57600#75/50*38400#7GPU,7 *57600=403200
批量 大小 类型: 帧 # 帧 # 样本
最大 样本: 每批64 # 最大序列, 如果使用框式的分批 大小 。 我们为小型模型设定了32个,为基础模型设定了64个
工作人数: 16
优化 :
时代:11
学习率: 7.5e-5
num warmup updates: 20000 # 热身更新
分级 累积 步: 1# 注:更新=分级/分级 累积 步:
最大值 grad 规范: 1.0 # 梯度剪接
bnb 优化器: False # 是否使用 bnb 8bit AdamW 优化器
模式 :
名称: F5TTS v1 基数 # 型号名称
符号化器: Char # 符号化器类型
指示器 path: 无效 # 如果“ custom” 指示器, 定义要使用的路径( 应该是 vocab. txt)
干线: 二T
拱门 :
平地:1024个
深度: 22
头:16个
ff 穆尔特: 2
文本( D): 512
文本( mask: true)
qk norm: 无效 # # 无效 rms norm
倾角( H): 4
pie attn head: 无效
atn 后端: flash attn # 火炬 #QQ flash attn
atn mask 启用:虚假
检查站 激活: False # 重算激活并保存内存用于额外计算
mel spect : (中文(简体) ).
目标( sample rate): 24000
n mel 频道: 100
hop 长度: 256
中长: 1024
nfft: 1024 (中文(简体) ).
mel spec type:vocos #vocos QQ Bigvgan (中文(简体) ).
发热器 :
本地: False # 是否使用本地下线 cpt
本地路径: 无效 # 本地vocoder 路径
语句 :
日志:魔杖 #魔杖 # # 高压板 # # # 无效
logger run name: ${model.name}{model.mel spec.mel spec type}}{model.tokenizer}}{${datasets.name}。
log samples: True # 推断每个保存检查站的随机样本. wip, 正常情况下会因额外的长样本而失败
保存 per updates: 50 000 # 每次更新都保存检查点
保留 last n 检查点: 30 # - 1 保存全部, 0 保存中间点, > 0 保存最后一个 N 检查点
last per updates: 5000 # 每个更新保存最后一个检查点
保存( D) :
. . . . . . .内容来源: SWivid/F5-TTS