#16249·Speech

MagpieTTS 原始音频填充会在精确多长度的音频中添加一个无用的静音帧

作者: udsy19创建于 2026年9月13日更新于 2026年9月15日
标签community-requestwaiting-on-maintainers

描述错误

MagpieTTSDataset.__getitem__MagpieTTSLhotseDataset 的原始音频分支将音频加载到 codec_model_samples_per_frame 的一个整数倍,使用以下代码:

python
audio = torch.nn.functional.pad(
    audio,
    (0, self.codec_model_samples_per_frame - (audio.shape[0] % self.codec_model_samples_per_frame)),
    value=0,
)

audio.shape[0] 已经是 codec_model_samples_per_frame 的一个整数倍时,模数为 0,并且填充量变为 codec_model_samples_per_frame 本身,而不是 0 - 会在训练目标音频中添加一个完整的无用静音帧。

内容来源: NVIDIA-NeMo/Speech