MagpieTTS 原始音频填充会在精确多长度的音频中添加一个无用的静音帧
作者: udsy19创建于 2026年9月13日更新于 2026年9月15日
标签community-requestwaiting-on-maintainers
描述错误
MagpieTTSDataset.__getitem__ 和 MagpieTTSLhotseDataset 的原始音频分支将音频加载到 codec_model_samples_per_frame 的一个整数倍,使用以下代码:
audio = torch.nn.functional.pad(
audio,
(0, self.codec_model_samples_per_frame - (audio.shape[0] % self.codec_model_samples_per_frame)),
value=0,
)当 audio.shape[0] 已经是 codec_model_samples_per_frame 的一个整数倍时,模数为 0,并且填充量变为 codec_model_samples_per_frame 本身,而不是 0 - 会在训练目标音频中添加一个完整的无用静音帧。
内容来源: NVIDIA-NeMo/Speech