#200·vits

添加新演讲者时出现问题

作者: JoanisTriandafilidi创建于 2023年12月18日更新于 2025年9月11日

你好!感谢你的出色工作!我在各种个人小项目中积极使用 Vits,我有一个与在多音箱模型中添加新音箱相关的想法。我的想法的核心是: 1. 我训练了一个适用于 200 个音箱的高质量多音箱模型。 2. 我使用 Speakernet 获得了一个合适格式的新音箱嵌入。 3. 我想通过添加一个新嵌入将新音箱添加到现有的多音箱模型中。也就是说,emb_g.shape 为 [200, 192],但将变为 [201, 192]。我正在将新的嵌入添加到 utils.load_checkpoint 函数中。 模型加载没有问题 - 但在推理时,而不是预期的新 (!) 语音,我得到的是 200 个已训练的语音中的一个。此外,如果我将其他嵌入应用于输入,我将从这些 200 个中得到其他语音。因此,我可以得出结论,模型有可能为人工添加的音箱生成语音。但我无法让语音与目标相匹配。 请告诉我我如何解决这个问题?为什么当模型看到一个新嵌入时,它会生成一个不同的语音?

内容来源: jaywalnut310/vits