如何可能改进 JUKEBOX [不是问题]
这适用于任何想尝试制作类似Jukebox的东西的人。我注意到Jukebox的第一件事就是它在歌词中连贯,并生成了相当不错的歌曲。我还注意到,它看起来比生成的地方要回退大约24秒,就像是进行了预热,但它是从自己的数据中生成的。这使得神经网络面临一个问题,它无法正确创建歌曲的结构。它创建了第一个合唱部分,当它处于第二个合唱部分时,它只知道之前发生了什么24秒,这不是最优的,因为它在同一首歌中创建了不同的合唱部分。对此的一个可能解决方案是使用歌词中的预先制作的标签。[Verse],[Chorus],[pre-Chorus]等...您可以通过允许神经网络将4-6秒的韵词存储在其内存中,以及10-12秒的合唱部分,使用一种可以预测歌曲结构的方法,然后使用它所拥有的音频作为参考。另一个问题是速度,目前,在Google Colab上,每分钟大约需要1小时,速度很慢,因此无法用于博客中所述的交互式应用程序。一个解决方案可能是尝试优化神经网络或使用非常快的GPU,例如a100。我听说这款GPU可以在大约1小时内完全对3个样本进行上采样。这意味着生成底层的时间可能更短,因此可以降低到1-2小时。但目前,Tesla A100相当昂贵,并不适合很多人使用。另一个问题是这种神经网络的连贯性。是的,它非常灵活,并且由于其训练方式,可以说出它从未听说过的单词,但问题是所有模型都被不同地训练。例如,Ed Sheeran模型表现得非常好,但我没有获得Shawn Mendez模型或Ariana Grande模型的同样好结果。是的,结果仍然相当好,但并不那么好,这不是因为神经网络是Ed Sheeran的粉丝,而是因为这些模型只是基于更少、不同或复杂的信息进行训练,这是音乐的现实。要解决这个问题,您可以尝试使用大量歌曲来训练或微调自己的模型,并尝试更长时间地训练,直到您满意为止。请注意,我不是机器学习专家,我只是玩弄神经网络并试图玩得开心。我相信很多这些信息可能是错误或虚假的,如果是这样,请纠正我!
内容来源: openai/jukebox