#156·DAIN

尝试训练或过度训练模型时出现分段错误 (核心已转储)

作者: Adodiego创建于 2023年5月22日更新于 2024年1月16日

你好,我正在尝试使用 train.py 函数来使用自己的数据库训练 RIFE 模型。一切都很顺利,直到最后一个 epoch,它给我了一个"Segmentation fault (core dumped)"的错误。我使用了 --nproc_per_node=1 和 --world_size=1,所以可能这就是问题所在?无论我使用多少 epoch,它在最后一个 epoch 都会出现这个错误。此外,通过这样启动代码: sudo -E /usr/bin/python3 -m torch.distributed.launch --nproc_per_node=1 train.py --epoch=1 --world_size=1,错误变成了简单的"Segmentation fault",没有"(core dumped)"部分。你有什么想法吗?为什么会出现这个问题?