多节点 GPU 训练问题: 对端连接被重置

作者: perry0418创建于 2019年1月2日更新于 2023年9月12日
标签enhancementhelp wantedcontributions welcome

❓ 问题和帮助

我按照仓库的示例进行了操作,在同一台机器上进行单 GPU 训练和多 GPU 训练都没有问题。但是,当我尝试使用两台机器通过两个节点进行训练时,就会出现以下问题:

追踪(最近一次调用): 文件 "./tools/train_net.py",第 177 行,在 中 文件 "./tools/train_net.py",第 177 行,在 中 main() 文件 "./tools/train_net.py",第 146 行,在 main 中 main() 文件 "./tools/train_net.py",第 146 行,在 main 中 backend="nccl", init_method="env://" 文件 "/home/ubuntu/anaconda3/envs/pytorch1.0/lib/python3.6/site-packages/torch/distributed/deprecated/init.py",第 101 行,在 init_process_group 中 backend="nccl", init_method="env://" 文件 "/home/ubuntu/anaconda3/envs/pytorch1.0/lib/python3.6/site-packages/torch/distributed/deprecated/init.py",第 101 行,在 init_process_group 中 group_name, rank) RuntimeError: Connection reset by peer at /opt/conda/conda-bld/pytorch-nightly_1542100572345/work/torch/lib/THD/process_group/General.cpp:20 group_name, rank) RuntimeError: Connection reset by peer at /opt/conda/conda-bld/pytorch-nightly_1542100572345/work/torch/lib/THD/process_group/General.cpp:20

内容来源: facebookresearch/maskrcnn-benchmark