在 YOLO 训练过程中出现随机 SIGSEGV (退出代码 139) 和偶尔的系统完全冻结
作者: CDYoungWait创建于 2026年9月9日更新于 2026年9月9日
标签questionOBBpriority: hightriage
问前搜索
- 我搜索了超解YOLO[发 (https://GitHub.com/ultralytics/ issues)和讨论,没有发现类似的问题.
问题
Random SIGSEGV(出站码为139),CUDA出错,在YOLOv8 OBB对RTX 5090进行训练时偶尔会出现完整的系统冻结.
□ 总结
在Linux的NVIDIA GeForce RTX 5090上训练一个YOLOv8 OBB模型,
培训过程有时以下列方式终止:
页:1 进程以出站码139(被信号11中断:SIGSEGV)完成.
我还观察到一种更严重的故障模式,即整个图形桌面变得无响应,SSH连接到机器停止工作,训练被中断. 可能需要重启以恢复该系统。
坠机并不总是在同一个时代或批次发生.
在最新的诊断运行中,这个过程并没有立即以SIGSEGV终止. 相反,它遇到了几个CUDA出自记忆的错误,自动多次缩小了批量大小,最后以:
页:1
火把来. 加速器 Error: CUDA 错误:未知错误
Systemd已经单独记录了多个先前用SIGSEGV终止的Python进程.
□ 预期行为
YOLO训练应正常完成.
如果GPU内存不足,我会期待一个可回收的'torch.cuda. 除了有用的回溯之外,在记忆错误或另一个Python之外。 Python进程不应以SIGSEGV来终止,而整个桌面和SSH服务也不应该失去响应.
□ 实际行为
我观察到两种失败模式。
失败模式1:本地 Python进程崩溃
进程退出时没有普通的Python回溯:
页:1 进程以出站码139(被信号11中断:SIGSEGV)完成.
运行之间的时间段不一致。
失败模式2:完成系统冻结
在一些运行中:
- 图形桌面完全没有反应。
- SSH连接机器停止工作。
- YOLO训练停止了
- 机器可能需要强制重启
□再现.
培训采用超解析法的局部取出.
从YOLO检查站恢复运行。 相应的公共API操作是:
```7ZZ
从超解析器导入 YOLO
型号=YOLO ("跑道/obb/train-9/重量/last.pt").
model.train( resume=True) (英语).
从检查站恢复的完整配置概述如下。
恢复操作被正确识别:
页:1 从147个世纪到150个世纪恢复培训 关闭数据加载器镶嵌
失败不是决定性的,可能需要持续的培训才能再生.
□ 训练配置
- 任务:定向取出 " 保险箱 " 探测
- 型号:YOLOv8l-obb
- 模型参数:44 484 072
- 可训练梯度:44 484 056
- 班级数:7个
- 目标时代:
. . . . . . .
内容来源: ultralytics/ultralytics