百科.dev
全部条目AI 编程趋势榜开源项目技术资讯提交条目
登录
返回工具页/返回 Issues 列表
#26109·ultralytics

在 YOLO 训练过程中出现随机 SIGSEGV (退出代码 139) 和偶尔的系统完全冻结

作者: CDYoungWait创建于 2026年9月9日更新于 2026年9月9日
标签questionOBBpriority: hightriage

问前搜索

  • 我搜索了超解YOLO[发 (https://GitHub.com/ultralytics/ issues)和讨论,没有发现类似的问题.

问题

Random SIGSEGV(出站码为139),CUDA出错,在YOLOv8 OBB对RTX 5090进行训练时偶尔会出现完整的系统冻结.

□ 总结

在Linux的NVIDIA GeForce RTX 5090上训练一个YOLOv8 OBB模型,

培训过程有时以下列方式终止:

页:1 进程以出站码139(被信号11中断:SIGSEGV)完成.


我还观察到一种更严重的故障模式,即整个图形桌面变得无响应,SSH连接到机器停止工作,训练被中断. 可能需要重启以恢复该系统。

坠机并不总是在同一个时代或批次发生.

在最新的诊断运行中,这个过程并没有立即以SIGSEGV终止. 相反,它遇到了几个CUDA出自记忆的错误,自动多次缩小了批量大小,最后以:

页:1
火把来. 加速器 Error: CUDA 错误:未知错误

Systemd已经单独记录了多个先前用SIGSEGV终止的Python进程.

□ 预期行为

YOLO训练应正常完成.

如果GPU内存不足,我会期待一个可回收的'torch.cuda. 除了有用的回溯之外,在记忆错误或另一个Python之外。 Python进程不应以SIGSEGV来终止,而整个桌面和SSH服务也不应该失去响应.

□ 实际行为

我观察到两种失败模式。

失败模式1:本地 Python进程崩溃

进程退出时没有普通的Python回溯:

页:1 进程以出站码139(被信号11中断:SIGSEGV)完成.


运行之间的时间段不一致。

失败模式2:完成系统冻结

在一些运行中:

- 图形桌面完全没有反应。
- SSH连接机器停止工作。
- YOLO训练停止了
- 机器可能需要强制重启


□再现.

培训采用超解析法的局部取出.

从YOLO检查站恢复运行。 相应的公共API操作是:

```7ZZ
从超解析器导入 YOLO

型号=YOLO ("跑道/obb/train-9/重量/last.pt").
model.train( resume=True) (英语).

从检查站恢复的完整配置概述如下。

恢复操作被正确识别:

页:1 从147个世纪到150个世纪恢复培训 关闭数据加载器镶嵌


失败不是决定性的,可能需要持续的培训才能再生.

□ 训练配置

- 任务:定向取出 " 保险箱 " 探测
- 型号:YOLOv8l-obb
- 模型参数:44 484 072
- 可训练梯度:44 484 056
- 班级数:7个
- 目标时代:
. . . . . . .

内容来源: ultralytics/ultralytics

查看 GitHub 原文在 GitHub 查看讨论