#8969·server

在模型初始化失败后,TensorRT 后端会泄露 GPU 资源;卸载无法恢复内存

作者: lsj574创建于 2026年9月11日更新于 2026年9月11日

描述 在部分初始化后,TensorRT 模型加载失败时,GPU 内存会累积。显式卸载失败的模型不会释放保留的内存。成功的加载/卸载循环保持稳定,无需推理请求即可重现问题。

内容来源: triton-inference-server/server