在新 pod 创建后, L40S 节点上的随机延迟回归 – 节点持续"不良"
作者: dengroc创建于 2026年8月31日更新于 2026年9月11日
标签performance
描述
我们在 AWS g6e 实例(NVIDIA L40S)上使用 Triton 服务了多个 Ads GPU 模型,每个节点有一个 Triton pod。我们发现了一个随机模式,其中一个 pod 调度到一个节点后,其延迟达到 100+ 毫秒(与健康基准值 30 毫秒相比)且永远无法恢复。该节点本身似乎变得“糟糕” — 同一节点上的替换 pod 也出现了相同的延迟,但该节点在某个早期 pod 切换之前是健康的。目前,我们唯一的补救措施是排空和替换该节点。
内容来源: triton-inference-server/server