#848·ART

TrainerRank MoE 内存接收: 后向重新计算 OOM 和配置校准失败

作者: bradhilton创建于 2026年9月4日更新于 2026年9月17日

**当前状态 — 2026 年 9 月 17 日: 未解决; Schulman 拥有后续工作。**GitHub 在 PR #907 合并时关闭了此问题。关闭事件标识了 #907,其范围是分布式错误传播,而不是内存估计。重新打开修复了该状态;一般入场问题仍未解决。PR #898 是当前的会计修正,位于 `04863263436b2d6977c171f059e8681636a6218d`。它涵盖了额外的保留激活/工作空间以及实际选择的适配器布局。最新的两个固定回退通过了测试,新的审查/CI 正在进行中。PR 仍保留在更改的入场行为上。合并 #899 在执行之前检查了入场预算是否仍然有效;合并 #900 使用物理可用内存和预算的缓存释放。这些解决了特定的缺陷,而不是一般的内存限制。剩余的证据:一个冻结的八序列向后工作负载的观察到的冷增量峰值比其估计高大约 8.03 GB。最近的运行完成了三个向后运行,但没有 OOM,但失败了原始梯度比较;这使用了一个较旧的冻结运行时,并不符合当前的 PR。活动通道是 (1) 在当前规划器代码上重复该工作负载, (2) 确定重新计算周围的保留张量,以及 (3) 在 #902 下调查重复梯度变化。所有完成的诊断 GPU 资源都被独立清理。一般向后安全性、接近上限的入场和代表性性能仍然未解决。最新的保留收据为 `/var/tmp/art848-warm-leaf-image-20260917-root/root-readout-acceptance.json` (`5b281455`), `/var/tmp/art898-fixture-contract-result-20260917-physical-wpe6ob97/manifest.json` (`7712f524`)。保留了详细的历史证据;其旧的待审批/采纳术语已被此状态取代。