#902·ART

调查匹配的同源 Qwen TrainerRank 角色之间的输出和梯度变化

作者: bradhilton创建于 2026年9月15日更新于 2026年9月17日

**9月17日后续: 同一代码块的可重复性仍未解决。** 使用8个序列、3个后向诊断的冻结版本再次完成了没有OOM的操作,但未通过原始比较:33个梯度张量未通过冷到热,40个未通过热到热。原始退出代码为1。严格的离线读取成功并保留了失败的科学结果;所有4个拥有的Kubernetes资源和本地进程组都被独立清理。 我们观察到了在两次热通道中,一个参数的输入和累积梯度。其参数值保持一致。在每个通道中,输入和累积梯度均字节对字节相等;在通道之间,4096个元素中有3300个发生了变化。然而,该参数(索引4,层0输出投影LoRA A) **通过了** 原始容忍度:最大容忍度比例为0.28871,相对L2为0.005226。这将变化局限在该叶子上,其输入贡献;它不能解释其他失败的梯度或证明全局累积/内核原因。阻塞的CPU快照可能会干扰执行。 下一个受限诊断目标是索引182,层11查询投影LoRA A,在三次保留运行中未通过热到热标准。它将保持完整的660梯度检查和原始容忍度不变,每个向量有4 KiB的快照。当前工作是源/CPU验证;没有隐含的本地成功。 证据: `/var/tmp/art848-warm-leaf-image-20260917-root/root-readout-acceptance.json` (`5b281455`); 详细的向量分析 `/var/tmp/art848-warm-leaf-readout-source-20260917-forward-jy5folvo/leaf-analysis.json`; 目标选择 `/var/tmp/art848-warm-leaf-next-target-20260917-forward-suzvu5vm/manifest.json` (`944f30fc`)。这使用了一个较旧的冻结运行时,而不是当前的 #898 头。跨运行状态对齐和与 #901 的共同原因尚未得到证明。