关于 AMD Infinity Fabric P2P 带宽及其对训练的影响的问题
作者: wsj040303创建于 2026年8月24日更新于 2026年8月24日
从 ml-engineering-master\network\README.md 中可以看到,"其他内节点解决方案通常具有相同的全对全和对等内节点带宽,因此 Infinity Fabric 显得明显更慢。我想这可能是因为这些解决方案主要是为推理而设计的,因为这种低速度会明显地降低 LLM 的训练速度。"您为什么认为 AMD 更低的点对点带宽使其内节点互连更适合推理而非训练?您的结论有何依据?由于训练和多 GPU 推理都可能涉及频繁的 GPU 间通信,尤其是在张量并行情况下,我很想了解为什么更低的 P2P 带宽会更明显地影响训练,或者导致这种区分。您的结论是否得到了特定的基准测试、工作负载特征或特定的并行化策略的支持?
内容来源: stas00/ml-engineering