问题:在进行基准测试之前,可以预测大规模扩展行为的程度有多大?
作者: alexbuiko-sketch创建于 2026年9月11日更新于 2026年9月11日
问题:在在目标 GPU 规模运行之前,可以预测多少扩展行为?我对与大规模推理/训练基础设施相关的更广泛的性能工程问题感兴趣。假设我们已经知道相关的工作负载特征:模型架构、并行性、批量大小、序列特征、硬件配置和网络拓扑。对于可能从 512 → 1024 → 2048 → 4096 个 GPU 扩展的部署:我们在实际分配和在目标规模运行之前,理想情况下能够预测多少扩展曲线?我不是在问具体的吞吐量。更有趣的问题是,我们是否能够预测:大致的扩展效率范围;扩展曲线可能会发展出一个肘;哪个瓶颈可能占主导地位;以及,因此,哪些 GPU 数量实际上值得进行基准测试。当前的实际工作流程通常似乎是:运行 → 测量 → 校准 → 推断 → 再次运行。这行之有效,但产生了一个有趣的不对称性:我们要评估的规模也可能是在较小规模校准的假设不再成立的规模。我正在探索一个在运行之前进行分析的方法,该方法的输出并不是一个精确的预测。相反,它将提供:预期的效率范围 + 可能的扩展肘 + 主要的瓶颈 + 最小的有用验证点。目标不是取代基准测试。目标是使基准测试本身更加智能。从 TensorRT-LLM/NVIDIA 性能架构的角度来看:你认为在实证校准变得根本不可避免之前,可以在分析上推进多远?我特别关注在工作负载/系统参数可以被模拟的效应与只在工作负载实际在规模运行时可见的效应之间的界限在哪里。即使是一个简短的维护者观点也会非常有用。
内容来源: NVIDIA/TensorRT