[功能]: ThunderAgent 共享前缀计费: 显式额度的 GPU A/B/C 结果
作者: JasperChan929创建于 2026年9月19日更新于 2026年9月21日
标签enhancementlanguage::pythondynamo-runtimedynamo-llmbackend::vllmperformancepythonFeature
在测试的 调度器源代码 中,_replica_usage_locked() 为每个 ACTIVE 程序添加其令牌总量加上一个程序缓冲区。因此,多个程序共享的精确前缀会被重复计费,即使后端重复使用它。容量发现 和后端的物理占用率信号具有不同的语义;本报告不会仅从明显未使用的 GPU 内存中推断浪费。前一个未变更调度器试验涵盖了 0/50/90% 共享和 2/4/8/16/32 个程序:在测试的 2-16 级别中没有暂停,但 32 个程序的级别最初在每个共享级别中允许 28 个程序。精确的令牌前缀检查和后端缓存命中确认了重复使用。这确立了帐务/并发性问题;它并未确立重复数据优化。下面的 A/B/C 结果是随后的受控比较,而不是通过不同的共享工作负载计算的速度提升。
内容来源: ai-dynamo/dynamo