"KV Cache" 与 "Prompt Cache" 的术语口径问题

Author: EndlessYUNCreated Sep 7, 2026Updated Sep 7, 2026

现象

  • §2.3.3 明确界定:KV Cache 是模型内部优化,"在一次推理过程中缓存已计算 token 的键值对";Prompt Cache 是 API 服务层优化,"跨多次 API 请求间缓存相同前缀的计算结果"。
  • 但图2-10 中,请求 1 与请求 2 是两个独立的 API 请求,二者共享 "System Prompt + Tools" 前缀,图内却用箭头标注为 "KV 复用",且标题为 "KV Cache 前缀复用机制"

问题:按 §2.3.3 的定义,跨请求的前缀复用应归属于 Prompt Cache;图2-10 却把这一跨请求行为标注为 KV Cache / KV 复用。同一本书内术语口径不一致,读者依据图2-10 会误以为 KV Cache 的生命周期是跨请求的,与 §2.3.3(以及直观理解:KV Cache 生命周期 = 单次推理请求)相冲突。

建议: 我的理解是 KV Cache 生命周期为单次推理请求(prefill 阶段生成 K、V,decode 阶段逐 token 复用);跨请求的前缀复用属于 Prompt Cache。图2-10 若按此理解,跨请求复用的那一段应为 Prompt Cache 而非 KV Cache。烦请指正是否理解有误。