最初发表于tamiz.pro.
1.
导言:记忆伪循环AI代理内存已成为供应商区分的最新战场。
无论是评价矢量数据库,LLM应用的长期内存模块,还是完整的认知架构,营销主张都惊人地一致:"无限上下文","完美回想"和"零延迟".
实际上,这些索赔在实际工作量的重压下崩溃了。
这篇文章深入了如何严格和再生地衡量AI内存系统的基准.
我们将超越合成的README基准,并建立一个测试方法,来展示你生产时实际面临的取舍。
重点是代理内存——允许对话代理记起之前的交互作用,用户偏好,以及长期事实的系统——但这些原则适用于任何被检索或上下文窗口扩展系统.
2.
什么是"记忆特工"?
在设定基准之前,我们必须澄清AI剂常用的记忆系统的分类.
这使得我们无法将苹果与橙相提并论. 2.1 短期与长期记忆短期记忆(STM)是LLM的上下文窗口.
它不稳定,受到象征性计算的限制,而且线性延伸成本很高。
长期内存(LTM)是代理商查询以扩充上下文的外置存储器(vector数据库,知识图,或关系存储器). 2.2 内存结构 结构描述 典型的 Latecy 失败模式矢量存储 + Retrievable Embed 文档; 以相弦相近性 10–100 ms 语义漂移取出上-k; 检索 经常摘要 将旧上下文归纳为压缩状态 50–500 ms 信息损失, 幻觉注入结构化 Slot 内存实体/属性入数据库表 5–50 ms Schema 错配, 丢失的插槽 神经记忆( 如 MemGPT) 具有读取/写取头的可训练内存模块 10-100 ms 灾难遗忘,训练不稳定 强健的基准必须评价整个系统——不仅仅是检索部分,而是记忆是如何被写入、检索和融入代理商推理循环的。
3.
基准哲学:信号高于噪音 大多数公共基准是销售文物。
它们使用: 拼写式的三重询问(保证高额召回).
适合RAM的小蝎子,忽略了I/O模式.
没有写耐用度测量,忽略了更新内存的成本.
没有降解测试,忽略了随着内存增长的性能变化.
我们的理念基于生产现实主义:衡量端到端的代理任务,而不仅仅是检索准确性.
规模测试:内存库应发展到上百万项,模拟代理互动月.
孤立变量:改变一个组件(如嵌入模型),同时保持其余不变.
报告分布,不是平均值:耐久性和准确性有长尾.
4.
设计基准套件 我们将设计一个模块化的基准套件,称为"记忆奔驰",可以应用于任何代理存储系统.
该套装由4个核心任务组成: 4.1 任务1:事实召回目标:测量系统从长期记忆中取回具体事实的能力.
数据集:由1M"用户事实"组成的合成体(如"用户更喜欢巴黎的素食餐厅").
查询集:一万个多种自然语言查询.
度量衡: recall@k:正确的事实是否出现在取回的上-k块中?
MRR (Mean recoprocal Rank):正确事实排名有多高?.
Latency P95:第九十五百分位检索时间. 4.2 任务2:时间原因:评价记忆系统处理时间敏感信息的情况。
数据集:一流被时间戳的事件(如"用户2024-05-10预订了飞往东京的航班").
腾讯:"用户最近的目的地是什么? "用户有没有去过巴西?" 量子:时间精确度:时间答案的正确性.
停滞惩罚:当出现更新的数据时,系统是否返回已过时的信息?