为什么你的AI特工没有合理问题——它有一个记忆问题:生产-分级代理国的实用指南

2026年8月27日3 次浏览来源:Dev.to阅读原文

最初发表于tamiz.pro.

你花了数周时间调整你的系统 你尝试过思考链,ReAct, 和思考树的激励。

你已经把GPT-4o比作克洛德3.5 索内特和什么都没有点击。

你的经纪人仍然失去上下文,相互矛盾,感觉每一次用户回来,都开始新鲜.

这是令人不安的事实:你的经纪人没有推理问题.

有个记忆问题 现今的模型在上下文的窗口里 具有很强的推理能力 "智能"代理和"三转后断"代理之间的空隙几乎永远无法追溯到模型的逻辑能力.

它追溯到代理者所记忆的,如何记忆,以及记忆是否在从演示到制作的过渡中存活.

这是一个深入生产级代理状态——将原型与处理真实用户整个会话的系统区分开来的结构,模式和取舍. 1."理性神话"在我们解决记忆问题之前,让我们一劳永逸地消灭推理叙事.

B.

实际衡量的基准 当我们评价LLM推理时,我们正在测量一些狭义的东西:鉴于一组迅速而受约束的上下文符号,模型如何解决一个被定义的问题?

思考链文件,MATH基准,GPQA,LiveCode Bench——这些都是无国籍评价.

模型通过它看到问题,理由,并产生答案.

没有什么是持续的。

无所积集.

真正的代理工作根本不同.

一个代理在多个转弯,多个工具之间运行,信息传播逐渐到达.

推理挑战不是"模型能思考吗?"——这是"模型能思考它已经知道的事情,同时想出下一步要做什么".

无国籍模式 状态世界 考虑这个对话:用户(第1回):"我需要预订从SFO到NYC的一班航班,下周二买不到400美元".

代理:呼叫搜索工具 = 找到航班 = 返回结果 用户(第2个回合):"哪一个有最短的停留时间?" 代理:从先前的结果调用另一个工具或理由 用户(第3回合):"实际上,将目的地改为纽瓦克".

特工:...它知道最初的要求是什么? 3号回合,代理商需要将修改后的目标与先前的工具结果,中间结论,以及不同回合表达的用户偏好相调和.

这不是推理缺陷——即国家管理缺陷.

对于模型的推理能力,没有太多的即时工程可以解决这个问题.

信息根本就没有道理 为什么"只是给它更多的上下文"是行不通的,你可以把之前的每一个转折都扔入上下文窗口,并希望模型跟踪它.

这在生产中失败有三个原因: 上下文窗口昂贵.

你寄的每个信物都要花钱 用工具结果进行10个回合的对话,可以很容易地消耗15 000至50 000个信使。

在规模上,这是破产。

上下文窗口很吵 检索对话史上40K个符号,并不意味着模型会关注右侧40K个符号.

注意力机制在长期背景下不断减弱。

关键细节从第1回 埋葬。

背景窗口不会在会话中持续。

当用户明天回来时,上周的对话就消失了,除非你明确保存在某处,然后再次取回.

解决方案不是更大的窗口。

这是更好的记忆结构。

2.

国家特工实际上是国家特工,不是一件事情。

它是由几个不同但相互作用的地层组成的复合体.

混淆这些地层是大多数生产失败的根源. 2.1 工作记忆(Episodic) 驱动当前交互的短寿命,会话约束状态.

包括: 当前的目标和次级目标 工具称为历史(所谓的、返回的) 中间结论和计划 通常在上下文wi中进行

分享