最初发表于tamiz.pro.
在出品中你见过:AI代理自信地虚构出不存在的银行余额,发明出一个不真实的文件路径,或者声称一个功能在默默失败时成功.
这些不是用户错误或不良的提示——它们是在复杂循环中工作,自我解释的语言模型的自然输出.
这不仅仅是口号意义上的"吸血问题".
它是一个结构工程的失败, 如何代理观察, 理性,和发挥自己的产出。
核心问题是,今天的主导代理架构——ReAct round(Reason + Act)——要求一个无国籍的LLM同时思考一个问题,调用工具,观察结果,并修正其精神模型,所有这一切都在一个单流上下文窗口内.
该模型在转弯之间没有地面真理锚.
它过去的行动只是其背景的文字象征。
它无法证实它所说的是否真的发生了。
这就是为什么代理人以惊人的一致性欺骗自己。
了解代理人自欺欺人的力学是建立实际有效的防御的前提.
我们到车盖下去 为什么特工们会幻化:自欺欺人的结构 在根本层面,代理人对自己先前行动的"记忆"不过是上下文缓冲中的象征.
当代理调用和工具返回时,动作和观察都被编码为文本.
下一转,模型读取这些符号,产生出它的下一个想法.
没有单独的、经核实的行刑线索。
该模型很容易误读自己的观察,将其与先前的观察相混淆,或者完全捏造出一个新的观察.
这在长距离任务中特别危险,因为上下文窗口长到上千个符号.
模型自身前作的信号与噪声之比急剧下降.
经验研究表明,幻觉率从单回转工具使用的~5%上升到了多回转剂循环超过10步的20-40%.
行动观察 在一个设计良好的体系中,一项行动在世界上产生可观察到的效果,而这种观察就是基于这种效果。
在标准的ReAct代理中,这种接合纯粹是文字上的.
模型生成类似 .
的动作字符串,运行时间执行,结果被附加到上下文中.
但模型本身与执行没有因果关系.
它不知道文件是被读取的——它只看到跟随自己标志的文字.
当工具响应是大,吵或者模棱两可时,模型常常进行解释性重建:它总结,解释,甚至发明它认为反应应该说的话,而不是忠实地代表实际输出.
这在模型的训练中不是一个错误——这是自相递进生成试图将高维现实压缩为低维文本的固有属性.
信心幻觉LLMS被优化为流利和可信,而非真实.
它们的丢失函数奖励产生下一个使序列一致的信号,而不是下一个事实准确的信号.
当一个代理通过多个推理步骤被按下时,置信会复合.
一个从轻而易举地误读开始的模型将产生出越来越有自信(但越来越错误)的后继思想,因为每个新符号都以之前有缺陷的推理为条件.
这创造了回馈回回路:当代理在其周围产生出更多的文本时,其不正确的模式变得更加确定.
推理的链条越长,代理者自我矫正就越困难——不是因为它缺乏能力,而是因为上下文被自己的权威声音所支配而被捏造出痕迹.
沙盒相隔:封存"爆破"半径相隔板"并不妨碍一剂撒谎——可以防止谎言造成损害.
主要见解是建筑分离:隔离特工的行刑