当一个聊天机器人产生幻觉时,一个人会读出答案并抓住它.
当一个特工出现幻觉时,它可能已经运行了查询,发送了电子邮件,或者在任何人出现前更改了配置.
唯一的区别在于为什么代理安全是其自身的学科,而不是应用安全的一个小节,也是为什么OWASP在2025年12月为代理应用运送了专用的Top 10,而不是将问题叠入现有的LLM列表.
我找过的大多数球队 并不因为意见不同而错过这个机会 他们错过了,因为安全工作 在计划中从来没有一行。
代理运出,它起作用了, 第一天随同它的进入模型仍然是第九十天的进入模型.
允许窃取真实攻击表面 实际发生的事件是无聊的。
一个特工是用来总结文档的 两次冲刺之后有人需要它来写一个摘要文件,所以它可以获得写出权限.
然后它需要张贴摘要,从而获得API的代币.
没有人坐下来批准一个带有文件系统和网络写入访问的文档摘要,但这就是现在存在的情况,而且由于没有任何故障,访问模式从未被重新审视.
最少的特权很容易同意,也无趣地维持,这正是它失败的原因.
有用的版本是一个规则而不是原则:每个代理从零权限开始,每一个添加的能力都会触发整个权限集的重读,而不是附加到其中.
间接快速注射将数据输入指令 即时注射仍然是OWASP对LLM应用的头号风险,在代理语境下它会变得更严重,因为支付不再是一个误导性的答案,而是一种真正的行动.
直接的版本,一个用户键入一些可以推翻系统提示的东西,是每个人测试的版本.
得到人的版本是间接的:恶意指示坐落在网页,支持票,PDF或数据库行中,被代理人告知去阅读.
代理人无法区分被要求处理的内容和被要求执行的指示,因此遵循了这些指示.
这就是为什么许可和注射是同一个问题而不是两个问题。
只能看书的经纪人是糟糕的一天.
能够读取被毒害的一页然后采取行动的特工就是一桩事件.
在深度内为特工辩护 法案中没有任何单一的控制是足够的,所以有用的模式是层层独立失效: 范围工具,而不仅仅是数据。
具有只能发送到内部地址的"发送电子邮件"工具的代理是不同于持有普通SMTP证书的代理风险简介.
把人放在短名单前.
超过阈值的金融交易,生产基础设施的改变,对外通讯,以及访问控制的变化,都应当需要批准,批准屏幕应当显示代理商在拟议行动旁边的推理,因此人正在决定而不是橡皮戳.
特工之间验证.
在一个多代理管道中,彼此信任对方信息的代理商,而不检查它们,就把一个被破坏的步子变成了十个糟糕的输出.
看着决定,不只是错误 大多数特工监控都算失败 更有用的信号是代理商选择做什么的分布,因为工具被调用时的缓慢漂移是成功注射的外观.
选择一个已经投入生产的代理商, 写下它持有的每一个许可, 在大多数团队中,文件尚不存在,制作文件通常足以找到至少一种没有人记得授予的能力。
从那里,起作用的顺序是:撤销不需要的,将批准置于你永远不希望做错的动作前,并添加记录工具调用而非仅记录失败的日志.
全面细分,包括威胁类别、治理方面和遵约情况