#5330·casdoor

[功能] 支持对 LLM 代理的渗透测试

作者: hsluoyz创建于 2026年3月26日更新于 2026年9月14日
标签enhancement

随着终端 AI 代理从对话工具演变为具有自主执行能力的超级助手,安全模式发生了根本性转变。GUI 代理不仅可以生成内容,还可以在各个系统中自主规划、决策和执行。虽然这种高度的自主性提高了效率,但也集中了风险 — 一旦失控,就可能直接导致数据泄露、财务损失甚至物理系统损坏。传统的安全措施(如权限隔离、沙箱化、身份认证和安全通信协议)可以提供基线保护,但难以应对 AI 代理中固有的威胁,包括提示注入、上下文污染、多模态对抗攻击、长期记忆毒化和合规应用在自主执行过程中引起的隐私泄露。这些攻击的本质是上下文混淆和上下文污染,其根源在于 AI 代理的一个核心漏洞:上下文边界模糊。模型无法可靠地区分、验证或隔离不同可信程度的指令和数据 — 指令和外部内容被扁平化并混合在上下文窗口中,从而打破了传统程序中存在的代码和数据之间的严格边界。为此,本研究针对自主 AI 代理中上下文边界模糊引起的系统性安全风险,重点关注高风险攻击,如提示注入、通过多模态输入和长期记忆进行隐蔽注入、引起的操作以及隐私窃取。研究目的是将传统安全机制与 AI 代理中动态防御能力深度整合,构建一个与代理推理和执行管线内生的统一防御防护壁垒。通过系统化地建模攻击路径,该方法增强了代理对上下文的结构化感知、可信度评估和意图推理能力,使其能够实时识别和隔离潜在的恶意指令和数据。结合权限控制、沙箱隔离和身份验证等传统安全措施,形成了一种轻量级、低干预、自动化协同防御系统,在保持代理高度自主用户体验的同时,构建了更加强大的安全和隐私保护边界。

内容来源: casdoor/casdoor