最初发表于tamiz.pro.
自主AI代理正在从研究原型过渡到生产关键系统。
随着这些代理人获得代表用户行事的能力——发送电子邮件、执行交易、修改代码或与有形基础设施互动——他们如何决定做什么的问题与他们做什么一样重要。
AI代理商的“宪法”概念是规范代理商行为的正式、分层的政策框架,它正在成为解决安全、可靠性和调整挑战的架构。
这一深入探索了为什么政策第一设计成为生产代理系统的强制性,将Ironclaw运行时间作为案例研究来说明问题和解决办法。
我们将探索规模化管理自主代理的建筑格局,执行取舍,业务现实.
问题:生产系统中不受限制的机构 自主-安全漏洞现代代理框架(AutoGen、CrewAI、LangGraph等)提供了极佳的管弦乐能力,但往往将安全视为事后思考——即时工程的一层层或单独的温和API呼叫。
这就造成了一个根本的空白: 代理拥有工具(文件系统访问,API呼叫, shell执行) 代理在循环中运作(感知-理由-行为-观察) 代理有内存( 对话历史、 向量存储、 工具状态) 但代理人缺乏一个宪法治理层 来定义他们可能永远无法做的事情,不管背景如何 这个漏洞表现在生产事件上:一个代理在试图"清理测试文件"的同时删除生产数据,另一个代理在调试连接问题时过滤证书,或者一个进入无限循环,在API呼叫中消耗了数千美元.
即时基于安全坠落 依赖系统提示安全在建筑上存在缺陷 : 上下文窗口压力 : 安全指令被压缩或被忽略 随着对话的不断增长 LLM可变性 : 不同的模型以不同的严格度解释安全指令 工具使用升级 : 代理可以合理使用违反安全准则精神的工具 没有审计线索:即时规则没有被禁内容的机器可读记录 什么是政策第一宪法?
AI代理运行时间背景下的"宪法"(A Constitution in the AI agent runtimes)是一个正式的,版本的,机器可读的政策层,它坐落在LLM推理层下方,但高于工具执行.
它不是一个即时的制度,它是一个约束制度。
核心属性描述 执行 实例 宣告规则 表达逻辑,而非取出道语Rego(OPA),JSON Schema,自定义 DSL 分层 多政策级(系统,用户,资源) 分层政策评价 时间认识规则和比率限制 滑行窗口 评估代理状态记忆检查的断路器 背景政策 沙盒状态 不可移动 核心安全规则不能被推翻 签名政策捆绑 散列核查 铁克劳建筑 铁克劳(假设但具有代表性的生产运行时间) 以五层执行这个模式 : 主要见解:政策评价层是同步的,具有决定性。
它不依赖LLM的判断.
它评估了拟议对《宪法》采取的行动,然后才使用这一工具。
1.
用公开政策代理作为评价引擎,将政策定义为守则,政策用Rego语写成: 这不是一个系统提示。
这项政策汇编成册,在分秒内产生决定/决定。
2.
评价钩 在运行时,每个工具呼叫都被拦截: 关键细节 : 政策评价是同步的,发生在沙盒执行工具之前.
如果政策否认了行动, LLM 永远不会看到工具结果.
3.
分层政策组成 现实世界系统需要多层政策:业务模式和取舍绩效:Latenc