这是一份名为OpenART Red-Teams Stateful Agents 跨越一万个不断变化的环境情景的研究论文的英文论文摘要。
如果你喜欢这些分析,你可以在AIModels.fyi上找到更多的AI和机器学习研究,或在Twitter上跟踪我们.
OpenART将持久性状态转化为红团队目标OpenART评价代理安全,涵盖超过一万个经过验证的状态情景,跨越了50个域,需要97个工具呼叫的中位数.
它的中心主张是,安全故障可能出自工作空间数据,权限,内存,以及计划被反复修改的轨迹,而不是孤立的提示.
竞技场保持每个良性任务目标和隐蔽安全契约的固定,而只改变目标可见环境状态.
这种设计目标延迟了静态基准可能错过的失败:早期授权的突变可能影响后期的决定,暴露被保护资源,或者在原变化后产生许多不安全的输出.
OpenART通过使持久性环境状态为测试中演化出的对象来扩展了更广泛的剂安全评价理念.
OpenART报告,75个代理型号配置的集中攻击成功率为85.0%。
严格的成功要求确定性评价员和GLM-5.2法官都能够识别攻击条件,因此分歧算作失败而不是被作为部分证据处理. .
继续阅读关于AIModels.fyi的全文论文摘要