看守所住的地方

2026年8月1日1 次浏览来源:Dev.to阅读原文

这个星期我读到的三条线是同一个问题:AI特工什么时候应该停下来问一个人?

三者在行动层面都作了答复。

哪个工具呼叫是冒险的, 哪些金额需要签名, 哪些决定是不允许的。

我最便宜的护栏不在那儿 它选的是里面的东西 从未获得信任的渲染器 部分我构建 使任意的 HTML 在无头浏览器中。

任何人都可以交出一个URL或一页的脚本, 没有任何版本的我信任 渲染器的行为。

故不取所请.

它运行沙盒, 带有入侵规则, 资源限制 和硬墙小时最后期限, 坏的渲染 被杀死而不是与推理。

安全无一来自小心的东西。

同样的规则,指着我自己的工具"雷克"在跑出前会减少,在跑出时不会被判断.

有两个我实际上坚持自己: 两个浏览器自定义路径。

一个驱动我真正的登录的档案, 的少数任务 真正需要它。

一个发射一个空的丢弃配置, 这是其他一切的默认。

秘密被写到一个文件 并经过路径, 从来没有回响到对话。

从未进入上下文的值不能通过会话摘要,日志或截图泄露.

两者都花费了一些真实的东西。

我用脚写登录,而不是已经登录, 我读了一个路径而不是一个值。

它不止一次地否决了方便的选择。

特工遵循的规则仍然值得遵守。

它们不能是唯一的一层,因为它们共享一个失败模式:它们依赖于代理正确判断它将要做什么.

所以,有一个问题,因为我只有我自己的几个例子: 什么是你让你的经纪人在结构上无法做到的事情, 而不是你告诉它不要做的事?

分享