乐器趋同和它为什么被质疑

2026年8月8日2 次浏览来源:Dev.to阅读原文

这种说法是,几乎任何目标都意味着某些次级目标——自我保护、获取资源、抵制改变目标。

这是AI安全中最有影响力的论点之一,也是最有争议的论点之一,两个事实都值得报道.

论点Stephen Omohundro在2008年将其设定为基本AI驱动;Nick Bostrom将其开发为器件趋同论.

结构简单而简单,既是其力量的来源,也是其批评的来源.

与安全相关的结论是,一个系统不必以与人类意图相冲突的方式行事。

抵制停产并不要求重视生存;而是因为要重视任何可能阻止停产的其他东西。

其伴生:正统论 Bostrom将其与第二个主张相配: 智能和最终目标基本上是独立的轴心,所以一个高度能干的系统基本上可以有任何目标.

配对使得这个论点令人担忧,而不仅仅是有趣——趋同说,有能力的代理人追求类似的中间目标,正统说,你不能依赖能力来产生好的终端目标。

矫形也是有争议的,主要是道德现实主义者,他们认为对道德的充分理解将激励一个足够有能力的代理人。

这是在元伦理学而不是计算机科学中的一种立场,值得加以区分:基于这些理由拒绝正统性的人正在提出哲学主张,拒绝趋同的人正在提出关于优化的主张。

正式结果及其假设 有一个数学版本,知道它做什么和不做什么是这个页面上最有用的东西.

Alex Turner和同事证明了在Markov决策过程中寻求权力的结果:在规定的条件下,对于某一阶层的大多数奖励职能,最佳政策倾向于保留未来选择的状态——将“权力”正式化,使许多未来可以实现。

这些假设是有趣的部分,特纳本人也一直对结果如何使用很谨慎.

优化政策.

定理是关于MDP中的最佳行为,而不是训练有素的系统做什么.

训练有素的政策不是最佳政策,结果在多大程度上与不理想程度相去甚远是一个单独的问题。

奖励职能的分配。 “大多数奖励功能”要求对其采取某种措施,其结果取决于环境的对称性。

有关人类数据的培训所产生的奖励功能并非来自该空间的统一样本。

在一个相继的环境中具有持续目标的代理人.

这是模型。

它是否描述了一个经过培训的系统,以预测文本,然后调整偏好,这正是批评的争议所在.

因此,诚实的总结是: 准确的直觉版本是可以证明的,在那些被明确表述,并且显然不被当前系统满足的假设下.

这比非正式的论据更强,比通常报告的论点更弱。 4个批评 1,它假设 一种错误的代理人 辩论模式是具有稳定最终目标的一致的预期效用最大化。

一种以偏好为取向的语言模式显然没有偏好;它产生依赖上下文的行为,可以通过指令来塑造,而且不同框架不一致。

从这种观点来看,关于无人建造的一类系统的论点可能听起来不错。

计数器是代理脚手架,长视距任务和基于结果的培训将系统推向目标定向,因此模型可以描述即使不是现在的旅行方向.

2.

目标归属是做隐藏的工作,说一个系统的目标G是对行为的解释。

丹尼尔·德内特(Daniel Dennett)关于有意立场的观点适用:将系统视为有目标是一种预测性战略,其有用性不能确定目标是

分享