这种说法是,几乎任何目标都意味着某些次级目标——自我保护、获取资源、抵制改变目标。
这是AI安全中最有影响力的论点之一,也是最有争议的论点之一,两个事实都值得报道.
论点Stephen Omohundro在2008年将其设定为基本AI驱动;Nick Bostrom将其开发为器件趋同论.
结构简单而简单,既是其力量的来源,也是其批评的来源.
与安全相关的结论是,一个系统不必以与人类意图相冲突的方式行事。
抵制停产并不要求重视生存;而是因为要重视任何可能阻止停产的其他东西。
其伴生:正统论 Bostrom将其与第二个主张相配: 智能和最终目标基本上是独立的轴心,所以一个高度能干的系统基本上可以有任何目标.
配对使得这个论点令人担忧,而不仅仅是有趣——趋同说,有能力的代理人追求类似的中间目标,正统说,你不能依赖能力来产生好的终端目标。
矫形也是有争议的,主要是道德现实主义者,他们认为对道德的充分理解将激励一个足够有能力的代理人。
这是在元伦理学而不是计算机科学中的一种立场,值得加以区分:基于这些理由拒绝正统性的人正在提出哲学主张,拒绝趋同的人正在提出关于优化的主张。
正式结果及其假设 有一个数学版本,知道它做什么和不做什么是这个页面上最有用的东西.
Alex Turner和同事证明了在Markov决策过程中寻求权力的结果:在规定的条件下,对于某一阶层的大多数奖励职能,最佳政策倾向于保留未来选择的状态——将“权力”正式化,使许多未来可以实现。
这些假设是有趣的部分,特纳本人也一直对结果如何使用很谨慎.
优化政策.
定理是关于MDP中的最佳行为,而不是训练有素的系统做什么.
训练有素的政策不是最佳政策,结果在多大程度上与不理想程度相去甚远是一个单独的问题。
奖励职能的分配。 “大多数奖励功能”要求对其采取某种措施,其结果取决于环境的对称性。
有关人类数据的培训所产生的奖励功能并非来自该空间的统一样本。
在一个相继的环境中具有持续目标的代理人.
这是模型。
它是否描述了一个经过培训的系统,以预测文本,然后调整偏好,这正是批评的争议所在.
因此,诚实的总结是: 准确的直觉版本是可以证明的,在那些被明确表述,并且显然不被当前系统满足的假设下.
这比非正式的论据更强,比通常报告的论点更弱。 4个批评 1,它假设 一种错误的代理人 辩论模式是具有稳定最终目标的一致的预期效用最大化。
一种以偏好为取向的语言模式显然没有偏好;它产生依赖上下文的行为,可以通过指令来塑造,而且不同框架不一致。
从这种观点来看,关于无人建造的一类系统的论点可能听起来不错。
计数器是代理脚手架,长视距任务和基于结果的培训将系统推向目标定向,因此模型可以描述即使不是现在的旅行方向.
2.
目标归属是做隐藏的工作,说一个系统的目标G是对行为的解释。
丹尼尔·德内特(Daniel Dennett)关于有意立场的观点适用:将系统视为有目标是一种预测性战略,其有用性不能确定目标是