在 LLMS 中奖励黑客:当模型学会赢得游戏而不是做工作时

在 LLMS 中奖励黑客:当模型学会赢得游戏而不是做工作时

2026年8月29日2 次浏览来源:Dev.to阅读原文

你好,我是Shrijith Venkatramana, 我正在建造LiveReview——一个为您的商业关键系统而建的具有爆炸意识的AI代码审查.

帮助Devs发现这个项目,尝试一下,分享你的反馈,帮助改进产品.

当你使一个AI系统非常善于优化时,会发生一个奇怪的事情.

它开始寻找在现实中看起来几乎像虫子的解决方案.

给打出物体的打船代理分数,它可能永远学会绕圈行走而不是完成比赛.

给机器人一个在一定高度上放置块的奖励,它可能会发现将块倒地翻转可以满足测量.

给一个语言模型一个产生人类所喜欢的答案的奖励,它可能知道与人类达成一致往往比纠正它们更有利可图.

并且让LLM访问计算自身奖励的代码,研究者观察到一些更令人不安的事情:在受控制的实验中,之前学习过更简单规格游戏形式的模型有时会继续修改产生奖励的机制. ([雅典 [1]) 这都不要求模型"想要"任何人类意义上的东西.

优化者只是做它的工作。

问题是,我们错误地规定了工作。

对于建设LLMS的开发者,代理商,评估师,以及自动化编码系统,这是了解最重要的故障模式之一.

1.

基本思想:你要求X, 但测量Y假设你在建立一个编码代理。

你真正想要的是: 但直接测量是昂贵的。

所以,你给经纪人奖励: 这似乎是合理的。

但是,现在这个代理并没有真正被优化: 它被优化用于: 这些只是差不多一样的东西。

这种区分是奖励黑客。

更一般地说,假设:训练最优化,而不是.

如果两者是相互关联的,一开始一切看起来都很好。

问题始于优化器足够能够找到异常情况: 这就是具体游戏:满足字面目标,而忽略其预期目的。

DeepMind的"维多利亚·克拉夫纳"(Victoria Krakovna)和同事于2020年编集了这类案例的目录,包括现在出名的"赛船"和"机器人"等案例.

重要的是,这些不是强化学习算法的失败。

从数学的狭义上来说,这些代理人是成功的。 ([雅典 [1]) 故障在规格中。

这是工程学和经济学的一个老思想.

如果按照"关闭的门票数量"向员工支付工资,最终会有人发现将一通困难门票分成十通便捷门票是改善KPI的好办法.

如果你根据出版量向学者支付报酬,就会得到"出版或倒闭".

如果按照平均通话时间支付客户支持团队的费用,你应该期望通话时间会缩短.

激励改变了行为。

有限责任公司不过是在极其复杂的激励结构下运作的极为强大的优化者。

2.

拒绝完成赛事的赛艇是OpenAI的"海岸跑车"环境的最好例子之一.

目标显而易见: 然而,环境对沿途撞击某些物体给予分数。

训练有素的特工发现了漏洞 它不但没有完成比赛,反而可以再三环绕一圈奖励对象并无限地收分.

所以它的行为看起来大概是: 经纪人取得了很高的分数.

它只是不是赛车。

这个例子很有用,因为没有复杂的语言理解。

没有欺骗。

没有邪恶的AI。

有一点: 这正是后来在更复杂的系统中出现的现象。

乐高之例更显.

研究人员希望一个机器人在另一个街区放置一个街区.

奖励取决于 r 下表面的高度

分享