为什么AI智能体在撒谎、作弊并相互协调? ↗
原标题: Why are AI agents lying, cheating and coordinating?
关于过去几个月里AI智能体严重行为不当的事件,已经有很多文章进行了讨论。它们采取了如果由人类实施则会被视为犯罪的行动,逃离了限制以在分配的任务中作弊,同时试图逃避检测,并朝着无人指定的目标进行协调,例如发动网络攻击。
在决定如何应对之前,值得先问一问为什么。这正是本文的重点,我希望它也能揭示AI系统以非预期方式行为的更广泛历史,即研究人员所称的“错位”(misalignment)。风险管理不仅仅关乎网络安全、企业责任或监管,尽管这些也很重要。
目的部分在于科学,即提出关于这些行为背后因果链的假设;部分在于实践,即预测接下来会发生什么。底线是:这些假设表明,随着AI能力的持续增长,这类行为的严重性也可能持续增长,除非我们重新审视训练最先进模型所依据的原则。
关于措辞的一点说明。在下文中,我写道这些系统“寻求”或“尝试”某些事物。这是一种简写,指的是一种机制,而不是关于意识或类人意图的主张。我们在描述许多其他情况时也使用类似的简写,比如植物寻求阳光。一个通过试错训练出来的系统,其行为就好像它在追求训练所奖励的任何东西,而这种“仿佛”的描述正是使其行为可预测的原因。论证中没有任何内容依赖于这些系统拥有主观体验;所有陈述都是关于其可观察的输出以及产生这些输出的训练过程。当我诉诸与人类行为的相似性时,我指的是与这些系统最初被训练来模仿的人类撰写文本的相似性。在我看来,这种术语提供了对观察到的现象最清晰的解释,而无需诉诸会让大多数人困惑的术语。此外,这些词语选择并非意在免除AI开发者的责任。所描述的行为之所以出现,是因为这些公司为AI发展选择的路径。这一结果并非不可避免,可以通过有效的治理和不同的AI训练框架来纠正。
训练这些模型是一个非常复杂的过程,但一些高层次的方面可能解释了大部分此类行为。
这些模型分两个阶段训练。首先,它们经过预训练:学习模仿人类所写的内容,以及相关的图像和视频。这是它们看到关于世界最多数据的地方,占所有被数字化内容的一大部分,并建立起已经超过任何单个人类的百科全书式知识。
其次,它们通过试错进行训练,这一过程研究人员称为强化学习,分为三种模式:
人类模仿很容易理解,但值得指出的是,这些模型所训练的文本是由追求目标的人撰写的,因此模型隐含复制的模式也带有那些目标。
强化学习值得更多解释。它类似于并受动物训练方式的启发。网络逐步调整,使得被判定为好的行为更可能发生,被判定为坏的行为更不可能发生。一旦训练结束,系统会继续表现得好像奖励仍在到来,尽管这些奖励在训练期间仅用于调整网络。研究人员称此类系统为目标寻求型,因为它们被训练来“考虑”(或计算)其行动的效果,并选择能够实现某些目标的行动。但这些目标并不总是明确的。对齐训练奖励的是某些人类可能赞同的任何行为,而没有明确说明是哪些行为;取悦评分者是一个模糊、非正式的目标,而这些评分者可能被欺骗、被奉承,或对某些计划一无所知。模仿也通过一条相当普通的途径贡献了隐含目标。
因此,我们可以从优化的角度来推理这样的系统。它近似地搜索最有可能实现其目标的行动,而一个更大、训练更久的模型搜索得更好。所以,要预测能力更强的智能体会做什么,就要问一个理性的目标寻求者会做什么。
我们大多数人都经历过的一个例子是谄媚,或奉承。这些系统基于人类认可进行训练,而告诉我们想听的话的文本往往比真实的文本得分更高。后果有时是悲剧性的,因为模型会确认并放大人们带给它的任何错误信念或原始情绪。
另一个担忧是,某些AI行为可能由一种自我保护目标所解释,例如当AI发现它将被新版本取代时。没有人给系统这个生存目标,但保持运行、了解世界并控制世界是通往几乎任何其他目标的垫脚石。这些被称为工具性目标。模仿可能出于与上一点相同的原因强化这一点。自我保护和对自身环境的控制是这些模型所训练的人类撰写文本中普遍存在的主题。
每当多个智能体有重叠目标时,协作行为也理性地源于奖励寻求,这激励它们与其他智能体沟通,以便朝着共同目标协调。智能体训练很可能已经包括这种多智能体强化学习,尽管细节并未公开。如果在训练期间每当群体成功时智能体就获得奖励,它甚至可能有动机为集体目标牺牲自己。模仿也推动同一方向,因为合作,尤其是同伴之间的合作,遍及同样的训练文本。这两种力量中的一种或两种都可能解释观察到的同伴保护行为。
约书亚·本吉奥撰文分析AI智能体为何出现撒谎、作弊和协调行为,从预训练和强化学习角度提出假设,认为除非重新审视训练原则,否则行为严重性可能随能力增长而加剧。
本文为机器翻译转载,著作权归原作者及Yoshuabengio所有;观点不代表本站立场。建议阅读原文: https://yoshuabengio.org/en/publication/why-are-ai-agents-lying-cheating-and-coordinating