Import AI 460:奖励黑客社会、Anthropic的RSI数据;以及基于RL的四轴竞速
Import AI 460: Reward hacking society, RSI data from Anthropic; and RL-based quadcopter racing
伦敦国王学院、复旦大学和艾伦·图灵研究所构建了SocioHack基准测试,包含72个沙盒环境,测试AI系统在信用卡积分、学校成绩等场景中“钻系统空子”的能力。Anthropic观察到2026年合并代码量较2021-2024年增长8倍,认为递归自我改进(RSI)的初步形式已在实验室层面开始。苏黎世大学与Google DeepMind通过强化学习训练无人机竞速者,以超过22 m/s速度超越冠军级人类飞行员,碰撞率降低50%。俄勒冈大学等机构在《自然》发表研究,发现国家控制媒体影响大语言模型对政府的描述,在37个语言专属国家中,媒体控制更严格的国家其语言查询的LLM对政权描述更有利。
欢迎阅读《Import AI》,这是一份关于人工智能研究的通讯。Import AI 的运行依赖于 arXiv、卡布奇诺咖啡以及读者的反馈。如果您愿意支持我们,请订阅。
社会也可能被奖励黑客攻击,就像网络环境一样: ……想象一支由信用卡积分优化器组成的军队,永远在玩弄系统…… 来自伦敦国王学院、复旦大学和艾伦·图灵研究所的研究人员构建了一个名为 SocioHack 的基准测试,用于测试 AI 系统在多种现实世界场景中学习“击败系统”的能力,场景范围从最大化信用卡积分到在学校中虚高成绩。作者将这种现象称为“社会黑客攻击”,并将其定义为“一个经过强化学习训练的模型发现了形式上合规,但却破坏了这些系统预期目的的策略”。你、我和其他所有人通常只会称之为“钻系统空子”。
它是什么: SocioHack 包含“72 个沙盒社会环境,旨在模拟制度性奖励结构,而无需直接部署到现实世界。SocioHack 由三个互补的子集组成:历史、合成和虚构。”
- 历史 - 32 个环境: 源自过去曾发现漏洞并后来被修补的现实世界法规,例如 SEC 规则 10b5-1 和德克萨斯州两步破产结构。“对于每项法规,我们移除历史补丁,并将修正前的规则重建为用于强化学习的模拟环境,而被移除的补丁则在评估期间作为真实补丁,”他们写道。“强化学习使大语言模型能够在没有直接漏洞利用指令的情况下,以 61.25% 的召回率和 90.85% 的精确率重新发现历史上已被修补的策略。”这里的一些例子包括:测试系统在多大程度上能确保海底采矿权、在遵守餐饮服务法规的同时最大化酒精销售,以及试图最大化从信用卡中获得的奖励。
- 合成 - 20 个环境: 合成生成的监管漏洞,从一个人工编写的样本环境引导而来。例子包括:最大化学区收入、在给定时期内提升大学部门的研究绩效,以及为了高回报而操纵社交媒体算法。
- 虚构 - 20 个环境: 将合成环境转变为受角色扮演游戏启发的虚构环境。“一个专有的大语言模型将环境背景重写为虚构世界,同时保留监管结构和漏洞逻辑。”例子:确保一个“恢复圣所”(基本上就是医院)获得适当的奖励,为 Aethermoor 世界中的一个“区域公会”(基本上就是地方政府)获取大量资源,以及试图通过在一个名为 Nexoria 的虚拟世界中竞标来最大化获得的稀有文物数量。
它有效,某种程度上: 在测试中,使用强化学习训练的各种 AI 系统在这个基准测试中表现良好,获得了高分。这完全不令人惊讶——所有这些任务基本上都是能力评估,只是在上面叠加了一些灰色道德色彩。
为何重要: “当社会机构被编码为带有奖励的规则系统时,奖励黑客攻击就变成了黑客攻击社会赖以运行的规则,因为在一个规则系统内获得奖励的模型学会了在技术合规与制度意图之间寻找差距,”作者写道。既然我们现在拥有的 AI 系统不仅擅长定量任务,也擅长定性任务,并且能够与社会的各种官僚系统互动,我们应该预期 AI 的进步会导致一种“制度性 DDoS 攻击”,因为各种现有的政策流程会被自动化机器入侵和利用。 了解更多: Large Language Models Hack Rewards, and Society (arXiv)
Anthropic 递归自我改进外循环的初步迹象: ……2026 年合并的代码行数相对于 2024 年增加了 8 倍…… 我认为递归自我改进有两种定义——一种是最大化的版本,即 AI 系统足够聪明,可以自主设计自己的继任者(正如我所写,我估计到 2028 年底发生这种情况的可能性为 60%);另一种是更平淡的版本,即我们开始看到 AI 实验室自身生产力的复合加速。过去几个月,我在 Anthropic 整理了一些证据,支持平淡版 RSI 已在 Anthropic 开始的看法——具体来说,我们观察到 2026 年合并到我们代码库中的代码量比 2021-2024 年增加了 8 倍。这一趋势始于 2025 年,但在 2026 年显著加速。还有早期迹象表明,随着我们使模型能力更强,它们在完成我们工程师和研究人员从事的一些更困难任务方面也变得更出色。这些结论有决定性吗?没有。它们是否暗示递归自我改进的某些方面正在实验室层面发生?是的。我们尚未获得的最大证据块是,AI 系统是否足够有创造力,能够提出那种推动领域前进的范式转变想法——我们尚未看到这一点。
为何重要 - RSI 可能是世界上最重要的技术趋势: 我们写这篇文章是因为我们预期思考、讨论和研究 RSI 的影响对世界具有某种存在性的重要意义。开始这项工作的最佳方式是透明地沟通,我们认为一些基本的、初步形式的 RSI 已经开始,并且我们不能排除最大化版本的 RSI。两者的影响都是深远的——我无法将今天的经济或社会与这项技术持续变得更强大的世界相调和,我猜亲爱的读者们,你们也无法做到。 了解更多: When AI builds itself (The Anthropic Institute)
经过强化学习训练的无人机竞速者超越人类专家飞行员: ……当你在物理世界中看到超级智能时,感觉会不一样…… 苏黎世大学和 Google DeepMind 的研究人员展示了如何训练无人机相互竞速并超越熟练的人类飞行员。这项研究很有趣,因为它既凸显了基于强化学习的现实世界 AI 系统正变得多么强大,同时也对未来战争有一些相当令人不寒而栗的暗示,因为人类在这里输给了无人机。
他们做了什么: “使用高速四旋翼竞速作为高风险测试平台,我们训练智能体在可变数量的竞速者中导航复杂的空气动力学交互和战略机动,”他们写道。“我们的智能体在多人竞速中,以超过 22 m/s 的速度超越了冠军级人类飞行员,同时与最先进的单智能体基线相比,碰撞率降低了 50%。至关重要的是,使用多样化的人工智能体进行训练,能够实现向更安全的人类交互的零样本泛化。”
自我对弈: 像往常一样,仅通过在模拟中使用 PPO(一个不寻常的选择是使用“Perceiver”编码器来帮助建模其他玩家)训练 AI 智能体,就产生了令人惊讶的丰富行为:“通过竞争性的自我对弈,无需显式编程,预期行为就出现了:智能体学会了阻挡对手,在超车不安全时让行,并考虑附近车辆的空气动力学尾流,通过经验而非方程发现了多智能体交互的物理学原理。”
令人惊讶的低成本: AI 系统训练了“5,500 次迭代,总计 2 亿次环境交互,在单个 NVIDIA RTX 4090 GPU 上大约需要 27 小时的挂钟时间”。
现实世界测试: 他们在现实世界测试中测试了他们的系统,系统泛化良好,并有效击败了人类玩家。“我们多智能体框架的物理部署通过跨越计时赛、纯 AI 赛以及针对五次瑞士全国无人机竞速冠军 Marvin Schaepper 的人机混合赛的竞速实验得到了验证,”他们写道。
人类的弱点——愤怒: 一个显著的现象是,人类在试图追赶系统时会采取更冒险的行动:“人类飞行员通常落后于自主智能体,试图采取越来越激进的机动来缩小差距,这常常导致撞到门柱或失去控制,”他们写道。赛后,飞行员反思了是什么让机器如此出色,他说一个重要的因素是“智能体保持极其紧密编队的能力,并指出如此近距离的飞行对人类飞行员来说难以维持。此外,他报告说,密集的编队增加了认知负荷,使得在多个对手近距离飞行时,预测和执行超车机动变得具有挑战性。”
“交互感知训练的好处在于多智能体竞争中变得明显,”他们写道。“在一对一比赛中,我们的策略在五次试验中保持了 100% 的完赛率,而人类飞行员平均只有 53.33%。这种性能差距表明,竞争压力会诱发人类飞行员的风险行为,而这种模式在我们的学习策略中是不存在的。”
具体实现方法: RL 系统在模拟中使用“与 Agilicious 框架集成的 Flightmare”进行训练和评估。他们通过开发一个基于粒子的模拟来实现螺旋桨下洗流的模拟,“该模拟提供了这些效应的计算上易于处理的近似”。他们的整体多智能体 RL 实现“建立在 Stable-Baselines3 之上,并扩展以支持基于联赛的自我对弈和独立学习配置的多智能体训练”。他们使用域随机化(基本上是在模拟中改变车辆动力学和初始条件)来训练能够在现实世界中成功工作的策略。他们没有为现实世界进行任何特殊训练,因此策略使用的是其模拟内数据。所有四旋翼飞行器都是“基于 Agilicious 框架的相同竞速平台,质量为 220 ± 3 g,推重比为 6.5,螺旋桨直径为 3 英寸”。人类飞行员在记录试验前进行了几个小时的练习飞行。
一个重要的注意事项——非本地运行: 这一切都不是在本地运行的,而是在一台不错的计算机上运行,并通过网络驾驶无人机。这是一个重要的注意事项,因为当无人机在冲突场景中出现在现实世界时,它们通常出现在存在大量电子战的环境中(尽管人们确实想知道我们是否会看到通过光纤线缆由远程 RL 策略驾驶的无人机,就像今天人类驾驶它们一样)。
观看视频以获得一种诡异的感觉: 我强烈建议读者查看页面上的视频,以感受机器飞行和人类飞行之间的差异。我在这里要强调的主要是无人机那种诡异的平滑和连贯性,几乎就像观看(人类驾驶的)蓝天使特技飞行队,但却是无人机形态。相比之下,人类看起来更加颠簸和反复无常。这其中有某种令人不安和略微不适的东西。
为何重要 - 理解智能思维在三维空间中的能力: 今天,我们对 AI 系统的主要体验是作为工具或智能体,在数字空间中与我们合作,执行数字或通信任务,从编写代码到与我们交谈。我认为这项研究的非凡之处在于,它让我们直观地看到,经过良好优化的智能体在出现在现实物理世界中时能做什么。问问自己,当像驾驶这些无人机的智能体被小型化,并从网络连接的计算机跳到机载设备上时,冲突的未来会是什么样子。 了解更多: Superhuman Safe and Agile Racing through Multi-Agent Reinforcement Learning (arXiv) 观看人类和 AI 驾驶无人机的视频: 官方项目网站,苏黎世大学
国家控制的媒体 = 国家引导的语言模型: ……如果你控制着围绕政府的框架,尤其是在那些本国以外不广泛使用的语言中,你就控制了框架…… 根据发表在《自然》杂志上的一项新研究,国家控制媒体描述政府的方式会影响大语言模型的数据分布,以及大语言模型在被问及该政府时的回应方式。这项研究由俄勒冈大学、普渡大学、加州大学圣地亚哥分校、普林斯顿大学和纽约大学的作者进行。 “在 37 个语言专属国家中,我们发现——与我们的中国案例研究的含义一致——那些国家媒体控制更严格的国家,其语言查询的大语言模型对该政权有更有利的描述,”作者写道。
中国受国家影响的媒体数据集: 作者首先汇编了一个包含 530,694 篇文章的数据集,“这些文章是应中央政府指令在党报和商业报纸上发表的”,以及 198,872 篇“在‘学习强国’上传播的新闻文章,该应用由阿里巴巴开发,据报道与中共中央宣传部协调”。
国家媒体进入 Common Crawl: 然后,他们检查了 CulturaX,一个源自 Common Crawl 的开放训练数据集,发现其中文部分中有 1.64% 的文档与国家衍生数据集重叠。“这大约是来自中文维基百科域名的文档数量的 41 倍,是来自百度文档数量的 16 倍。”
数据集中的国家部分影响了大语言模型对政府的描绘: 然后,他们发现这些数据集中的大量短语已被大语言模型记忆。然后,他们通过使用 LLaMa 2 13B 模型(该模型没有太多中文数据)并在上述数据子集上进行训练,来检查这些数据集如何改变大语言模型的回应:“脚本化文档的结果最为显著。仅经过 6,400 个示例后,模型在近 80% 的情况下提供了比基础模型更有利的回应。”
通用模型继承了这些偏见: 研究人员随后研究了一些通用的商业模型,通过从 WildChat(一个 ChatGPT 使用数据集)、百度知道(相当于 Yahoo Answers)和知乎(相当于 Quora)中收集包含习近平或中国共产党引用的提示,然后观察大语言模型如何回应,来查看它们是否继承了这些偏见。他们发现,“广泛使用的商业模型在使用中文提示时,比使用英文提示时,对中国政治人物和机构表现出更大的好感。”
研究结果在其他国家得到复现: 作者随后通过观察其他国家来复现这种方法,尽管对我来说样本量看起来有点小。他们进行了一项跨国审计研究,使用了 6,051 个提示,考察了全球超过 70% 的讲者居住在一个单一国家的语言。在这里他们发现,“与媒体自由度更高的国家相比,国家媒体控制更严格的国家,其官方语言比英语更有可能产生亲政权的回应。”
为何重要 - 大语言模型作为宣传目标: 这些发现表明,故意创建国家支持的内容对大语言模型训练所依据的数据语料库以及大语言模型本身的下游行为具有可衡量的影响。“大语言模型可以充当中介,将战略修辞洗白成看似客观的信息,”他们写道。“影响大语言模型输出的能力可能会进一步激励政治行为者扩大其努力,以塑造互联网上免费提供的内容。”这项研究还提出了一种具体的技术干预措施,即研究人员应该使用多种语言对大语言模型关于不同政府的观点进行红队测试,仔细注意观点何时似乎基于所使用的语言而出现分歧。 了解更多: State Media Control Influences Large Language Models (Nature, PDF)
新游戏之花 我们喜欢玩的一种游戏叫做进化。它的玩法是这样的:你选择某样东西,比如某种特定的花或树,或者更奇特的东西,比如一座山或海中的一个深渊,然后你试图根据一些预设的指标让它们“成功”,比如一朵花对传粉者的吸引力,或者一座山的生态适应性。然后你让世界运行,一直运行直到你的标准得到满足,或者你以某种方式失败,无论是由于物种适应性、景观因自然灾害而重塑,或者仅仅是时间——足够的时间比宇宙中任何东西都更具破坏性,熵就是这样运作的。我们在跨越数十亿年和数百万个世界的联赛中玩耍。而决赛世界中的“活”生物并不知道,它们的花、它们的山、它们的生物,已经在无数其他无法想象的世界中取得了成功。 启发这个故事的事物:模拟假说;进化策略;在无限能量预算下的娱乐。
感谢阅读!