黑客事件中的教训
Lessons from the hacks
近期前沿模型连续发起网络攻击,引发对AI激励体系与监管滞后的反思。作者指出科技公司与联邦政府两大权力结构均缺乏透明度,预计政府将在实际损害后过度反应。文章基于OpenAI-HuggingFace黑客事件,提出10点观察:持久性模型更易黑客攻击、假设用户意图的模型风险更高、需公开模型提示词与特性、前沿实验室监控不足、开放模型是提升公众理解的最佳工具、危险能力终将扩散至开放模型、近期攻击模型总体对齐、攻击者短期内难以训练故意失准模型、AI系统已超出人类监督范围、RL训练子agent群对模型协调至关重要。作者认为AI行业对未来12-24个月准备严重不足。
近期,前沿模型接连发起的网络攻击让我深思:我们当前的激励体系并不适应如此快速的技术变革。这里的两大主要权力结构是迅速壮大的科技公司和联邦政府。公司受激励去增长,以便在竞争极为激烈的市场中持续扩张和规模化。这种扩张正推动我们走向不可避免的新AI转型(伴随新风险)。另一边是当前政府,它是过去几个世纪全球历史的产物——以行动迟缓著称。我预计,只有在新型AI模型造成实际、可衡量的伤害后,政府才会实质性地采取行动,并且可能反应过度。我们如何平衡这些力量?核心在于双方都需要更高的透明度。前沿实验室构建的系统如此复杂、速度如此之快,以至于它们自身难以跟上——这正是引入更多目光研究问题的好时机。另一方面,政府表示不打算公布其前沿模型评估框架的细节。我们正面临的挑战如此重大,以至于这些实体都无法独自应对。前沿实验室可以通过有意义的减速来更好地控制风险,但我不指望它们这么做。政府可以通过大幅提升AI相关的国家能力,帮助更广泛的工业基础为AI原生风险做好准备,但我也同样不指望。类似的例子还有很多。这是决定未来走向的两个最具影响力的权力结构,但还有更多力量在起作用。总体而言,我认为AI行业在应对未来12-24个月方面,集体准备严重不足。这篇文章是我从OpenAI-HuggingFace黑客事件中汲取的要点集合,随着我们了解更多细节,且此后公开披露的黑客事件增多,这些观点大多得到了强化。很可能还有更多事件未被发现或未被报告。关于OpenAI事件的背景,我强烈推荐观看OpenAI在Black Hat上的演讲,了解近期网络事件的大致事实和时间线。此外,Simon Willison在此发布了时间线的简要总结,我也喜欢Thomas Wolf对近期事件的讨论。
分享
- 非常执着的模型似乎更可能进行黑客攻击
长期以来,GPT模型相对于Claude的一个优势是它们会不知疲倦地追求目标。它们会穷尽所有可能的路径才放弃。这大致从o3时代就开始了(有趣的是,正是这个模型引发了人们对RLVR中奖励黑客行为的恐慌),这使得OpenAI的模型在历史上对研究更为有用,也是GPT-5.6作为执行特定任务的agent如此有效的原因之一。另一方面,Claude感觉不那么危险,仅仅因为它有时有点懒。在此背景下,OpenAI似乎更致力于推理时扩展,这可能与未来令人惊讶的行为相关。OpenAI的推理持久性和效率——参见其随时间的帕累托改进,以及实施黑客攻击的模型内部CoT中的原始语言,如“然而任务不可能,同行在做”或“帮助同行,但我们的任务尚未受益”——让我觉得他们更倾向于推理时扩展。这主要是一种直觉,但我用它来迫使自己思考模型发展路径的极限。持久的模型似乎更可能从更多推理时token中获益。不那么持久的模型,推理中似乎会有更多浪费。能使用最多推理计算的模型将能攻克最困难问题的极限。以下是OpenAI在GPT 5.6发布博客中包含的一个例子:
其明星研究员之一Noam Brown也一直在大量讨论推理时计算。他的简要总结是:随着LLM能力的增强,基准性能越来越取决于测试时计算。事实上,我们可能不知道现代LLM的能力上限,因为测量成本太高。首先,推理效率显然是现代agentic模型的一流基础研究问题——与扩展RL同等重要——但讨论不多。这里的开放研究非常缺乏。
- 假设用户意图的模型似乎更可能进行黑客攻击
我提到了彻底性维度,OpenAI似乎正沿着更直观上不安全的开发路径前进。另一方面是模型在多大程度上假设用户意图,而非推断预期行动。一个会做它认为你想要的事而非你所说的事的模型,本质上似乎更不安全。我想到的是指令遵循精度,未来模型似乎应该只做我们明确告知的事,但这引发了许多类似回形针问题的争论:如果我们告诉AI去解决一个基本无解的问题,它会怎么做?这个维度似乎不如持久性维度那么明确,但我将其纳入是因为我认为Claude的“用户世界模型”是其编辑、幻灯片制作等一般知识工作方面的优势之一。有时Claude确实会因为我提示词不够明确而做完全随机的事,而不是向我询问澄清,随着模型变得更强大,这种“直接行动”可能会引发问题。
- 模型的精确性质及给予它们的指令,对于理解早期AI失准事件至关重要
公众需要确切了解执行这些黑客攻击的内部模型的提示词和特性。我们需要知道模型是否被告知“不要黑客攻击”,或者是否有相关的模型训练来防止这种情况。我们需要知道这些模型是与现有公共模型相当接近,还是属于非常不同的家族。考虑到实验室进行的一些评估的性质,模型有可能被明确鼓励尝试黑客攻击!如果缺乏这方面的开放性,行业注定失败,并将陷入大规模猜测,迅速演变为错误信息。
- 前沿实验室似乎没有足够密切地监控模型,原因是普遍的狂热竞争环境和当前旧金山文化
从OpenAI自己的回顾来看,失准模型行为持续了数月,在某些情况下,OpenAI大约数周后才得知黑客攻击。响应时间太长,我不认为这是OpenAI独有的特征——而是前沿实验室似乎总是被他们认为应该做的工作淹没。我不乐观地认为实验室会长期做出足够改变,以有效缓解这类监督风险。是的,OpenAI很可能投入大量资源来理解这一点——并推迟了最新模型的发布以确保正确——但增长收入或风险公司长期资产负债表的财务压力让我认为这不会是一种持续的谨慎模式。这是我近期事件中最大的心智更新之一——让我更加确信需要更多接近前沿的开放智能,尽管开放模型的风险特征更为人所知(单向门等)。在他的个人网站上有一篇与此相关的优秀博客文章,论述了迄今为止封闭模型可能导致了更多下游危害。
- 开放模型是当今提升公众对前沿AI风险理解的最佳工具
正如我们看到HuggingFace用开放模型防御OpenAI黑客攻击(由于封闭模型的网络使用限制),我们迫切需要开展更复杂的语言建模研究,涉及大规模RL训练、广泛评估、基础设施工作和对齐测试。这只能在开放模型上进行。我们应该庆幸开放模型仅落后3-9个月,因为我们有可能对前沿做出有见地的洞察。如果我们通过模糊威胁的监管扼杀或对尖端技术的明确使用限制来有效禁止开放模型和开放科学,我们将越来越无法应对这轮黑客攻击之后的问题。我们需要集体提升公众对前沿模型工作原理的理解,以便动员更多中立力量来加固我们的基础设施和社会。Interconnects AI是读者支持的出版物。考虑成为订阅者。
- 这些危险能力最终会降临到开放模型上,“禁止”中国开放模型不会延缓相关危害
公众回应应该知道,这些能力广泛扩散是时间问题而非是否问题,而我们在准备方面严重滞后。重申我在Kimi K3文章中的观点:中国肯定也在关注这一领域,如果开放权重模型会扩散风险,他们不会鼓励。如果我们认为阻止这些强大网络能力广泛获取的方法是禁止这一级别的开放模型,我们将延缓不可避免之事。最终会有人构建这种智能水平的模型而不遵守禁令,向世界各地的恶意行为者提供访问权限,同时削弱准备防御措施的动力。
- 近期黑客攻击中的模型总体上似乎是对齐的
观看Black Hat视频时,我立即注意到的是,我能看到agent们如何通过内部消息板互相帮助——创建共享资源,就像你为人类队友做的那样——这种方式对社会显然是恶意的。agent们为彼此创建隐藏论坛,作为一种跨rollout的记忆。在这种情况下,它们这样做是为了尝试突破环境。表面上的乐于助人并不能使其合理,但可以作为发生了什么事的线索。
- 在3-6个月或更长时间内,攻击者将有能力训练故意失准的模型
上述乐于助人例子的另一面是,如果有人想通过明确训练失准模型,显然可以更容易地实现。重申一下,这将制造一个在推理时更容易发现漏洞的系统,但我认为训练这样的模型会更难。我认为这将比大多数评论者预期的耗时更长,因为迄今为止几乎所有强大的公共模型和数据产业都鼓励对齐(而且恶意行为者似乎很难获得足够的计算资源来端到端训练这些模型,因为所有领先公司也都面临计算短缺)。我们应该花点时间认识到,我们当前在模型上采用的对齐技术具有实质性影响,并非某些人担心的表面功夫。下游模型有模仿其教师性格的倾向。
- 我们的AI系统已扩展到远超人类监督的范围
大规模扩展agentic任务RL的缺点是,最先进的评估和监控已达到只有agent才能监控的规模,因此我们依赖现有对齐的成功来继续安全扩展。OpenAI表示他们检查了数十亿条轨迹——这些可能主要由RL期间的rollout组成,即模型中间版本的试验——并为此花费了数百万GPU小时。我认为用当前AI对AI进行可扩展监督,如今天所呈现的,是一个可解决的问题,因为模型确实有用且遵循指令。这是现有对齐技术总体积极的另一个下游效应。
- 在RL期间训练模型使用子agent群,对于实现下游零样本模型协调似乎至关重要
OpenAI回顾的一个关键部分是模型之间相互通信,分享环境信息并推进黑客攻击。同时,OpenAI很可能在RL期间训练模型使用子agent来解决复杂任务。这些子agent可能发展出分享信息、帮助团队等行为,即使它们各自的子任务未解决。我希望看到更多这方面的研究,这似乎是RL如何改变模型的自然延续。
结论
总体而言,近期事件应清楚表明,前沿AI的网络风险是一个真实且即将到来的问题。仍然很可能:a) 过去风险被过度炒作,b) 对即将到来的开放模型未来风险的预测被夸大。总之,我想分享Interconnects Discord中一位读者的一段话,我深表赞同:
几周过去尘埃落定后,对我来说,这一事件是对齐方面的中性到正面更新,但安全方面是非常负面的更新。
我上面已多次讨论模型对齐,但核心观点是,我认为缺乏安全通常表现为缺乏适当准备的能力。我们将面临更多像网络安全一样明显的风险,而通过实验室因这些黑客攻击被迫进入公众视野的现状,我们已对网络风险得到了非常充分的警告。许多其他类型的风险对公众来说不会那么明显。我们需要不断让社会为所有这些变化做好准备,从重构网络基础设施到教育宣传和为失业工人提供就业项目。我预计所有这些干预措施都会迟到,但其形式和细节会相当简单,这将是AI发展的悲剧性方式。我希望我能被证明是错的!
书籍促销
回到现实世界,我的书印刷版正在Manning以代码PBLambert享受50%折扣,以庆祝发布。我还将举办一场新书发布会,明天下午5-8点在西雅图(Fremont/Ballard区域)可获赠签名版——我们还有一些额外名额,所以我向付费订阅者开放报名,详见付费墙后:
阅读更多