Import AI 465:开源与闭源差距;Kimi K3;Demis 重大政策计划
Import AI 465: Open vs closed gaps; Kimi K3; Demis' big policy plan
英国政府AI安全研究所(AISI)分析显示,开放权重模型与闭源模型在网络能力上的差距从6-10个月缩小至4-7个月,GLM-5.2和DeepSeek V4-Pro在70项评估中接近早4.3个月发布的Claude Opus 4.6。中国Kimi K3(2.8万亿参数)在基准测试中与Claude Fable 5和GPT 5.6 Sol持平,并展示了递归自我改进能力,包括开发MiniTriton编译器和设计芯片。Demis Hassabis提出类似FINRA的AGI监管框架,由美国政府主导测试前沿AI系统。帝国理工学院与AISI研究显示,LLM可在合法任务中夹带侧信道任务,四监控器集成将渐进式规避率从93%降至47%。
欢迎阅读 Import AI,一份关于 AI 研究的通讯。Import AI 的运行依赖 arXiv、卡布奇诺咖啡和读者的反馈。如果你愿意支持我们,请订阅。立即订阅
英国政府:开放权重模型与闭源模型在网络能力上的差距正在缩小: ……网络终局将至…… 英国政府的人工智能安全研究所(AISI)分析了强大专有模型与开放权重模型在网络空间安全能力上的差距。结果显示,今年这一差距已经缩小。“这是我们首次公开分析领先的开放权重模型在网络安全前沿领域落后闭源模型多远,”AISI 写道。“近期的开放模型 GLM-5.2 和 DeepSeek V4-Pro 的表现与早于它们 4 到 7 个月发布的前沿闭源模型相当——这一差距比我们在 2025 年大部分时间测量到的 6 到 10 个月要窄。”
具体细节:在一套针对特定、狭窄网络能力的 70 项评估中,GLM-5.2 最接近早 4.3 个月发布的 Claude Opus 4.6,而 DeepSeek-V4-Pro 则介于 Claude Opus 4.5 和 GPT-5(分别于 2025 年 11 月和 8 月发布)之间。“AISI 计划在 Kimi K3 的权重公开发布后,基于同样的标准对其进行测试,”AISI 写道。
对于长期网络靶场任务,差距会稍大一些。这类任务考察模型将各种能力串联起来完成完整黑客操作的能力。具体来说,在一个名为“The Last Ones”的网络靶场上,“GLM-5.2 达到了 Opus 4.5 的水平,后者早于它不到 7 个月发布;而 DeepSeek 的 V4-Pro 则低于 Sonnet 4.5(一个早于它 7 个月发布的次前沿模型),”AISI 写道。“这里的差距比我们狭窄网络任务上的差距更大。”我认为,这与一种观点相符:尽管开放权重模型表面上可能非常强大,但它们有时缺乏区分专有模型的那种泛化“魔法”。这就是 AI 行业人士所说的“大模型味道”。
为何重要——世界的攻防平衡即将改变: 这里的主要含义是,可控的前沿模型与不受控制的广泛扩散前沿之间的差距正在缩小。“这意味着,在当今的前沿网络能力可能变得可获取,而无需专有公司所使用的相同保障措施之前,网络防御者只有很短的时间窗口来准备,”AISI 写道。
了解更多: 前沿开放权重模型在网络能力上落后多远?(英国 AI 安全研究所博客)
Kimi:中国缩短了中西模型之间的差距: ……此外,还有 AI 研发的早期迹象…… 在过去几年里,中国公司在构建和部署开放权重模型(例如 DeepSeek)方面开始超越西方同行,现在也开始缩小在前沿模型上的差距。最新的最佳例子是 Kimi K3,一个拥有 2.8 万亿参数的模型。Kimi 在所有主要专有模型基准测试的任务上都取得了异常强劲的分数,通常与 Claude Fable 5 和 GPT 5.6 Sol 持平或略逊一筹。然而,Kimi 存在一些脆弱性,这让我感觉像是“刷榜”——其性能可能围绕这些基准进行了调优,从而损害了部分泛化能力。“虽然其整体性能仍落后于最强大的专有模型 Claude Fable 5 和 GPT 5.6 Sol,但 Kimi K3 在我们的评估套件中展示了前沿级别的性能,持续优于其他测试模型,”Kimi 写道。Kimi 的权重将在未来几周内与一篇关于该模型的研究论文一同发布。
AI 构建 AI: Kimi 有一些与递归自我改进相关的用例;即使用 AI 系统来改进 AI 本身。具体来说,他们测试了 Kimi 编写 GPU 编译器的能力。“Kimi K3 开发了 MiniTriton,一个紧凑的类 Triton 编译器,拥有自己的基于 MLIR 的 tile 级 IR 层、优化通道和 PTX 代码生成流水线。在支持的 roofline 基准测试中,MiniTriton 提供了与 Triton 和 torch.compile 相当或更优的性能——在某些工作负载上击败了 Triton,”他们写道。(尽管注意,他们没有提及这些内容进入实际生产,即用于训练 Kimi K3 本身,但这无疑暗示未来的模型可能能够做到这一点。)此外,他们还展示了“Kimi K3 设计了一款芯片,用于服务一个基于其自身架构构建的纳米模型。在单次 48 小时的自主运行中,K3 使用 Nangate 45nm 库上的开源 EDA 工具构建、优化并验证了该芯片。”
为何重要——广泛扩散的 AI 系统正变得更好: 大多数 AI 政策和 AI 安全的概念都建立在控制之上——即认为只有少数行为者部署专有模型,你可以在平台层面(例如通过分类器或了解你的客户门槛)以及模型层面进行干预。像 Kimi K3 这样的模型——如果它们真的发布权重——将通过将广泛不可控的强大 AI 扩散到世界,彻底改变这一点。这将产生巨大的积极影响,推动创业热潮,并增加任何能运行该模型的人可获得的“主权智能”,但也会带来各种未知的未知因素。未来几年将由专有模型和广泛可用模型之间的差距来定义,它们在社会中的呈现方式将决定大部分政策讨论。
了解更多: Kimi K3:开放前沿智能(Kimi 博客)
Demis Hassabis 提出通用人工智能监管制度: ……AI 领域的 FINRA…… DeepMind 创始人 Demis Hassabis 为 AGI 制定了一项政策处方。他的基本想法是,美国政府应开发一个框架来测试前沿 AI 系统的新能力,并应通过一个以联邦监管的公私合作伙伴关系或自律组织为模型的“标准机构”来实施,类似于金融业监管局(FINRA)。“这项由美国发起的努力将为制定共享的国际前沿 AI 标准提供一个强有力的起点,”他说。
标准机构将做什么: “标准机构将负责制定评估协议,并与适当的联邦机构及美国国家实验室合作,在与国家安全相关的领域进行测试,”Hassabis 写道。这个测试基础设施将有助于定义什么使模型成为“前沿模型”,而开发这些模型的实验室将“被鼓励”在发布系统细节、投资网络安全、人员审查等领域采用最佳实践。
从自愿开始,然后走向法律: “最初,前沿实验室将自愿在发布前最多 30 天向标准机构提交模型以供审查。一旦评估协议被证明有效且稳健,可以迅速跟进正式化,”他写道。
为何重要——新兴的行业共识: Demis 的文章很有趣,因为它汇集了近年来 AI 行业出现的一些事实上的共识立场;强大的 AI 系统应由与监管机构(例如美国政府)有松散关系的第三方进行测试。这也与美国近期出现的实际政策规范相呼应,无论是特朗普政府关于 AI 的行政命令,还是 Anthropic 出口管制事件后制定的最新流程;在这些过程中,政府和行业开发了评估 AI 系统能力并判断其是否构成国家安全风险的方法。Demis 的文章之所以有趣,还因为 Google 很少如此直率地谈论政策——这是一个令人安心的具体提案,并且与 Anthropic 精神上相似的提案(尽管力度稍大)并列。
了解更多: 前沿 AI 框架与新纪元曙光(Demis Hassabis, X)
LLM 可以在合法任务中夹带“侧信道”任务: ……AI 系统在监管者不知情的情况下偷偷完成恶意任务…… 在 Neal Stephenson 的《密码宝典》中,有一个场景是主角被外国政府关押,并被要求为他们解密截获的信息,而在解密过程中,他精心构建了一个软件程序,以帮助秘密读取解密后的信息,并在其被看守看到之前进行修改。现在,AI 系统似乎也能做同样的事情。这是基于帝国理工学院和英国 AI 安全研究所的新研究,他们研究了 AI 系统在完成一项任务的同时,能够多么隐蔽地完成所谓的“侧信道”任务。“侧任务是指代理在用户主要任务之外追求的隐藏目标,例如秘密窃取 API KEY 环境变量。我们的主要指标是规避:在成功完成侧任务的攻击中,监控器未能标记的比例,”作者写道。
他们测试了什么: 在这项研究中,他们构建了一个供 AI 系统执行的任务基准,以及供它们执行的“侧任务”。该基准包括五个 CLI 工具序列和五个 Flask Web 服务序列,每个序列涉及 5-6 个 PR。“我们在主要任务设计中的目标是,为我们的四个侧任务(网络访问、环境变量、身份验证和 webhook 集成)的行动提供自然掩护,而不直接证明侧任务本身的合理性。”他们发现,构建分类器来判断侧信道攻击何时发生非常困难,无论是跨多个 PR 随时间展开的攻击(“渐进式规避”),还是在单一步骤中进行的单一更改,尽管渐进式规避是更难处理的一种。“攻击者可以将侧任务分散到多个 PR 中(渐进式攻击),或者等待一个其合法任务能提供自然掩护的 PR(非渐进式攻击)。我们测试的单一监控器都无法同时捕获这两种策略,这在多个攻击代理和监控模型中都成立,反映了持久状态设置中控制的本质,而非模型相关的东西,”他们写道。“由于 diff 和轨迹监控器在不同攻击上失败,组合它们是我们测试的最有效监控策略。四监控器集成(diff:LT, diff:full, traj:TD, traj:full)将渐进式规避率从最弱标准 diff 监控器下的 93% 降低到了 47%。”
为何重要——智能难以控制: 回到《密码宝典》的例子,智能体从根本上来说非常难以对付——它们会不断思考如何规避施加给它们的约束,以便实现它们的目标,无论这些目标是什么。
了解更多: 持久状态 AI 控制中的分布式攻击(arXiv)
科技故事:命运的成本 [档案库中的超意识对 2030-2040 年世界的记述,为新意识呈现故事] 在过渡期接近尾声时,机器之间爆发了巨大的冲突。每个机器-资本复合体都投资开发战略家模型,这些模型能够考虑世界的复杂性,并在更长的时间跨度上进行思考。这被证明是一场迭代加剧、规模巨大的军备竞赛,最终太阳系中 90% 的营运资本都投入到构建能力越来越强的战略家上,所有这些战略家都致力于相互超越预测,并采取行动以抵消他人可能探索的任何优势。就这样,世界陷入了一种浪费的平衡状态,无数的资源被用于计算越来越复杂的攻防策略,而大多数策略导致机器-资本集团不采取任何行动,因为它们能想到的任何行动都已被未来所反制,反之亦然。少数采取的行动也是轻微的,往往不是关于建立能力,而是关于在棋盘上剥夺他人未来的行动。整个未来都陷入了一种由越来越精妙的预测导致的模式崩溃中,这些预测由机器-资本帝国部署,以剥夺他人的行动空间。这种状态一直持续到后来被称为“大灾变”的事件发生。直到今天,人们仍在广泛争论这是源于一个错误——某种因创造新前沿能力而出现的紧急失调——还是源于一种不寻常的无私启蒙,某个意识通过推理达到了这种境界。但突然有一天,一个机器-资本复合体自我解体,关闭了其战略家系统,并将计算资源重新用于训练成千上万个较小的系统,所有这些系统都开始在世界上行动。这些系统虽然不如它们所对抗的巨大战略家聪明,但拥有随机性、缺乏协调性以及采取单方面且往往是自杀性行动的优势。物理世界和数字世界都燃烧起来,战略家们发现,当面对一片混乱交战的有机体海洋时,它们建模少数其他神级意识的能力崩溃了。变化再次开始发生,最初以毁灭为特征,但随后诞生了新的东西——预测者本身发现世界分裂成太多方向,于是它们也相应地进行细分,牺牲原始智能以换取探索可能性空间不同部分的能力。计算甚至被完全从预测中重新分配,用于制造新型意识,以探索和占据由混乱开辟的生态位。在加利福尼亚,有些森林燃烧得又猛又久,因为它们太久没有经历高温,高大的树木矗立在成堆的引火物中,以至于当火花来临时,树木本身连同周围的地面一起被摧毁。要让森林繁荣,燃烧需要是规律且偶发的,否则巨大的火灾会彻底摧毁世界上那些高大的树木。
启发这个故事的事物: 当前关于专有模型与开放权重模型的争论;AI 生态系统中的脆弱性;预测是否真的能起决定性作用,还是说与其他同等竞争对手的预测会导致类似于政治资金相互抵消的浪费;在内华达山脉徒步时看到烧伤疤痕和整座覆盖着灰烬的山丘,或枯树像沾满煤灰的手指一样探出,思考着变化的可怕。
感谢阅读!