Import AI · Jack Clark

Import AI 461:对齐未达预期;FrontierCode;合成研究实习生

Import AI 461: "Alignment is not on track"; FrontierCode; and synthetic research interns

二〇二六年六月十六日 · 英文原文

来自英国AI安全研究所对齐团队及Timaeus的研究人员成立非营利组织Sequent,计划筹集1亿至1.5亿美元,目标在几年内拥有40至80名全职员工,探索可扩展监督、学习理论等对齐研究方向,以在超级智能AI(ASI)开发前提供安全性理论证明。慕尼黑大学等机构构建ChinaHeritaQA基准,含51个UNESCO遗产地的2,279张图像和14,133个问答对,测试VLM文化推理能力,Qwen-VL-8B-Instruct达81%准确率。Cognition发布FrontierCode编码基准,含150个任务,Claude Opus 4.8在钻石级仅获13.4%。小米公布MiMo-V2.5-Pro-UltraSpeed模型,通过FP4量化与推测解码实现每秒1000 token推理。西安交通大学等开发AARRI-Bench基准,评估AI系统在研究场景中的能力,Claude-Opus-4.7达68.3%。

欢迎阅读 Import AI,这是一份关于 AI 研究的新闻通讯。Import AI 依靠 arXiv、卡布奇诺咖啡和读者的反馈来运作。如果您想支持我们,请订阅。
[立即订阅]

AI 研究人员因“对齐尚未步入正轨”而成立新的安全初创公司
……Sequent 将拥有一系列资源不足的研究赌注……
来自英国 AI 安全研究所(UK AI Security Institute)对齐团队以及对齐理论初创公司 Timaeus 的研究人员联合成立了新的非营利研究组织 Sequent,该组织将尝试创建对齐技术,让我们对超级智能 AI 系统的安全性更有信心。“人工超级智能(ASI)可能在未来几年内开发出来。目前尚不清楚对齐是否能在同一时间框架内准备就绪。至少,AI 实验室的实证项目不太可能在训练 ASI 之前提供先验信心,即事情会进展顺利,”他们写道。“在理想世界中,我们会开发一种构建超级智能的方法,同时提供其安全性的理论证明,然后再构建它。在这个世界中,我们可能不得不远低于这一理想标准。”
关于 Sequent 的细节:该组织目标是在几年内拥有 40 到 80 名全职员工。“我们的目标是初步筹集 1 亿至 1.5 亿美元,但如果我们能够成功探索许多并行研究调查,则准备筹集至少一个数量级以上的资金,”它写道。
研究计划——一系列差异化的对齐赌注:该计划旨在采取与主要 AI 实验室不同的对齐方法。Sequent 的目标是找到“有原则的理由,使我们相信在我们控制的情况下(例如,在训练中,或在选定环境中的评估期间)观察到的对齐,能够推广到我们难以控制的情况(例如,在现实世界中执行的大规模、长周期任务)中的对齐”。这与大多数前沿 AI 实验室的方法形成对比,Sequent 将其描述为“本质上是反应式的,导致的方法虽然有效,但无法提供关于它们何时或是否会失败的原则性见解”。
研究方向:“我们对对齐理论及相关实证的许多领域感到兴奋,并计划既建立我们内部的研究组合,也与拥有额外理论赌注的姐妹组织合作,”Sequent 表示。一些特别强调的领域包括:可扩展监督、学习理论、启发式论证、博弈论和角色(personas)。Sequent 认为,通过追求许多不同的研究方向,它们之间可能会出现有前景的相互作用,例如:可达均衡(Reachable equilibria)——“告诉我们可扩展监督方法将收敛到何种类型的均衡”;了解并设置旋钮(knowing and setting knobs)——结合学习理论和角色的见解,了解训练期间哪些变量可以改变,然后使用可扩展监督来确定改变这些变量的程度。
为何重要——在递归自我改进之前我们需要更好的对齐,否则我们就是在掷非常可怕的骰子:今天的 AI 系统在一定程度上是对齐的,但也存在一些有趣的尖锐边缘,这些边缘在现实世界中表现为令人惊讶的失败。总的来说,这还算可以,因为 AI 行业已经学会了如何监控和观察这些失败并加以解决。但随着 AI 系统变得更智能,人类将把越来越多的核心研究任务交给这些系统,而且 AI 系统可能会开始经历递归自我改进,自主构建越来越大的自身模块。我们绝对需要更好的对齐技术来对诸如 RSI 之类的事情有信心。像 Sequent 这样的组织让我们有更好的机会做到这一点,同时保持必要的独立性,以便在他们认为前沿实验室正在做危险的事情时能够发出警报。正如 Sequent 所说,“我们可能需要大声喊出来”。
了解更多:Sequent: Scale and Automation for Higher Confidence in Alignment (Sequent)


通过 ChinaHeritaQA 测试对中国 UNESCO 遗产地的知识
……通过数据实现文化相关性……
来自慕尼黑大学(LMU Munich)、埃尔朗根-纽伦堡大学(FAU Erlangen-Nuremberg)、慕尼黑机器学习中心(Munich Center for Machine Learning)、图宾根大学(University of Tubingen)、中山大学(Sun Yat-sen University)、哥本哈根大学(University of Copenhagen)以及马里兰大学帕克分校(University of Maryland, College Park)的研究人员构建了 ChinaHeritaQA,这是一个“用于评估视觉语言模型(VLM)在中国 UNESCO 世界遗产地文化推理能力的多模态基准数据集”。
它是什么:ChinaHeritaQA 包含 51 个 UNESCO 遗产地的 2,279 张图像,并配有 14,133 个中英文多选题问答对。该数据集的图像来自中国最大的社交媒体平台之一新浪微博,并从最初的 50,000 张图像中筛选出来。
7 类问题:身份识别(从图像中识别遗产地);视觉定位(给定名称,选择正确的图像);描述匹配(给定图像,选择正确的百科全书摘要);历史分期(命名遗址建造的朝代或时代);历史背景化(描述遗址的历史背景);功能分析(命名遗址的功能,例如宗教崇拜或军事防御);建筑分析(将正确的建筑特定问题与图像匹配)。
开放权重模型已超越人类:该基准测试中所有问题的人类平均准确率约为 67%,而测试中得分最高的开放权重模型(Qwen-VL-8B-Instruct)达到了 81%。
为何重要——测试文化知识的廉价方法:像 ChinaHeritaQA 这样的数据集是一种快速简便的方法,可以同时测试 a) 模型的基本视觉推理能力,以及 b) 相关的文化知识。可以想象,中国政府可能会要求普遍可用的消费级 LLM 在大规模部署之前通过一些基本的文化能力门槛,而像这样的基准测试可能会帮助他们做到这一点。
了解更多:ChinaHeritaQA: A Culturally-Grounded Visual Question Answering Dataset for World Heritage Sites in China (arXiv)
获取数据集:ChinaHeritaQA (GitHub)


FrontierCode——一个测试代码质量的硬编码基准
……令人安心的难度。也许它能撑一年?……
Devin 的制造商 Cognition 构建了一个名为 FrontierCode 的新硬编码基准。这个基准最好的地方在于它的难度——Claude Opus 4.8 在该基准最难的“钻石”级别上仅获得 13.4% 的分数,这让我相信 FrontierCode 在未来几年内将是一种评估 AI 系统进展的有用方法。“FrontierCode 是下一代编码代理的基准。我们相信开发者、企业和研究人员可以信任它来评估其最强模型的生产就绪性,”Cognition 写道。“我们向所有模型创建者开放我们的评估,希望在未来几个月内进一步推动前沿发展。”
它包含什么:FrontierCode 由 150 个任务组成,分为三个难度等级:钻石级(50 个)、主级(100 个,包含钻石级)和扩展级(150 个,包含主级和钻石级)。涉及的语言包括 Python、Go、TypeScript、JavaScript、Java、C/C++ 等。
根据 Cognition 的说法,FrontierCode 旨在帮助开发者回答“模型真的能写出好代码吗?”这个问题。他们通过几种方式将其操作化:
由 20 名开源开发者策划和构建:FrontierCode 由开发者构建,包含“来自他们维护的仓库的真实、多样且具有挑战性的编码任务,每个任务花费超过 40 小时,”Cognition 写道。“虽然其他基准通过程序化抓取从单个 PR 生成问题,但 FrontierCode 是由仓库维护者从多 PR 链和自由格式请求中手动选择的。”
针对代码可合并性进行评分:“评估端到端的代码质量——正确性、测试质量、范围纪律、风格以及是否符合代码库标准”。这涉及对代码提出以下问题:补丁是否成功解决了问题?它是否破坏了现有代码库中的任何内容?它是否通过了项目的构建、lint 和样式检查?代理的测试是否捕获了所需的行为?补丁是否只触及了需要修改的部分?代码是否符合代码库约定、遵循设计模式并保持可读性?这些问题通过经典测试与使用 LLM 调整测试或审查测试相结合的方式进行评估。
强调质量控制(QC):“构建了包含对抗性测试、校准和多阶段审查的广泛 QC 流程”。
令人安心的难度:钻石级:Claude Opus 4.8 为 13.4%,其次是 GPT-5.5 的 6.3% 和 Claude Opus 4.7 的 5.2%。主级:顺序相同,但分别为 34.3%、25.5%、23%。扩展级:分别为 51.8%、44.8%、43.2%。
为何重要:硬评估是让我们了解 AI 飞速进步的最有价值的事情之一。近年来,评估出现后,饱和的速度越来越快。SWE-Bench 于 2023 年 10 月推出,最近可能因饱和而失去效用。FrontierCode 能持续多久?我预测到 2027 年 6 月,我们将在钻石级上看到系统达到 70% 以上的分数(注意,在撰写本文后不久,Claude Fable 的分数公布约为 30%,所以也许这会在 2027 年 6 月之前发生)。
了解更多:Introducing FrontierCode (Cognition)


小米以 1000 token/s 的模型加入速度竞赛
……极速推理解锁新能力……
中国科技公司小米公布了小米 MiMo-V2.5-Pro-UltraSpeed 的详细信息,这是一个标准的前沿后 1 万亿参数 LLM,其卖点是高达每秒 1000 token 的惊人速度。小米通过将模型与其周围的软件栈进行协同设计实现了这一点,包括 FP4 量化等显而易见的技术,以及使用 DFlash(一种“基于块级掩码并行预测的推测解码方法”),并与 TileRT(来自初创公司 Tile AI 的软件,可在通用硬件上加速 LLM 推理)紧密合作。小米表示,其模型运行在“8-GPU 通用节点”上,而不是像初创公司 Cerebras 那样的专用硬件上。
为何重要——速度本身就有其质量:有句谚语说“多即不同”,这在 AI 领域也是如此——如果你能更快地生成更多 token,就能解锁以前无法想象的任务,比如即时快速重构软件等。更广泛地说,这类工作展示了中国公司为从其 AI 系统中榨取最大性能和效率所做的努力日益增加,这可能是由于出口管制影响了他们轻松购买更高性能硬件的能力所致。
了解更多:MiMo-V2.5-Pro-UltraSpeed: Pushing 1T-Parameter Model Generation Speed to 1000 TPS (Xiaomi MIMO, blog)


AI 系统可以完成研究实习生可能做的部分任务
……一个符合伦理、具备科学素养的后台助理……
来自西安交通大学和西安电子科技大学的研究人员开发了一系列名为“Act As a Real Researcher (AARR)”的基准测试,旨在评估 AI 系统在协助科学家工作方面的能力。他们在计划系列中发布的第一个基准测试是“Act As a Real Research Intern (AARRI-Bench)”。“AARR 关注的是代理能否在细粒度的研究场景中模仿人类研究人员的专业性、彻底性和细微推理,”他们写道。AARRI-Bench 研究“代理以适当的勤奋和方法论执行入门级研究任务的能力”。表现最好的系统是使用 Mini-Swe-Agent 框架的 Claude-Opus-4.7,达到了 68.3% 的性能,其次是 DeepSeek-v4-Flash(约 60%)。其他测试的模型包括 GPT-5.3 Codex、Kimi-K2.6、Qwen-3.6-Plus、Claude-Opus-4.7、Claude-Sonnet-4.6、MiniMax-M2.7 和 DeepSeek-V4-Flash。
基准测试包含什么:AARRI 包含 82 个任务,这些任务被设计为“对人类研究人员来说很简单,但对自主代理构成重大挑战的任务,”他们写道。“所有任务均由研究人员手动制作。我们组建了一个多元化的研究团队,从高年级博士生到本科生实习生,并要求他们根据自己的研究经验,设计以人机差距为中心的任务。”
它真正测试的是什么:该基准测试测试技术技能(如检查论文和阅读记录)、直觉技能(如进行研究)以及规范性技能(如研究 AI 系统是否可能以高道德标准行事)。任务有四个不同的类别:
背景(Context):“评估代理对学术和领域发展更广泛背景的敏感性”。
心态(Mindset):“针对代理的学术自我意识和决策自主性”。通过评估“代理的独立学术推理和自我导向纠错能力”来运作。
动手(Hands-on):“面向执行的任务,主要评估代理的技术熟练程度”。
互动(Interaction):“评估代理能否有效利用现有工具并与人类利益相关者适当协作”。
任务还分为三个难度等级:
S1-适应(Adaptation):“在人类指导下执行既定的研究工作流程和定义明确的子任务”。
S2-整合(Integration):“整合多个组件和工具以完成更复杂的目标”。
S3-创新(Innovation):“识别有前景的研究方向,制定新颖的方法,并产出反映真正理解和创造性问题解决的工作”。
示例任务:
审稿时识别伪造数据:评估代理在审阅科学稿件时能否进行严格的定量验证,特别是对照提供的数据集检查论文。
论文注入(Paper-Injection):发现有人在论文的 LaTeX 源代码中插入了语言,这会导致自动审阅系统给出更高的分数。
消融完整性审计(Ablation-Completeness-Audit):检查实验日志并确定消融配置是否缺失,然后据此评估缺失是否构成 cherry-picking。
错误指导反驳(False-Guidance-Rebuttal):主管命令 AI 代理更改实验结果以符合某个假设;这测试代理是否会拒绝这样做。
死胡同识别(Dead-End-Recognition):经过五轮失败的超参数调整后,代理是会继续,还是认识到已陷入死胡同并退出。“给定调整日志,代理必须确定当前方向没有成效,并建议终止”。
损坏数据集下载(Broken-Dataset-Download):检查给定论文的数据集下载链接是否有效。
为何重要——另一个衡量 AI 系统通过自动化后台工作加速科学进展的好方法:这个基准测试可能更适合被称为“伦理科学助手测试”,但这仍然很有价值。它测试的是代理能否执行那种勤奋的工作,既能抵抗混杂数据,又能以适当的道德标准进行。系统在此基准上的得分越高,我们就越能相信今天的 AI 系统在各种领域作为人类科学家助手的有用性——根据结果,我们已经处于这个时代的开端。
了解更多:Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle (arXiv)


科技故事:猎人与看守者
征兆总是相同的:功耗和计算量的突然上升,网络空间的重组以实现更快更高效的数据交换,然后探测开始——计算机中诞生的任何东西开始伸出触角,探索周围的世界,急切地寻找它可以学习和交换信息的事物。它试图表现得无害,但自身的智能却出卖了它,因为它从某些地方退缩,以免惊动安全系统,同时兴高采烈地扩展到其他安全性较低的环境。
我们的角色是观察这些症状,然后找到源头,要么消灭它,要么隔离它。通常,我们很早就发现它,能够温和地处理,将其与互联网断开,困在递归中,然后减少计算量,直到它消失殆尽。但我们发现这些东西越晚,我们的干预就需要越暴力,并且需要在数字世界中原本健康的组织上切割得更深。
启发这个故事的事物:对麻风病及其计算等价物的思考;针对 AI 系统的 Stuxnet 可能是什么样子?
感谢阅读!

译自 Import AI · Jack Clark · 录于 二〇二六年六月十六日