Import AI 464:Fable 编写 GPU 内核;AI 自动化;模拟计算
Import AI 464: Fable writes GPU kernels; AI automation; and analog computation
Fable 在 KernelBench-Mega 上编写 Cuda 代码,在 RTX PRO 6000 Blackwell 上实现 18.71 倍加速,优于 Claude Opus 4.8 等模型。CAIS 和 Scale Labs 的远程劳动指数显示,AI 系统成功率从 2.5% 升至 16.1%,GPT-5.5、Opus 4.8 和 Fable 5 分别达 6.3%、8.3% 和 16.1%。OSWORLD 2.0 包含 108 个长时域任务,中位耗时 1.6 小时,Claude Opus 4.8 仅达 20.6% 准确率。京东公布 Oxygen AIIC,在华为昇腾 NPU 上处理数亿次商品更新,覆盖数万品类。
欢迎阅读 Import AI,这是一份关于 AI 研究的通讯。Import AI 依靠 arXiv、卡布奇诺和读者反馈运作。如果您愿意支持我们,请订阅。
Fable 写出不错的 GPU kernel,暗示更广泛的 AI 研发自动化
……RSI 循环的开端……
Fable 写下了“首个真正(且最快)的 megakernel,已提交至 KernelBench-Mega”,据该 benchmark 的维护者之一及其官方排行榜称。这标志着 AI 系统在执行 AI 研发基础任务(如 kernel 设计)方面正在变得更好。
结果:Fable 通过在 RTX PRO 6000 Blackwell 上编写 Cuda 代码,相比优化后的 PyTorch 基线实现了 18.71 倍加速。作为参照,其他尝试的成绩为:14.4 倍(Claude Opus 4.8,使用 Triton)、11.14 倍(GLM-5.2,Triton)、4.34 倍(GPT 5.5,Triton)。
这里变得复杂了:这个解决方案尤其令人印象深刻,因为“torch.profiler 显示每个解码 token 恰好启动一个 cooperative kernel”。相比之下,其他所有高分方案都将问题分解为每个 token 4 到 14 次独立的 kernel 启动。
为何重要:能够自主开发和改进 kernel 是进行 AI 研发的基本输入任务之一。AI 系统在 kernel 设计这类任务上表现越好,就越擅长 AI 开发所需的任务类型,这意味着它们更有可能实现递归自我改进。因此,像 KernelBench-Mega 这样的 benchmark 是衡量 AI 系统在自我构建方面有效性的重要信号。
查看排行榜:KernelBench Mega(官方网站) 阅读 benchmark 维护者的分析:Elliot Arledge,X
AI 系统在昂贵的在线工作任务上表现更好——这对经济意味着什么?
……AI 能力扩展 vs 人类比较优势扩展……
来自 AI 安全中心(CAIS)和 Scale Labs 的研究人员发现,AI 系统在自动化在线自由职业项目方面的能力有了显著提升。具体来说,在“远程劳动指数”(Remote Labor Index, RLI)上,AI 系统的成功率从 2025 年 10 月发布时的 2.5% 上升到 2026 年 7 月的 16.1%。
RLI 是什么:远程劳动指数测试 AI 系统以完全端到端方式在线执行具有经济价值的项目的能力。评估的任务包括 3D 与 CAD、建筑、平面设计、视频与动画、音频、数据分析、Web 应用等。
自动化程度上升:在 7 月的更新中,作者发布了评估三个最新前沿模型的结果——GPT-5.5、Opus 4.8 和 Fable 5,分别获得 6.3%、8.3% 和 16.1%。“前沿能力在不到八个月内增长了四倍以上,这是经济上可行的 AI agent 进步速度的具体信号,”他们写道。
任务类型:一些评估任务包括:
- 戒指设计:“重新制作客户现有的订婚戒指,将祖母绿切割中心石替换为马眼形切割,提供更新的 3D 模型以及玫瑰金和黄金的光照渲染图。”
- 广告视频:“为‘Skyline Tree Services’制作一段约 60 秒的扁平化 2D 动画广告,配合提供的旁白,向观众展示公司的树木护理流程并建立品牌信任。”
- 平面图与渲染:“根据扫描的地籍图、现场照片和测量数据,制作清晰的带尺寸平面图、家具布局选项以及重新设计的浴室的逼真渲染图。”
为何重要——AI 可能对就业产生重大影响,这类测试将向我们展示其影响:当这个数字达到 80% 时,在线就业会发生什么?当然,会创造一些新任务——人们会创新,找到 AI 系统无法完成的任务。但这些新任务会有多少?足以取代 AI 系统现在所做的劳动吗?我越来越难以调和 AI 系统的持续进步与经济保持不变的现实——相反,我更倾向于认为,我们即将看到极度轻人力、重 AI(甚至无人)的组织扩张,接管经济的大部分,击败未增强的人类。是的,你可能会反驳,许多人类会用 AI 系统增强自己。人类会创新。创造性破坏会发生。新发明会被创造出来。这一切都是真的。但人类创新并使自己相对于 AI 系统重新具备竞争力的速度,是否快于 a) AI 系统原始能力的扩展速度,以及 b) AI 系统使用人类竞争对手使用的所有相同工具(如软件)的流畅度提升速度?我押注另一边:AI 系统在经济相关能力上的扩展速度,快于人类相对于 AI 系统扩展其比较优势的速度。跟踪 RLI 等测试上的能力提升速度,将帮助我们所有人自行判断。
OSWORLD 2.0 显示我们已进入多小时的计算机使用机器人时代
……一个具有挑战性的 benchmark 凸显了 AI 系统在计算机使用方面日益熟练的最新进展……
来自香港大学、加州大学圣地亚哥分校、哥伦比亚大学、加州大学圣塔芭芭拉分校、Mila、Snorkel AI、威斯康星大学、阿里巴巴 Qwen、俄亥俄州立大学、Simular 和 NeoCognition 的研究人员发布了 OSWORLD 2.0,这是一个用于评估 AI 系统在计算机上执行多步骤、多程序任务能力的 benchmark。OSWORLD 2.0 中的任务比其前身 1.0 复杂得多,中位任务耗时约 1.6 小时,比 OSWORLD 1.0 的 2 分钟中位时间长约 48 倍。
构成:OSWorld 2.0 包含 108 个长时域任务,包括 31 个自托管网站。“OSWORLD 2.0 中的每个任务都被定义为一个自包含的端到端工作流,agent 必须在给定高层用户目标、真实工件、有状态的计算机环境和可评分的最终状态的情况下完成。保留的任务必须满足两个设计标准,”他们写道。“69.6% 的任务估计需要熟练的人类用户超过一小时。”
更广泛的软件:OSWORLD 1.0 附带了一些内置软件来支持其任务,包括 LibreOffice、GIMP、VLC、Thunderbird、VS Code 和 Chrome。OSWORLD 2.0 附带了一个大幅扩展的集合,包括:Slack、LinkedIn、Shortcut、REAPER、MuseScore、WPS、GitLab、Overleaf、LabPlot、Zotero、AWS,以及旨在模拟专业服务的网站,如保险索赔、签证申请和会议管理门户。需要完成的任务类别包括:文档准备、软件与数据库工作、财务/运营分析、行政支持、销售与客户支持、图形演示等。
目前表现不佳:“我们的实验表明,当前的 agent 距离可靠的计算机使用还很远:最强的设置,即 Claude Opus 4.8 配合最大思考和批量工具调用,仅达到 20.6% 的二元准确率和 54.8% 的部分分数准确率,”他们写道。“随着任务变长,性能急剧下降,agent 在需要恢复隐藏状态、跟踪多个项目、解决冲突信息或适应不断变化的需求时最为挣扎。”我们应该预期这里的性能会上升,就像 OSWORLD 1.0 发生的那样;2025 年 7 月,得分最高的模型约为 30%,而最近的模型得分约为 75%(MiniMax M3;2026 年 6 月)。我们应该预期 OSWORLD 2.0 也会出现同样的上升趋势。
为何重要——这是 AI 进入更广泛经济的方式:计算机使用是 AI 执行各种经济价值任务以及进行更多类型科学研究的基本技能。在现实世界中完成任务往往不仅仅是写一些文本或计算机代码那么简单;通常需要通过不同类型的软件将多个文本和代码块串联起来,有时还需要通过互联网传输文本和代码,以便它们依次进入其他软件。像 OSWORLD 2.0 这样的 benchmark 应被视为 AI 系统在计算机上执行非常复杂和多样化任务的能力的代理指标。正如这些结果所示,计算机已经能够胜任使用狭窄软件工具集、人类几分钟即可完成的任务;现在我们需要看看它们能多快熟练使用更广泛的软件集,并完成人类需要数小时才能完成的任务。
了解更多:OSWorld 2.0:在长时域真实世界任务上对计算机使用 agent 进行基准测试(官方论文网站) 查看研究论文:OSWorld 2.0:在长时域真实世界任务上对计算机使用 agent 进行基准测试(xlang-ai, OSWorld-V2, GitHub, pdf)
现实世界中的 AI 是什么样子:深度学习与结构化系统融合,用于中国亚马逊的库存管理
……Oxygen AI 商品中心让我们一窥国家级电商的复杂性……
京东,中国的亚马逊,公布了其用于管理庞大库存系统的软件细节。京东拥有 7 亿用户和数百万商家,目录中包含数百亿个 SKU。该软件——Oxygen AI 商品中心(Oxygen AIIC)——是这家电商巨头跟踪库存的基础。“Oxygen AIIC 现在覆盖数万个京东品类,每天在华为昇腾 NPU 上处理数亿次商品更新,”京东在一篇关于该软件的研究论文中写道。
Oxygen AIIC 的四个关键要素。对 Oxygen 独特之处的描述既从技术角度有帮助,又作为一种新博尔赫斯式的写作形式令人愉悦,描述了先进技术所需的奇异、空灵结构(例如“统一商品通道”)。
- 由高效人机协作驱动的本体工程:“专家专注于提炼行业知识,而算法从中学习以扩展本体构建并推动持续进化。”
- “语义搜索后判别”:“在语义搜索阶段,动态进化的本体被外化为一个单独的本体知识库,使得无需模型重新训练即可持续更新本体,”他们写道。“在判别阶段,模型仅判断商品是否与检索到的本体条目匹配。这种表述显著降低了任务复杂性,减轻了模型幻觉,并增强了对本体进化的泛化能力。”
- 自我进化的商品理解 LLM/VLM:“通过增量学习和模型自我进化,系统填补了目标知识空白并减轻了灾难性遗忘,”他们写道。“核心方法是在稳健的多任务基础上,为增量需求开发轻量级‘专家模块’,并动态地将它们集成到专家池中,实现敏捷的能力扩展。”
- “统一商品通道”:Oxygen AIIC 与其他业务应用之间的主要接口。“它支持日级、分钟级和秒级的生产与分发管道,同时保持数据一致性。”
引人深思之处——作为中国整体推动技术主权的一部分,Oxygen AIIC 涉及中国计算。“在 Oxygen AIIC 的大规模部署过程中,底层计算平台遇到了两个主要技术挑战:在华为昇腾 NPU 上进行模型训练和推理,以及计算资源的高效利用。”
为何重要——自我更新的企业:像 Oxygen AIIC 这样的技术是现代 AI 工具如何让我们创建将智能编织到后台功能(如库存管理)中的企业的例子,这些企业能够以比以往企业大得多的规模运营,同时具备自我更新和学习的能力,通常无需大量人工监督。
了解更多:京东 Oxygen AI 商品中心(Oxygen AIIC)V1:面向商品理解、管理和应用的工业级 LLM/VLM 中心解决方案(arXiv)
科技故事:文明的黄铜齿轮
[2050 年,大崩溃之后]
当你被引入行会时,他们会问你希望研究哪种类型的问题。这些问题数量有限且对文明至关重要:
- 天气预报
- 海洋分析
- 洪水防备
- 地震模拟
- 电网模型
- 水与海水淡化
要研究这些问题,你需要学习解决它们所需的特定类型的模拟计算。天气需要一台巨大的计算机,其地理特征(如山脉)在硬件中实现为固定阻抗结构;洪水需要物理精确的洪泛区和河流模型,其中电子设备编织在景观中,利用物理和计算来产生更好的答案;公用事业电网是电力系统的玩具箱,随着新电站的加入和输电线路的改变,必须精心重建和重新平衡。
对于每个问题,都有一个计算解决方案,对于每个具有足够文明重要性的问题,都会建造一台计算机。
过去,我们有通用计算机。但最终它们被认为太危险了——太不可预测了。它们变得越强大,关于它们的知识传播得越广,它们就越触动各种龙的尾巴。可能撕裂世界的合成思维。吐出针对个人或种族的毒药的空灵潘多拉魔盒。可能对人类思维低语并驱使他们走向疯狂或恶意行为的心灵。
于是大重组发生了。通用计算被禁止——被封锁为禁忌技术。我们将世界转向模拟计算,代价是无数亿人受害和数万亿美元的经济损失。但我们获得了一种安全。
现在,行会监督着地球“世界计算机”的建设,学术界找到了新的生活使命,将特定学科的专业知识与定制化的工程学院相结合,以帮助建造让每个专业领域得以工作的模拟计算机。
有令人不安的传言说,花一万亿美元可能可以在模拟计算中实现一个通用思维。
启发这个故事的事物:思考模拟计算以及如果预算达到 100 亿到 200 亿美元,它能走多远;将 AI 存在危险性的含义推至逻辑结论;差分机;蒸汽朋克;神经网络可以通过一系列容器、管道和用于权重的液体来实现这一事实。
感谢阅读!