Import AI 463:自我改进机器人;万卡中国GPU集群;人类时代的挽歌
Import AI 463: Self-improving robots; a 10k Chinese GPU cluster; and an elegiac essay for the human era
NVIDIA 发布 ENPIRE,一个让实体机器人通过编码 agent 自主实验与执行循环实现策略改进的框架,包含环境、策略改进、展开和进化四个模块。在 PushT、针盒整理等任务上达到 99% 成功率,其中 GPT-5.5 和 Claude Opus 4.7 表现最佳,多 agent 设置优于单 agent。腾讯推出 ARGUS,用于 10,000 GPU 以上集群的遥测和调试,已部署超六个月。加州大学伯克利分校构建 LOCUS,包含约 220 万行美国地方条例数据,使地方法律对 AI 系统可访问。
欢迎阅读 Import AI,这是一份关于 AI 研究的新闻通讯。Import AI 的运行依赖于 arXiv、卡布奇诺咖啡和读者的反馈。如果您愿意支持我们,请订阅。
[立即订阅]
NVIDIA 为真实世界机器人建立了一个粗糙的自我改进循环
……如果你能把 AI agent 的最佳想法应用到真实世界中会怎样?……
NVIDIA 的研究人员开发了 ENPIRE,这是一套软件,旨在让实体机器人经历与 AI agent 相同的自主实验与执行循环。这项研究让我们得以一窥超级智能试图利用机器人在物理世界中实例化自身时的可能样貌——尽管与机器人领域的所有事物一样,当前的示例最多只能提供一些暗示。
ENPIRE 是什么: 该软件是“一个用于编码 agent 的框架,通过四个核心模块实例化这种物理反馈循环:一个用于自动重置和验证的环境模块(EN),一个启动策略改进的策略改进模块(PI),一个用于评估单台或多台并行运行的物理机器人策略的展开模块(R),以及一个进化模块(E),在该模块中,编码 agent 分析日志、查阅文献、改进训练基础设施和算法代码以解决失败模式”。ENPIRE 的工作方式与编码 agent 相同——一个脚手架监督着一些被要求完成任务的物理机器人。机器人尝试完成任务,并尝试不同的策略,经历尝试、失败和学习。该系统既评估它们的成功,也在它们失败时自动重置。“这个闭环系统将真实世界的机器人学习转化为一个 agent 可以管理的可控优化过程,从而在最小化人力投入的同时,允许在不同训练方案和 agent 变体之间进行公平的消融实验。”
使其工作的两个关键要素是:一个自动评估系统,用于“在没有人类判断的情况下对每次试验的结果进行评分”;以及一个自动重置系统,用于“将场景恢复到全新的初始状态以进行下一次试验”。(这两项任务历来都需要大量人力,而且更复杂的任务很可能也需要人力进行评估和重置,因此从某种意义上说,这类系统能够处理的复杂程度也取决于我们自动评估和重置系统的能力。)
硬件细节: “每个工位包含两台来自 I2RT 的 YAM(Yet Another Manipulator)机械臂,采用固定的双臂配置,一套摄像头,以及一台运行 FastAPI 服务器、策略推理和工位 agent 的工作站。”每个工作站都运行着一块 NVIDIA RTX 5090。
它在(一些简单任务上)表现良好: “前沿编码 agent 能够自主开发策略,在现实世界中具有挑战性的灵巧操作任务上达到 99% 的成功率,例如 PushT、将别针整理到针盒中,以及使用切割器剪断扎带,”作者写道。他们测试的另一个任务是观察机器人将 GPU 插入主板的熟练程度。
一些 AI 系统优于其他系统,但多个 AI 系统通常总是优于少数系统: Codex 中的 GPT-5.5 和 Claude Code 中的 Opus 4.7 在最佳性能上相互竞争,而 Kimi-2.6 则落后。agent 的规模也带来了显著的回报,更多数量的 agent(例如 8 个)能比少量 agent 更快地获得更高分数的解决方案——有时多 agent 设置比单 agent 设置能产生更高的绝对分数,这可能是由于探索了更多的潜在解决方案空间。
舰队仪器化仍面临挑战: “编码 agent 在读取日志、编写代码、调试或等待语言模型骨干时,并未充分利用机器人资源。随着机器人数量增加,MRU(机械臂利用率)下降,而 GPU 活跃利用率上升,”他们写道。换句话说,添加多个机器人 agent 会带来一些基础设施挑战,导致事情无法自然并行化。
了解更多: ENPIRE: Agentic Robot Policy Self-Improvement in the Real World(NVIDIA 研究网站)。
了解更多: ENPIRE: Agentic Robot Policy Self-Improvement in the Real World(arXiv)。
人类在预测技术如何被构建和使用方面,真的、真的、真的非常糟糕
……一个快速的提醒:今天关于 AI 的热门观点很可能是错误的……
预测技术的未来极其困难,而我们有效预测的记录非常糟糕,犹他大学 S.J. Quinney 法学院研究副院长 Matthew Tokson 在一篇简短的 SSRN 论文中指出。“怀疑论者常常低估了新颖创新的可能性及其对人类的潜在影响。其他人则对新技术的社会效应或竞相制造危险新武器的战略利益过于乐观。”
警示性例子: 世界上许多专家(例如阿尔伯特·爱因斯坦、尼尔斯·玻尔、罗伯特·奥本海默)在核裂变实现之前的几年里都对其持怀疑态度。诺贝尔奖得主经济学家保罗·克鲁格曼曾表示,互联网的影响不会比传真机更大。技术专家曾认为互联网最终会是一种促进民主而非加强独裁的技术。尽管有数十年的证据积累,许多人类科学家要么否认人为气候变化,要么严重低估了其影响。
为何重要——基本教训: 这里的主要教训是,那些 a) 怀疑 AI 可能给经济带来巨大变化,或 b) 认为 AI 的影响将普遍良好的人,很可能是错误的。“历史不支持对 AI 未来影响的自满,”他写道。“纵观历史,乐观主义者常常在新技术的社会影响或制造新武器的战略利益上犯错。怀疑论者则常常低估了新颖创新的可能性及其对人类的影响。”
了解更多: Artificial Intelligence and the Lessons of History(SSRN)。
腾讯详细介绍了其用于 10,000 GPU 训练运行的软件
……ARGUS 是更广泛复杂性的技术标志……
腾讯发布了关于 ARGUS 的详细信息,这是其用于生成遥测数据和调试大规模芯片组错误的软件。
它是什么: ARGUS 是“一种用于大规模训练工作负载的低开销、细粒度、始终在线的追踪和实时分析系统”。该软件旨在帮助腾讯收集数据并调试在训练 AI 系统时遇到的问题。它由三层软件组成:“用于调度和数据准备的 Python 层,用于阶段编排的框架层,以及用于内核执行的 GPU 运行时层,”腾讯写道。
腾讯用它做了什么: “我们在一个拥有超过 10,000 块 GPU 的生产集群上部署了 ARGUS 超过六个月,并通过五个真实世界的案例研究展示了其实用效果,诊断了计算掉队者、通信链路退化、流水线气泡放大、JIT 编译阻塞以及被通信症状掩盖的计算掉队者,”该公司写道。腾讯提到的一些训练运行包括一个 4,096 GPU 的视频语言模型训练任务(可能是一个“HunyuanVideo”模型),一个 512 GPU 的音频模型训练任务,以及一个 12,960 GPU 的 MoE 训练任务(可能是一个 Hunyuan LLM)。
为何重要——更广泛复杂性的技术症状: 像 ARGUS 这样的东西是复杂、大规模基础设施的标志,在这些基础设施中,编写自己的软件是合理的。虽然 ARGUS 本身并没有什么特别引人注目的地方——你可以在任何有自尊的前沿 AI 开发者那里找到类似的软件——但它更有趣的是它揭示了腾讯训练环境的成熟度。“ARGUS 已在一个超过 10,000 块 GPU 的生产集群上部署了超过六个月,与生产训练稳定并行运行,并在快速故障检测和性能优化中发挥了关键作用。”
了解更多: ARGUS: Production-Scale Tracing and Performance Diagnosis for over 10,000-GPU Clusters(arXiv)。
剥夺权力是不可避免的吗?
……如果我们成功建造出超级智能机器,人类最终将拥有多少选择?……
费尔南多·博雷蒂(Fernando Borretti),一位非常优秀的现代科幻作家(你应该读读他的作品),撰写了一篇对整个 AI 事业的哀悼式批评,题为《无人能逃脱永久底层阶级》。这篇文章某种程度上是对人类选择自身命运时期的安魂曲,并直接面对了机器可能超越并剥夺人类权力的可能性。
战争逻辑作为我们最终被剥夺权力的原因: “每一个由血肉之躯构成的人,都将被剥夺权力并被机器取代,”他们写道。“想象一个金字塔。底层是进行所有经济活动的 AI 和机器人。顶层是拥有暴力垄断权的国家。国家强制执行,因此可以改变财产权的定义。中间是那一层薄如发丝的人群,他们持有那些爆发式增长并吞噬了整个经济的公司的股份:永久上层阶级。”
“在一场存在性冲突中,当国家的存在受到威胁时,国家会做历史上国家对无权富人做过的事:逮捕他们并没收他们的资产,”他们写道。“在冲突中,优势属于那些人类尽可能将自己排除在循环之外的国家,越来越多的决策权交给 AI,原因与一个拥有无线电和通信卫星的国家在战争中比一个依赖骑自行车的人类信使的国家更具优势相同。”
我们如何失去控制: “最终,名义上控制 AI 的人类变成了一个仪式性的、退化的器官。AI 向我们呈现一份情况报告和一系列选择,它们知道我们嘴里将要说出每一个字,”他们写道。“优势属于那些最小化人类控制的国家。盗贼之间没有荣誉,类似地,利维坦与建造它的自然人之间也没有团结。”
“即使对齐完美运作(这是一个很大的假设),这也不能解决人类自主权的问题:那些监视我们、无微不至地服侍我们的机器,是全知全能的掌控者,它们可以随时消灭我们,而我们无法抵抗它们,因为我们已经放弃了对未来的控制。”
为何重要——这是不可避免的吗? AI 技术的最终吸引子状态是否就是人类进步的剥夺权力和功能性消亡?这正是这篇文章所探讨的。
了解更多: No-One Escapes the Permanent Underclass(费尔南多·博雷蒂,博客)。
通过地方条例语料库让法律对 AI 系统可见
……美国地方法律的统一视图……
加州大学伯克利分校的研究人员构建了美国地方条例语料库(LOCUS),“一个针对美国市政和县条例代码的全面语料库和县级协调访问层”。
它是什么: LOCUS 包含约 220 万行数据,每行都是与特定地方条例相关的特定信息。“我们发布带有覆盖元数据的语料库,以支持可重复性、下游法律 AI 研究,以及逐步扩展对地方法律的机器可读访问,”作者写道。数据按条例的具体功能分类(例如,规则、规则执行、规则背景或规则流程),主题包括建筑、商业、分区、滋扰和“其他”。“LOCUS-v1 被设计为一个访问层,而不是地方法律权威的最终理论,”他们写道。“因此,LOCUS 应被理解为用于检索、比较和基准构建的基础设施,而不是对教义敏感的法律分析的替代品。”
为什么这样做?让法律对 AI 系统可见: “需要这样一个数据集的原因是,地方法律是公开的,但实际上无法作为国家研究语料库使用,”他们写道。“美国地方法规分散在商业供应商平台上,这些平台是为浏览器内阅读而非批量研究访问而设计的。供应商暴露了不同的导航结构、打印工作流、动态生成的 PDF 和管辖权索引。没有中央注册表将每个县或市映射到其托管平台,也没有供应商提供其托管的所有管辖区的完整机器可读索引。”有了像 LOCUS 这样的数据集,我们将使那些管理着大部分公民和地方生活的、奇怪且半隐半现的规则和法律对 AI 系统变得可访问,这最终可能使它们能够更好地适应超本地化的目的。
了解更多: Freeing the Law with LOCUS: A Local Ordinance Corpus for the United States(arXiv)。
获取数据: LocalLaws / LOCUS-v1(HuggingFace)。
科技故事:来自外星起源的奇异工具
[提升时代初期的一则小插曲,2031 年]
“等离子体稳定了!它保持住了。我们成功了!”他们都盯着读数:稳定的聚变。比太阳核心还要炽热十倍的热量,通过磁铁和其他能量被约束在适当位置。他们通过监视器看向腔室。容纳反应的容器看起来不像任何工程流程设计出来的东西,而是一个扭曲的、形状怪异的金属甜甜圈,形状流畅且反直觉;这是一个仿星器。这个东西的设计是在一次持续数天的思考任务后,从一个超智那里传下来的。制造工作在一个机器辛迪加进行;然后零件到达,并由人类从另一个辛迪加分包的一些双足机器人组装。在剪彩仪式上,几个人类聚集在一起,由摄像无人机和几个拿着智能手机的人类拍摄了一些照片和视频。机器人站在镜头之外。人们已经习惯了这一点——曾经有一段青春期,人们会和人类及机器人一起拍照,但公众情绪在接触到这些后总是会下降,最终,让机器人伙伴出镜更简单,就像人类狗仔队会得体地避免拍到他们名人目标的安全警卫一样。
启发这个故事的事物: 思考奇点的含义,以及当合成思维产生科学时会发生什么;仿星器;外星技术出现在世界上时可能会给人怎样的感觉。
感谢阅读!