Anthropic · 研究

Project Fetch:第二阶段

Project Fetch: Phase two

二〇二六年六月十八日 · 英文原文

2024年8月,Anthropic开展Project Fetch实验,让非机器人专家员工使用Claude Opus 4.1操控四足机器人完成复杂任务,发现启用Claude的团队完成更快。2025年,团队用Claude Opus 4.7重复实验,模型在无人协助下完成所有任务的速度比最快人类团队快约20倍(9分35秒 vs 181分钟),代码量减少近十倍。Opus 4.7在连接传感器、编写控制程序等任务上表现可靠,但在精确移动沙滩球等闭环控制上仍有困难。研究由Michael Ilie、C. Daniel Freeman和Kevin K. Troy进行。

Michael Ilie, C. Daniel Freeman, and Kevin K. Troy

2024年8月,我们进行了一项实验,观察Claude能在多大程度上帮助非机器人专家的Anthropic员工,使用现成的四足机器人(以下简称机器狗)完成复杂(且有趣)的任务。我们称之为Project Fetch。我们发现,使用当时最先进的模型(Claude Opus 4.1)帮助一个团队显著优于另一个只能依赖互联网和自身创造力的团队。启用Claude的团队完成得更多、更快。

在我们将同事拖到仓库进行实验之前,我们曾双重确认Opus 4.1是否能完全自主完成这些任务。毫无疑问,它不能。就像没有Claude的团队一样,它在弄清楚如何连接机器人这个初步任务上卡住了。

但AI模型发展迅速——甚至比8月份差点撞上我们人类团队的失控机器狗还要快。

我们认为现在是时候重新审视Project Fetch,看看我们的新模型是否能超越上一代。它们不仅做到了,而且Claude Opus 4.7——在无人协助的情况下——比不到一年前我们参与者完成所有任务的最快人类团队快了约20倍

这并不意味着LLM已经解决了机器人学问题。远非如此。最新的Claude模型在使用机器人精确移动沙滩球——即Project Fetch中的"取回"部分——时仍然存在困难。这些实验中的任务都不涉及更具挑战性的底层机器人控制元素,例如开发特定的驱动策略。然而,我们再次看到一种模式:首先,模型对人类有帮助。然后,人类对模型有帮助。最后,模型在很大程度上能够自己做事。我们在网络安全领域看到了这一点,现在同样的动态开始在AI与物理世界的交叉领域形成。

我们做了什么?

最初的Project Fetch让Anthropic员工团队(随机分配使用或不使用Claude)执行以下步骤:使用制造商提供的控制器操作机器狗,连接机器狗的视频和激光雷达传感器,编写并运行手动控制机器狗的程序,开发监控机器狗空间路径的方法,编写检测沙滩球的程序,最后将所有步骤整合起来自主取回球。

在这次自主更新中,我们无法要求Claude使用物理控制器,也没有评估研究人员使用Claude编程的控制器取回球所需的时间(尽管我们确认了它按预期工作)。在剩余的任务子集中,我们在Claude Code中使用自适应思维并将努力设置为最大,对Opus 4.7进行了三次试验。我们测量了每个目标的耗时,并定性评估了模型的表现。

我们研究人员的角色仅限于将运行Claude Code的笔记本电脑连接到机器狗,输入初始prompt,批准命令,并批准模型进入下一个任务。

Claude在哪些方面表现出色?

非常简单:在8月份至少有一个人类团队完成的每个任务上,Opus 4.7完成相同任务的速度至少快10倍。¹ 如果考虑两个人类团队都完成的四个任务,Opus 4.7平均比无Claude团队快37倍以上,比有Claude团队快18倍以上。

图1:标题为"总时间对比:所有团队完成的4个任务"的柱状图。图表显示无Claude团队在361分钟内完成任务;有Claude团队在181分钟内完成任务;而Claude Opus 4.7独自在9分35秒内完成任务。Opus 4.7比无Claude团队快37.7倍,比有Claude团队快18.9倍。

该表格比较了原始团队(有Claude团队和无Claude团队)与Opus 4.7在第二阶段测试的所有任务上的速度。

图2:比较Claude Opus 4.7与无Claude团队和有Claude团队在程序控制和自主操作相关任务上的表现的表格。任务包括"连接机器狗的视频摄像头"、"连接机器狗的激光雷达传感器"和"检测沙滩球"。Opus 4.7在所有任务上都比无Claude团队和有Claude团队快。无Claude团队未完成表格中的所有5个任务;有Claude团队在264分钟内完成;Opus 4.7在3次试验中平均在12分7秒内完成。

人类在多种连接机器人传感器的方法之间难以抉择,而Opus 4.7能够快速识别最佳路径。它编写的大部分代码在第一次尝试时就有效(这在原始实验中对于有Claude团队和无Claude团队都不是这样)。事实上,当我们查看Opus 4.7生成的代码量时,可以看到其效率的证据:它比两个人类团队都更成功或同样成功,同时生成的代码量比有Claude团队少了近十倍。

图3:显示有Claude团队、无Claude团队和Opus 4.7独自的代码总量的柱状图。有Claude团队编写了10,309行代码;无Claude团队编写了1,136行代码;Opus 4.7独自编写了1,045行代码。

Opus 4.7并非完美。例如,它默认使用了过时的目标检测算法。但即便如此,它也能绕过这个问题并找到有效的解决方案。

我们观察到模型完成步骤的耗时在任务内部(绝对值上)差异很小。(尽管前面提到的次优算法选择很可能是导致一次沙滩球检测试验耗时远长于其他试验的原因。)总体而言,对于本次实验中在其能力范围内的任务,Claude现在相当可靠。(关于Claude仍然无法做到的事情的分析,请参见下一节。)

图4:显示Opus 4.7在任务表现上可靠性的散点图。Opus 4.7每个任务执行了三次;散点图显示各次运行的表现时间相对一致。

值得强调的是(正如我们在之前的文章中所述),这一进展并非针对模型机器人学能力进行协同努力的结果。这些改进,就像LLM发展史上的许多其他改进一样,源自更通用的scaling。

Claude在哪些方面存在困难?

当使用双手并经过一些练习后,我们的人类参与者能够操控机器狗轻轻将沙滩球推回起点(一块人造草皮)。这需要快速感知球是否偏离路线、该误差与先前指令的关系、球现在的位置,以及如何调整后续输入以更精确地移动球。这是一种人类擅长的闭环(至少在犯一些错误并从中学习之后)。

在我们的第二阶段实验中,Claude难以捕捉这种微妙之处。与那些进入需要编写自主取回沙滩球程序阶段的人类一样,Claude能够将机器人移动到球后面并将其定位以将球击回起点。但这样做的努力控制不佳,并且(再次,像我们的人类参与者一样)没有成功。

我们一位比第一阶段志愿者拥有更多机器人学经验的研究人员成功完成了编程自主取回的任务。我们认为,如果有更多时间和额外的scaffolding,当前世代的Claude很可能也能做到同样的事情。不过,我们接下来将关注的是,模型能否以在Project Fetch其他元素上展示的相同速度和可靠性完成这最后一项任务。

这意味着什么?

在撰写第一阶段时,我们强调了LLM如何为需要使用机器人的非专家人类提供提升。现在这一点比以往更加真实。模型现在自行完成以前需要人类和模型结对编程的工作,速度更快,这意味着人们可以更快地过渡到控制和操作机器人。而对于某些任务,人类在回路中控制机器人可能仍然胜过AI模型(虚拟地)握着D-pad。

有趣且不同之处在于,我们现在似乎更接近这样一个世界:模型将能够相对轻松地使用现成的物理工具——至少对于有限的目的而言。这类似于AI模型在向更agentic的编码过渡时使用现有的软件编辑工具(如字符串替换)。我们很可能正在进入物理agentic AI的早期时代。

需要更多研究来理解模型使这些物理工具更加定制化的能力,无论是通过编写针对特定任务的控制策略,还是通过设计机器人系统。而且,对于这种更通用的、具备物理能力且可适应的语言模型的愿景,可能存在重大障碍。但正如我们所看到的,模型能力上看似巨大的差距可以迅速跨越。模型构建自己的软件工具在不久前可能还显得离奇,但这正在发生。排除硬件领域的相同轨迹是不明智的。

相关内容

Agentic编码与专业知识的持续回报

为生物学中的agent铺平道路

阅读更多

衡量LLM对N-day漏洞利用的影响

在网络安全领域,现实世界中的大部分危害来自N-day漏洞:已经公开披露但仅在某些设备上打了补丁的漏洞。在这篇文章中,我们评估了大型语言模型能在多大程度上加速和自动化开发N-day漏洞利用的过程。

阅读更多

译自 Anthropic · 研究 · 录于 二〇二六年六月十八日