Microsoft Research · 学术

Echoverse:面向计算机使用代理的深度演化环境

Echoverse: Deep, evolving environments for computer-use agents

二〇二六年七月三十日 · 英文原文

微软研究团队构建了Echoverse,一套包含十个深度领域世界和两个能力世界的合成训练环境,用于训练计算机使用智能体。这些世界复现真实应用行为、预置真实数据并保持状态一致。经过全部世界训练后,一个9B模型的基础得分从36.5%提升至67.1%,与GPT-5.4的差距缩小到14个百分点以内。实验表明,高仿真度世界是必要条件,浅层世界会损害智能体;针对日期选择器和嵌套过滤器等挑战性UI元素进行专项训练可提升泛化能力;让模型、世界和验证器共同进化能全面提升三者;基于真实状态的强化学习推动智能体超越模仿。团队发布了其中四个世界的代码、数据和基于真实状态的评分器。

追求深度而非数量:针对智能体真正缺失的能力,并与它们所训练的模型共同进化

概览

我们为计算机使用智能体构建了十二个训练世界:十个深度领域世界和两个能力世界,每个世界都针对一种以多种形式呈现的控件(如日期选择器和嵌套过滤器)进行专项训练。深度是它们值得用于训练的原因:这些世界复现了应用程序的真实行为,预置了真实数据,并在不同屏幕和用户之间保持状态一致。经过全部十二个世界的训练,一个9B模型的基础得分几乎翻倍(从36.5%提升至67.1%),与GPT-5.4的差距缩小到14个百分点以内。这项实验给了我们几个启示:

我们正在发布其中四个世界的代码、数据和基于真实状态的评分器,以支持关于高保真计算机使用世界的研究。

一个计算机使用智能体只有在行动产生真实后果时,才能学习到行动的结果。一次点击会改变保存的状态,一条消息会到达真实的人,或者一个拒绝跳转的页面会告诉智能体它上次的操作毫无效果。截图可以显示界面的外观,但只有工作的世界才能显示操作所导致的结果。值得学习的后果是有状态的,而且其中大部分都隐藏在登录之后。人们希望自动化的工作存在于封闭系统中:电子邮件和聊天、银行、健康记录、云和ML的内部控制台。你无法针对这些系统的在线版本训练智能体。每一次尝试都会写入真实账户,尝试之间无法重置,真实状态始终隐藏在屏幕之后。

因此,你将系统重建为一个合成世界,其中的数据库归你所有:状态是真实的,变化也是真实的,但可以安全地破坏、快速重置,并且基于数据而非截图进行评分。

我们所说的“世界”是指三个紧密关联的部分:一个环境(应用程序、其状态以及改变状态的动作)、在其中设定目标的任务,以及一个根据真实状态对结果进行评分的验证器。社区现在已经很擅长构建它们:通过流水线搭建应用程序、预置数据、生成任务并附加验证器,从而产生数百个环境和数千个可检查的任务。这项工作建立在这一进展之上。

然而,当世界变得丰富时,其内部结构就成了瓶颈:无论状态在用户和屏幕之间是否保持一致,工作流都保持着它们的依赖关系,一个薄弱技能需要以足够多的形式出现才能泛化,而成功是通过结果还是外观来判断的。我们的假设——也是Echoverse要检验的——是,真正的杠杆作用更多地来自于一个不断改进已有世界的循环,而不是增加世界的数量。它将构建环境和训练模型视为一个过程,而非两个阶段:在一个世界中运行模型,发现其失败之处,在那里让世界、任务和验证器变得更忠实或要求更高,然后在更清晰的信号上进行训练,并重复此过程。普通的微调只改进模型。在这里,同一个用于评估模型的评分运行,也改进了评判它的世界,因此静态基准会饱和,而循环则会产生复合效应。

三个杠杆让这个循环保持高效,它们都不是原始的环境数量。

图1:学习循环:每次评分运行都被读取两次。 存活的失败成为模型训练数据,而世界、任务或验证器中的缺陷则成为修复目标。同一个用于评估模型的评分运行,也磨砺了评判它的世界。

为什么是合成世界,为什么要有深度?

开放、无需登录的网站似乎消除了对合成世界的需求,但它们因另一个原因而成为糟糕的训练场:它们不会静止不动。页面会重新设计,列表和日期会向前滚动,主机会限制或阻止自动化流量,因此一个依赖于它们的基准会漂移,没有两次运行面对的是同一个网站。偶尔的评估可以承受这一点;但训练不行,因为它需要将同一个任务运行数千次,并且每次都需要相同的世界。一个合成世界在时间和数据上是固定的:日历不会移动,种子数据不会变动,一个任务在第一千次运行时的含义与第一次相同。我们用一点点表面上的真实感,换来了一个完全可控的世界。

可控只是基础。一个世界可以完全稳定,但仍然空洞,因此能赢得训练时间的是深度:不是它的页面数量,而是它忠实地保留了工作的因果结构。五个属性设定了标准:

在最重要的系统中,困难在于权限、共享状态和审计历史:这正是浅层克隆所跳过的结构。在这个标准之上,更多的环境增加了多样性;在这个标准之下,它们增加了噪音。

Echoverse工厂如何运作?

Echoverse是一个单一的流水线,有两个输出:保留工作流深度的完整领域世界,以及针对一个诊断出的交互进行变化的能力世界。两者都依赖于我们拥有底层数据库这一事实,因此成功是应用程序自身状态的一个属性,而不是模型对截图的解读。

构建世界

该流水线将少量种子场景扩展成一个规范,然后将其编译成关于路由、状态和行为的机器可检查断言。只有在那之后,它才会生成应用程序:一个在React界面下的FastAPI和SQLite后端。一个新的应用程序是一个假设,而不是一个世界:构建者针对运行中的环境运行每一个断言,修复数据库、后端或前端,直到每个断言都通过,然后写入一个就绪记录,将硬性障碍与建议性风险分开。存在未解决障碍的世界不会进入下一阶段。这里的深度不是prompt中的承诺;它是世界已被证明通过的断言列表。

扩充语料库

一个构建干净的世界仍然不是训练数据。我们将每个任务重新基于实时数据库,从实际存在的实体中提取目标,然后通过一组分析器发送每个目标:其实体是否真实,目标是否合理,难度是否匹配工作,以及最严格的测试——一个驱动真实UI的智能体能否完成它?最后一项检查在浏览器中运行,在模型看到目标之前就捕获了任何界面都无法满足的目标。生成的目标是一个断言;针对真实应用程序的解决是证明。每一次失败都会成为一个问题,由必须更改的层来标记:数据库、后端、前端、任务文本或验证器。特定层的修复程序应用修复,针对运行中的应用程序重新检查,如果出现回归则回滚。该循环根据数据库真实状态重新评分,直到通过率停止上升,每个存活的任务都带着对其进行评分的精确检查一起导出。

这些任务通过一个过程成为训练数据:GPT-5.4解决每个任务,一个验证器保留通过真实状态的轨迹,这些轨迹成为下面每个实验背后的监督微调(SFT)数据。构建世界和扩充语料库不是两个阶段,而是一个循环:大多数缺陷属于世界,因此我们在每次迭代中都会重新版本化环境。更困难的任务暴露了世界中的差距,而更坚固的世界可以承载更困难的任务,因此每一轮都会让两者都变得更强。

图2:环境工厂:每个世界背后的两个循环。 阶段1将少量种子扩展成一个应用程序,然后修复数据库、后端和前端,直到它通过机器可检查的断言。阶段2将任务重新基于实时数据,运行一组分析器和特定层修复智能体,并根据数据库真实状态重新评分,直到通过率趋于平稳。许多修复都落入了世界本身(虚线箭头)。

验证器基于数据库

每个任务都带有自己的答案键,一个在生成时通过SQL查询从真实数据库中铸造的值或状态变化,通过构造保证真实,并在智能体完成后重新检查。读取任务根据与存储值的语义等价性进行评分($288 对 $287.62 通过);写入任务基于真实的数据库前后差异,因此声称一个工单已关闭,除非行状态翻转,否则失败;读写任务取两者中较低的分数。评分难以被钻空子,基于真实状态而非标注,并且在EchoStay预订、EchoForge工单和EchoBank转账之间保持一致。

完整领域承载工作流

具有最重要工作的领域是公共基准最难触及的:封闭的专有系统,其困难在于权限、共享状态和历史,而非布局。一个忠实的克隆必须复现这一点。重要的不是像素,而是一个操作的后果能够跨越屏幕和用户,因此一个任务可以运行一个真实的工作流,并根据它留下的状态进行评分。十个Echo领域涵盖了通信、技术工作、受监管记录、社区、媒体和旅行。在存在丰富公共数据集的地方,我们在此基础上构建:EchoStay的种子数据来自InsideAirbnb,因此其房源、房东、评论和设施是真实的而非虚构的;EchoForum基于一个包含255万条评论的公共论坛语料库。在不存在的地方,例如邮件、日历、银行和健康记录,一个种子数据流水线在严格约束下生成状态,密集且内部一致,而不是少数占位行。

表1:Echo家族的十个完整领域环境,按其代表的工作分组。 每个都是广泛使用产品的忠实替身,以工作流而非品牌命名。这种累积的状态使得一个操作的后果能够跨越屏幕和用户。EchoStay中的预订通过搜索、列表、可用性和支付,跨越大约87条路由和23张表,但没有一个确认屏幕;EchoMail线程承载着从草稿到投递、回复和标签状态的意图;EchoCare订单将每次更改写入审计跟踪。任务因此代价高昂,通常需要五到二十个动作的深度,并且只有在底层状态发生变化时才完成。

图3:Echo套件中各领域的详细信息。 每个都作为其建模应用程序的自包含、完全交互式克隆发布,拥有自己的后端、种子数据库和功能表面。计数基于数据库真实状态,而非模拟图。

能力世界隔离单一技能

并非每个弱点都代表一个缺失的领域;有些是由智能体无法可靠操作的单个控件引起的。想象一个智能体预订旅行:它搜索、过滤、打开正确的列表,然后在日期选择器处卡住,无法将“三月的第二周”转化为在不熟悉的日历上的正确点击。构建另一个预订网站无法解决这个问题。只有当控件本身以足够多的形式出现时,技能才能被学习,而日期选择器和嵌套过滤与搜索在真实网络上无处不在,以一百种不同的方式呈现,这正是单个深度应用程序无法提供的多样性。因此,我们隔离控件并扩大交互范围,跨布局、状态和约束大规模生产它,然后为每个生成基于真实状态的任务。

日期选择器世界将一个日期控件渲染为跨10个上下文的6个核心widget,并保留10个新的未见过的widget,从日历热图到滚轮和财政季度选择器;其最困难的任务将转录转化为推理,解析“2026年1月的最后一个星期四”或“开始日期后的10个工作日”为一个精确的、widget可到达的日期。嵌套过滤器世界变化了20个widget家族,并保留了9个复合面板家族作为分布外数据,通过应用程序自身的逻辑而非外观来判断每个提交的过滤结果是否实际满足请求的条件。

图4:两个技能覆盖的每个widget家族,分为训练(分布内)和仅评估(保留): 嵌套过滤器,20个家族加上9个保留的复合面板;日期选择器,跨10个上下文的6种核心类型加上10个保留的widget。

图5:跨领域主题化的日期选择器和嵌套过滤器: 跨六个垂直领域的嵌套过滤器,从房地产到宠物领养;跨十个上下文的日期选择器,从日程安排到保险。

更深入、更有针对性的世界带来了什么改变

更多的轨迹并不会自动提供更多的训练信号。重要的是深度:一个episode是否将一个任务贯穿真实工作流的依赖步骤,而不是仅仅孤立地排练一个动作。两个实验从相反的两端具体说明了这种差异:一个在完整领域上深入,另一个则缩小到单一有缺陷的技能。

浅层世界适得其反;深层世界可以迁移

浅层世界是廉价的选择。它搭建迅速,看起来令人信服,但它只排练孤立的、看起来正确的点击。在此基础上训练,模型会学到错误的反射,过度操作、循环和重复无效动作,因为在简单的世界里没有任何东西惩罚过它们。一个深层世界成本更高,但其轨迹携带了能够迁移到真实网站的依赖结构。为了隔离这一点,我们选取两个真实的WebVoyager领域,Allrecipes和Hugging Face,并比较三个检查点:基础模型和两个分别在这些领域的浅层世界和深层世界轨迹上训练的模型。浅层世界提出简短、自包含的任务;深层世界提出跨越依赖步骤的任务,其中早期动作会改变后续可用的状态、选项和验证。两者都给模型相同的领域暴露,因此只有深度不同,评估使用这些领域的公共WebVoyager基准任务,在任何训练世界之外的真实网站上运行。在Allrecipes上,浅层世界拉低了模型,从80.0%降至75.0%;在Hugging Face上,它持平于48.0%。只有深层世界改进了两者,将Allrecipes提升至85.0%,将更困难的Hugging Face部分提升至65.0%。在暴露量相等的情况下,差距在于深度:深层模型循环更少,在37个Hugging Face任务中,耗尽步骤预算的任务从15个下降到9个。区分两者的不是模型看到了多少,而是它看到的内容是否保留了工作的结构。

图6:两个真实WebVoyager领域的深层与浅层世界,具有相同的领域暴露和不同的任务深度。 深层提升了两个领域;浅层在Allrecipes上低于基础模型,在Hugging Face上停滞不前。

针对单一技能的精确性

日期选择器和嵌套过滤器世界精确地训练了我们的评估所标记的控件,并且这两个技能相互加强。日期选择器训练提升了日期选择器评估(分布内从60.0%到82.6%,保留布局从34.0%到54.0%);过滤器训练将保留过滤器从62.8%提升到84.1%。在从未训练过的表单上获得的收益表明模型学到了一个规则,而不是一个布局。这些技能相互迁移而非竞争:单独训练任何一个仍然会提升另一个,而同时训练两者在每个部分上都是最好的全能选手。以GPT-5.4作为前沿参考,这个组合模型在嵌套过滤器上已经略微领先,并缩小了日期选择器分布内的大部分差距,仅在保留的日期选择器上明显落后。而且这个规则延伸到了开放网络,将Online-Mind2Web从29.5%提升到34.3%,在它从未见过的网站上。

图7:有针对性的训练,有针对性的收益: 训练日期选择器或嵌套过滤器中的任何一个都会提升两个控件,包括两者都未训练过的保留widget和组合,而同时训练两者在每个部分上都是最好的全能选手。越高越好。

从合成世界到真实网络

本节剩余部分将运行三个模型。基础模型是Qwen3.5-9B,仅给予少量合成轨迹,足以将通用模型对齐到浏览器动作空间。我们的模型是同一个90亿参数网络,在完整的合成语料库上训练。GPT-5.4是一个大得多的前沿模型,作为参考上限包含在内。

技能能否在开放网络上存活?

我们评估我们的模型(未经修改)在WebVoyager和Online-Mind2Web上,这些基准它从未训练过。它们与我们构建的内容几乎没有重叠:两者都以开放的公共网站和以读取为主的浏览为主,而我们的世界训练的是需要登录、以写入为主的工作流。大幅跳跃从来不是重点;方向才是。冻结的模型在两个基准上都超过了基础模型,WebVoyager从66.5%到71.5%,Online-Mind2Web从40.5%到43.4%(不使用BrowserBase时,分别为50.9%到55.6%和29.5%到37.2%),通过BrowserBase报告是因为托管浏览器会移除数据中心机器人拦截和速率限制,否则这些会压低每个智能体的分数。由于混合数据中没有真实网络数据,这是迁移,而非记忆。

图8:合成训练迁移到真实网络。 完整语料库模型,在两个它从未训练过的基准上,都超过了基础模型;分数通过BrowserBase运行以移除数据中心机器人拦截。适度的真实网络收益是覆盖效应,而非上限:瞄准一个真实领域,它就会增长。EchoForge,我们的代码托管世界,是与GitHub(WebVoyager测试的真实网站之一)同类的应用程序。将EchoForge加入训练组合,真实GitHub分数从58.5%攀升至63.4%,整体真实分数也上升了(WebVoyager从50.9%到52.9%,Online-Mind2Web从29.5%到31.1%)。平均值只是反映了我们构建的大部分内容位于这些基准从未触及的领域。

图9:缩小与前沿模型的差距,按环境划分。 绿色条是从基础模型到我们模型的收益;淡色剩余部分是仍与GPT-5.4的距离。我们的模型在EchoBank和两个嵌套过滤器上超过了GPT-5.4,并在其他地方缩小了大部分差距;每个模型的确切分数标注在右侧。

我们构建的领域,其中大部分是封闭且需要登录的,讲述了相反的故事。在所有十四个领域中,模型几乎翻倍,从36.5%到67.1%,并且在基础模型最弱的地方,它提升了三到九倍,EchoCalendar、EchoML、EchoChat、EchoCare、EchoForge和EchoForum都从个位数或低两位数上升到四五十到六十几。这使得一个90亿参数的模型在平均值上(67.1%对80.7%)与GPT-5.4的差距缩小到14个百分点以内。在EchoMail、EchoBank和两个嵌套过滤器上,它匹配或击败了远大于它的前沿模型,仅在分布内日期选择器上落后几分。让一个9B模型如此接近的,不是规模,而是深度、有针对性且可检查的训练数据,这正是工厂旨在生产的东西。

扩展带来了什么,又没带来什么

我们分别扩展了两个轴:通过一组固定环境获得更多轨迹,从每个环境中抽取相同数量;以及更多不同的环境。它们的行为不同。在相同世界上使用更多轨迹会持续提升领域内平均值,尽管收益不断缩小,而向真实网络的迁移则完全持平:从6,400到20,000条轨迹,WebVoyager保持稳定(54.8%到55.6%),Online-Mind2Web下滑(40.1%到37.2%)。由于每个点都均匀地采样所有世界,这不是人为现象:每个环境只包含有限的可迁移技能,一旦模型将其提取出来,更多的展开主要是在打磨它已经会做的事情。

扩展环境产生了相反的结果。随着广度的增加,平均值持续攀升,而WebVoyager只有在使用完整集合时才达到最佳状态。对于泛化而言,杠杆是多样性,而非数量。一个模型通过在许多种工作上训练来达到它从未见过的网站,而不是通过多次看到同一种工作。

即便如此,规模本身在两个轴上都不是杠杆。一个大的轨迹预算,如果花在浅层世界上,或者根据错误的答案进行评分,会移动合成数字,但在真实网络上毫无进展。能够迁移的是每个轨迹内部的东西:保留真实工作流的深度,针对智能体失败的控件进行训练,以及基于数据库的评分,保持信号的真实性。

图10:两个扩展轴,不使用BrowserBase评分。 左图:在固定的一组世界上使用更多轨迹,从每个环境中抽取相同数量,x轴按实际轨迹数量间隔。合成平均值持续上升,但真实网络迁移饱和,WebVoyager持平,Online-Mind2Web在6,400条轨迹后下滑。右图:更多环境,广度使合成平均值和WebVoyager持续攀升。环境的多样性,而非轨迹数量,是将技能带到未见网站的关键。

学习的不仅仅是模型

智能体获得的分数从来不仅仅是模型本身。它来自一个耦合的堆栈:智能体、环境、任务和验证器。一个零分可能意味着智能体失败,或者控件损坏,或者请求的状态不可能实现,或者验证器检查了错误的东西。将每个零分都解读为模型监督,是在训练本应修复的缺陷。因此,我们将每次评分展开都解读为对整个堆栈的测试,并让整个堆栈学习。环境随着损坏的控件和连接被修复而改进,任务随着目标被重新基于现实并变得更困难而改进,验证器在它与数据不同步时被修复。只有在这三者中都存活的失败才成为模型的课程。

EchoStay让这一点变得可见。其失败追溯到世界,而非智能体:一个客人数量控件静默地破坏了预订任务,因此正确的预订永远无法注册。修复它将那些预订任务中能够完成的比例从48%提高到78%,恢复了24个被阻塞任务中的15个。同样的循环在其他地方发现了不同的故障:EchoForum需要前端修复和页面加载加速,这使一组失败的37个任务从0个解决变为36个解决;EchoChat的验证器与数据不同步,重新对齐后,可评分任务的比例从34%提高到99%;EchoCare需要一个状态连接修复;EchoForge有后端逻辑,但没有UI控件可以到达它。随着世界变得清晰,模型也随之进步。在EchoStay上跨两轮重新运行循环,在其语料库上训练的模型得分翻了一倍多,从16.2%到38.5%,达到了GPT-5.4的50.4%的三分之二距离。学习的不仅仅是模型;它是当它下面的一切都学习时,产生复合效应的东西。

图11:共同进化在EchoStay上提升了模型。 随着世界从v1到v2,在其上训练的模型得分翻了一倍多,从16.2%到38.5%,这是与世界自身解决率不同的衡量标准。越高越好。

修复世界和教导模型之间的界限在受控环境中很容易保持,两者都是可检查的。真实网络抹去了它:没有世界可以在任务中途修复,因此当一个动作落在空处时,正确性完全取决于智能体注意到并做出不同的选择。这是世界必须教的最后一件事,也是真实网络最不宽容的地方。

从SFT到RL:将世界转化为RLE

到目前为止,所有结果都来自模仿:9B模型复制了GPT-5.4做对的轨迹。然而,模仿继承了一个上限:一个干净的演示永远不会展示如何从错误中恢复或何时停止,这些是在野外破坏智能体的失败。强化学习优化了我们评分的最终结果,并让模型从自己的轨迹中学习,而不是从老师的轨迹中学习。但强化学习需要一个它可以大规模驱动的RL环境(RLE)。每次展开都需要重置到已知状态,需要并行采样的吞吐量,需要一个它可以信任的奖励,并且一次运行会将同一个任务重复数千次。真实网络不是一个RLE:它不会重置,因此没有两次展开开始相同;它在RL的规模之前很久就会限制和阻止自动化流量;并且它不暴露真实状态,只暴露一个必须由第二个模型判断的截图,因此奖励和判断者一样嘈杂,策略学到的是判断者的盲点,而不是任务。

Echoverse通过构造就是一个RLE。每个世界都是一个自包含的应用程序,我们为每次展开进行快照和重置,并行运行,并从其自身的数据库进行评分,因此过滤SFT数据的验证器返回一个基于真实状态、可验证的奖励,而不是从像素推断出来的奖励。用于评估智能体的同一个世界也训练它。

图12:在Echoverse RLE上的强化学习。 从SFT策略开始,我们在一个世界中展开一组轨迹;每个轨迹是一系列改变数据库的动作和执行步骤。一个评分器,即过滤SFT数据的同一个基于真实状态的验证器,位于环境之外,并将每次展开的最终数据库状态评分成一个奖励。这组奖励更新策略,循环在每个训练世界中重复。

我们将SFT模型作为起始策略,并针对五个世界运行RL:EchoBank、EchoForge、EchoForum、EchoStay和EchoTunes。任务来自每个世界中较困难的一端,SFT策略仍有提升空间,每次更新都利用几个评分展开。每次展开获得两个奖励:一个来自我们基于数据库的验证器(LLM judge GPT-4.1)的轨迹奖励,以及一个来自多模态判断者(GPT-4.1 vision)的密集每步奖励,该判断者对每个截图进行评分。我们在SFT数据之外,每个世界大约训练100个任务,进行两个epoch。在每个世界25个任务的保留集上,判断者评分从58%上升到69%。老师教了它该做什么;世界教了它何时停止、何时恢复以及何时放弃。

图13:在五个世界上进行强化学习,两个epoch。 左图:保留的判断者评分(每个世界25个任务)从58%攀升至69%。右图:评论家的平均分数,即RL奖励信号,在训练中呈上升趋势。奖励汇总了来自我们基于数据库的验证器(LLM judge GPT-4.1)的轨迹奖励和来自多模态判断者(GPT-4.1 vision)的密集每步奖励。

这给我们带来了什么

一个世界不再是一个你用来打分的固定基准;它是一个你不断改进的训练表面,同一个用于评估模型的评分运行,也磨砺了评判它的世界。深层世界在浅层克隆拉低能力的地方实现了迁移;一个以一百种形式重建的widget教会了一项延伸到真实网络的技能;共同进化同时推动了双方;针对同一个世界的强化学习推动智能体超越了模仿,提升了保留表现并削减了浪费的步骤。持久的优势不是最大的合成网站库存。它是一个工厂,诊断智能体还不能做什么,构建或修复教导它的世界,保护已经获得的能力,并再次运行循环。

接下来的步骤同时在三个前沿扩展。首先,为公共基准无法触及的封闭领域构建更多深层世界。其次,为模型持续失败的交互构建更多能力世界。最重要的是,针对这些基于真实状态的世界进行更多强化学习:更长的运行、更困难的任务以及更广泛的奖励探索,将智能体的行为和表现推得比模仿更远。这些杠杆会产生复合效应:更深更广的世界带来更强的RL,更强的RL提升智能体,而每一轮都会暴露出下一个需要构建的能力。

我们正在发布工厂的一部分:四个世界的环境代码和评分测试任务,两个深层领域(EchoStay和EchoForge)和两个能力世界(日期选择器和嵌套过滤器,每个都包含分布内和保留部分)。每个任务都带有对其进行评分的基于数据库的验证器,因此同一个世界可以用于评估智能体或训练智能体。

代码和任务: https://aka.ms/echoverse

当世界在智能体能力的边界上成长时,评估不再是一个记分牌,而是成为决定下一步构建什么的引擎:世界与它们训练的智能体一起持续学习。

致谢

我们感谢Alexey Taymanov, Andrew Zhao, Aravind Rajeswaran, Corby Rosset, Hussein Mozannar, Luiz Do Valle, Sara Abdali, Spencer Whitehead, Vibhav Vineet, Zach Nussbaum, Yadong Lu, Pashmina Cameron, Rafah Hosn, 和 Chinmay Karkar 在整个工作中提供的宝贵帮助、富有洞察力的讨论和持续的支持。

(在新标签页中打开)

文章《Echoverse: Deep, evolving environments for computer-use agents》首次出现在 Microsoft Research 上。

译自 Microsoft Research · 学术 · 录于 二〇二六年七月三十日