HarnessEval-W:将视觉世界评估代理化
HarnessEval-W: Agentifying the Evaluation of Visual Worlds
来自 MirroS
摘要
一个基准测试应当提供的远不止一个标量分数:评估之所以可信,在于支撑该分数的推理过程。这一点对世界模型尤为关键,因为判断一次生成轨迹(rollout)需要理解物理、因果关系及世界状态是否演化正确。人类能自然察觉此类违例,但现有基准测试均未自动化这一能力:指标以暴力计算方式得出,缺乏可供检查或验证的推理链。我们提出HarnessEval-W,一种智能体化评估流水线,将LLM生态系统中的“harness”范式引入世界模型基准测试。HarnessEval-W不采用固定评分标准,而是解读每个评估案例的上下文,将评估问题分解为可测量的子问题,并生成专门的子智能体,每个子智能体配备定制上下文和诊断工具,以对其子问题进行推理。父智能体随后验证收集到的证据,并将其总结为最终判定。这一分层工作流将每次评估转化为透明的证据树,其完整推理链为结果提供依据。我们将HarnessEval-W应用于18个代表性世界模型,覆盖330个评估案例。其判断与人类偏好高度一致,同时为每个生成的轨迹提供可验证、细粒度的诊断。我们将完整流水线作为实时基准测试开源,并邀请广大社区贡献,随着世界模型的演进共同扩展新技能和评估案例。
译自 Hugging Face · Daily Papers · arXiv:2608.16859 · 录于 二〇二六年八月十八日