Apple · ML Research

FlowEval:基于参考的生成用户界面评估

FlowEval: Reference-Based Evaluation of Generated User Interfaces

二〇二六年七月八日 · 英文原文

FlowEval是一个基于参考的评估框架,用于衡量大语言模型(LLM)和编码agent生成的用户界面(UI)是否支持真实的交互流程。它通过比较真实网站的导航轨迹与生成UI的轨迹,解决了现有评估方法中人类专家评估速度慢、成本高,以及自动化评判准确性低且不透明的问题。

虽然大语言模型(LLM)和编码 agent 常被用于用户界面(UI)开发,但开发者很难可靠地评估它们在视觉与交互设计方面的能力。现有评估方法要么依赖人类专家——他们能通过测试关键流程准确评估可用性,但速度慢且成本高;要么依赖自动化评判——虽可扩展但准确性较低且不透明。我们提出 FlowEval,这是一个基于参考的框架,通过比较真实网站的导航轨迹与生成 UI 的轨迹,来衡量生成的 UI 是否支持真实的交互流程。

译自 Apple · ML Research · 录于 二〇二六年七月八日