Hugging Face 模型页面展示所有评估结果
Featuring Every Eval Ever Results on Hugging Face Model Pages
Every Eval Ever (EEE) 与 Hugging Face Community Evals 实现互操作,通过统一 JSON schema 标准化 AI 评估结果报告。EEE 记录评估者、模型、生成设置及指标,Hugging Face 数据存储已收录约 229,000 条结果,覆盖 22,000 个模型和 2,200 个 benchmark。转换器自动将 EEE 记录映射为 Hugging Face YAML 格式,支持 MMLU-Pro、GPQA、HLE 和 GSM8K 四个 benchmark,并生成审计报告。贡献者可通过 Hugging Face 账户提交已验证结果,链接至完整 EEE 记录。
](https://huggingface.co/deepmage121)
Every Eval Ever (EEE) 和 Hugging Face Community Evals 现已实现互操作。我们支持评估结果的跨平台发布与解读,同时链接到开放模型、排行榜和统一的标准化元数据存储。
EEE 于 2026 年 2 月作为 EvalEval Coalition 的一个项目 推出,这是首个跨机构合作,旨在改善 AI 评估结果由第一方和第三方评估者报告的方式。Hugging Face 于 2026 年 2 月推出了 Community Evals,以去中心化 Hub 上 benchmark 分数的报告方式。两者结合,弥补了用户、研究人员和政策制定者在信任、理解和选择评估与模型方面的空白。
评估结果是我们衡量模型能力、比较模型之间差异以及推理安全性和治理的方式,但它们分散且难以比较。它们存在于论文、排行榜、博客文章和 harness 日志等不同地方,每种都有各自的格式。同一模型在同一个 benchmark 上,根据谁运行以及如何运行,往往会返回不同的分数;例如,LLaMA 65B 在 MMLU 上曾被报告为 63.7 和 48.8。这些差异可能源于 我们发现的通常未被报告的评估设置。
EEE 是我们对报告端的解决方案。它是一个用于评估结果的 JSON schema,记录以下内容:
- 谁运行的
- 哪个模型
- 如何访问的
- 生成设置
- 指标的实际含义
- [推荐] 用于每个样本输出的配套 JSONL 文件
该 schema 是在研究人员和政策研究人员的反馈下构建的,可以接收任何来源的结果,因此 harness 日志、排行榜抓取数据和论文中的数字最终都会变成相同的格式。GitHub 仓库 提供了转换器、示例和贡献指南。自推出以来,Hugging Face 上的 数据存储 已增长到约 229,000 个评估结果,涵盖超过 22,000 个模型和 2,200 个 benchmark,从 31 种不同的报告格式中提取。仅从头重现这些运行就需要花费数十万美元,这充分说明了在有人付费生成数据后,不应让数据分散。
在此了解更多关于 schema 以及如何贡献的信息 此处。
现在,它带来了更好的集成和归属。贡献者现在可以将 EEE 结果发送到 Hugging Face Community Evals。我们构建了一个转换器,可以获取您的 EEE 记录并写入 Hugging Face 期望的小型 YAML 文件,这样您就不必手动以两种格式保存相同的结果。
这对所有报告或阅读评估的人(不仅仅是现有的 EEE 贡献者)来说都是新功能。报告自己模型的第一方评估者和报告他人模型的第三方评估者都可以向 Community Evals 和 EEE 提交数据,任何浏览 Hub 的人都能看到可追溯到完整记录的结果。当您通过组织的官方 Hugging Face 账户提交数据时,您的结果会在 EvalEval 上显示一个 已验证 的勾选标记,向读者表明这些数字直接来自源头。本文的其余部分将介绍 Community Evals 是什么以及转换器的作用。
Hugging Face Community Evals 如何与 EvalEval 协同工作
Hugging Face Community Evals 有两个方面。
一个 benchmark 存在于一个数据集仓库中,该仓库通过添加 eval.yaml 来注册自己。注册后,该数据集页面会收集并显示一个排行榜,列出 Hub 上针对该 benchmark 报告的所有分数。官方 benchmark 列表 会随时间增长。
模型的分数存在于模型仓库中的 .eval_results/*.yaml 文件中。它们会显示在模型卡片上,并反馈到匹配的 benchmark 排行榜中。模型作者自己的结果以及其他人通过 pull request 提交的结果都会被汇总,每个分数都带有一个徽章,表明它是作者提交的、社区提交的还是独立验证的。任何人都可以通过打开一个包含正确 YAML 文件的 PR 来为任何模型添加分数,模型作者可以关闭 PR 或在自己的仓库中隐藏结果。
以下是其中一个排行榜的样子:
Hub 上 Humanity's Last Exam 的 Community Evals 排行榜
这就是 EEE 和 Community Evals 结合的地方。当您将结果发送给两者时,会发生两件事:首先,您的分数会出现在 Hugging Face 模型页面上,并被拉入 benchmark 的排行榜。其次,它会带有一个源徽章,直接链接回完整的 EEE 记录,其中包含生成配置、harness 版本、可重现性说明以及任何实例级数据。
来自 EEE 数据存储 (a) 的评估 (MMLU-Pro),在文件级别交叉链接到 Hugging Face 模型卡片 (b)。Source EvalEval 徽章链接到完整的 JSON 记录。
这两个目的地朝着同一个目标执行不同的任务。Hugging Face 将您的结果放在人们查看模型的地方,并带有指向来源的链接。EEE 保存完整的结构化记录,使结果可解释,并在此基础上驱动 Eval Cards。 将您的数据发送给两者,同一个评估结果将同时变得可见和可读,这正是报告评估结果的意义所在。
您可以在下面看到这种跨兼容性。上面模型卡片上显示的相同 GPQA 分数也会在 Eval Cards 中呈现,后者将 EEE 运行数据与 benchmark 和模型元数据组合成一个可解释的记录。同一个评估,不同的展示面:
工作原理
Hugging Face 将评估分数以 YAML 格式存储在模型仓库的 .eval_results/ 目录下。必填字段仅为 benchmark 数据集、任务和值。source 块是创建指向 EEE 的反向链接的部分。
- dataset:
id: openai/gsm8k
task_id: gsm8k
value: 96.8
date: '2024-07-16'
notes: '8-shot CoT'
source:
url: https://huggingface.co/datasets/evaleval/EEE_datastore/blob/main/flat/objects/<xx>/<yy>/<uuid>.json
name: EvalEval
转换器会根据您现有的记录填充此内容。 它将 source_data.hf_repo 映射到 dataset.id,evaluation_name 映射到 task_id,score_details.score 映射到 value,evaluation_timestamp 映射到 date,然后插入数据存储对象 URL 作为指向每条记录 EEE JSON 的源链接。它目前处理四个官方 benchmark:MMLU-Pro、GPQA、HLE 和 GSM8K。
转换器不仅仅是重塑字段。 您将其指向一个 EEE 数据存储集合,它会下载该集合及其引用的记录,检查对象哈希,并找到映射到受支持 benchmark 的分数。在写入任何实时数据之前,它会审计已存在的内容:它读取模型主分支和开放 PR 中的每个 .eval_results YAML,并按数据集和任务(而不是文件名)进行比较。如果分数已存在,则标记为 already_present;如果存在不同的分数,则标记为 score_conflict;如果模型仓库在 Hub 上无法解析,则标记为 missing_hf_model。其他所有内容都标记为 ready。
未经您的确认,不会推送任何内容。 该工具会写入本地 YAML 预览和可供您检查的审核文件,显示哪些已准备好、哪些需要注意的报告,并且仅在您输入 OPEN PRS 并输入提交消息后才打开 PR。重新运行会重用集合的缓存结果,除非您传递 --force。
转换器的审核步骤。排除的条目(此处为没有匹配 Hub 仓库的模型)会列出其 EEE 源 URL,准备好的 PR 等待明确的 OPEN PRS 确认。
从这里开始
将您的完整记录提交到 EEE 数据存储。
使用 EEE 只需要一个额外的步骤,而转换器在很大程度上自动化了该步骤。社区评估转换器工具 可以在 GitHub 仓库中找到。要处理一个集合,请执行以下命令:
uv run tools/hf-community-evals/community_evals_converter.py MMLU-Pro \
--datastore evaleval/EEE_datastore@main
检查它生成的预览和报告,然后在准备好提交时输入 OPEN PRS。有关 schema、CLI 和转换器的完整文档,请访问 evalevalai.com/every_eval_ever/hf-community-evals。


