GitHub · AI/ML 项目

用新开放数据集加速研究人员和开发者构建多语言AI

Accelerating researchers and developers building multilingual AI with a new open dataset

二〇二六年六月十五日 · 英文原文

GitHub 发布了 GitHub 多语言仓库数据集(GitHub Multilingual Repositories Dataset),这是一个仓库级元数据集,涵盖超过 4000 万个仓库的 8000 万条分类记录,旨在帮助研究人员和开发者发现包含非英语自然语言内容的公开 GitHub 仓库。数据集包含 README、issue 和 pull request 的语言分类结果(来自 fastText、gcld3 和 lingua-py 三个分类器,置信度 >0.5)及仓库元数据,以 CC0-1.0 许可发布,兑现了微软欧洲数字承诺中关于使多语言数据更易于获取的承诺。

软件可以用编程语言编写,但人类语言才是开发者协作的核心。开发者通过 README 解释项目如何运作,在 issue 中寻求帮助,在 pull request 中审查、讨论并改进代码。这种协作通常以英语进行——但并非总是如此。随着 AI 在开发者构建软件的过程中扮演越来越重要的角色,多语言开发者内容比以往任何时候都更加重要。今天,GitHub 发布了 GitHub 多语言仓库数据集(GitHub Multilingual Repositories Dataset),这是一个仓库级别的元数据集,旨在帮助研究人员和开发者发现包含非英语自然语言内容的公开 GitHub 仓库。在构建该数据集时,我们发现语言分布在 README、issue 和 pull request 之间有所不同:韩语是 issue 文本中最常见的非英语语言,但在 README 中仅排名第五。葡萄牙语以超过 300 万个仓库位居非英语 README 列表之首。该数据集现已在 GitHub 上以 CC0-1.0 许可发布。这兑现了我们于 2025 年作为微软欧洲数字承诺(Microsoft's European Digital Commitments)的一部分所做出的承诺,即让多语言数据更易于获取,包括面向开源 AI 开发者。

数据集包含什么

GitHub 多语言仓库数据集有意不包含仓库内容的原始转储。相反,它是一个元数据集,帮助开发者和研究人员找到可能存在多语言协作的仓库。该数据集涵盖超过 4000 万个仓库的超过 8000 万条分类记录。对于每个公开仓库,我们提供:

我们有意没有将三个分类器的结果合并为单个标签。不同的分类器具有不同的覆盖范围和置信度校准,尤其是对于资源较少的语言。通过公开所有三个分类器的结果,我们让您自行决定严格程度。想要一个高精度的希腊语子集?可以要求所有三个分类器在某个置信度阈值以上达成一致。想要对罗曼语族进行探索性研究以获得广泛的召回率?一个分类器可能就足够了。

你能用它构建什么

该数据集专为那些难以用通用网络文本完成的工作而设计:

一些注意事项

语言识别很困难,尤其是在软件仓库中。仓库文本通常很短。它可能包含徽章、模板、安装命令、代码片段、用户名或混合语言内容。一个 150 字符的样本可能无法代表整个仓库。分类器在覆盖范围和校准方面也各不相同,尤其是对于资源较少的语言。这就是为什么该数据集不应被视为语言识别的真实基准(ground-truth benchmark)。相反,它被设计为一个透明的发现工具。用户可以检查分类结果、置信度分数和来源,然后选择适合自己研究或开发工作流程的精度和召回率权衡。

该数据集也不应用于推断仓库所有者、贡献者或社区的敏感属性。这些信号是仓库级别的元数据,而非个人级别的属性。

为什么开放多语言数据很重要

如今,许多欧洲语言在用于构建和评估 AI 系统的在线文本中仍然代表性不足。这造成了一种风险,即 AI 工具对某些开发者、语言和社区效果良好,而将其他群体抛在后面。开放数据有助于缩小这一差距。

我们构建这个数据集是因为开发者内容不同于一般的网络文本。README、issue 和 pull request 包含了软件协作的语言:安装说明、错误报告、功能请求、审查评论和社区规范。这种上下文有助于构建更能理解开发者实际工作方式的 AI 系统。

通过使多语言开发者内容信号更易于发现和分析,该数据集为研究人员、开源开发者和模型构建者提供了另一个研究软件开发中语言表征的工具。它有助于识别差距,支持更好的评估,并为欧洲及其他地区的开发者提供更具包容性的 AI 工具。它也反映了一个更广泛的原则:为开发者构建 AI 应包含开发者实际使用的社区、语言和工作流程。

下一步计划

我们将在 6 月 16 日于斯特拉斯堡举行的开放创新对话中心(Open Innovation Dialogue Hub)讨论该数据集以及开放数据对多语言 AI 的更广泛重要性。该活动由微软开放创新中心(Microsoft Open Innovation Center)、欧洲委员会(Council of Europe)和 GitHub 共同组织,将汇集政策制定者、研究人员、文化机构和开放创新领导者,共同探讨 AI、语言多样性、文化遗产和开放数据。

多语言 AI 需要多语言开发者社区。我们希望这个数据集能帮助更多人研究、支持并为这些社区构建工具。通过在 GitHub 上以 CC0-1.0 许可发布,我们邀请研究人员、开源维护者和模型构建者使用它、批评它、扩展它,并在此基础上构建评估集和工具。如果您用它做出了有趣的东西,我们很乐意听取您的反馈。

《通过新的开放数据集加速研究人员和开发者构建多语言 AI》一文最初出现在 GitHub 博客上。

译自 GitHub · AI/ML 项目 · 录于 二〇二六年六月十五日