Cloudflare AI 团队吸纳 Ensemble AI 人才壮大队伍
Growing the Cloudflare AI team with talent from Ensemble AI
Ensemble AI 团队核心成员加入 Cloudflare,以增强其 AI 基础设施能力。Ensemble AI 于2023年在旧金山成立,专注于模型压缩与高效推理,开发了 NdLinear(Transformer 中标准线性层的替代品)和 NdLinear-LoRA 等架构级方法,旨在降低大语言模型和多模态模型的内存、计算与部署开销。该团队将融入 Cloudflare 的 Workers AI 平台,与推理引擎 Infire 及张量压缩技术 Unweight 协同,改善模型效率、GPU 利用率和可扩展部署,使开发者能以更低成本在全球网络运行 AI 工作负载。
今天,我们很高兴地宣布,Ensemble AI 团队的核心成员将加入 Cloudflare,助力我们在 AI 基础设施方面的工作,让开发者能够更轻松地大规模高效运行强大的 AI 模型。Ensemble AI 于 2023 年在旧金山成立,过去几年一直专注于 AI 领域最重要的挑战之一:在不牺牲质量的前提下,让大型模型的部署更快、更小、更具成本效益。该团队开发了模型压缩和高效推理的新方法,旨在降低大语言模型和多模态架构的内存、计算和部署开销。随着 AI 成为开发者构建应用的核心部分,推理的经济性比以往任何时候都更加重要。模型越来越大,工作负载越来越动态,客户也越来越期望 AI 无处不在:全球分布、快速、可靠且价格合理。将 Ensemble AI 团队引入 Cloudflare,将增强我们实现这一目标的能力。
融入 Ensemble 的专业知识
Ensemble AI 团队专注于在降低运行成本的同时,保留现代 AI 模型内部的结构。他们没有将模型效率仅仅视为量化或硬件问题,而是探索了新的模型构建模块,这些模块可以在架构层面使神经网络更加紧凑和高效。这项工作的核心之一是 NdLinear,它是 Transformer 模型中标准线性层的即插即用替代品,直接对多维激活进行操作,而不是将结构扁平化。这使得模型能够保留有意义的轴(如 head、通道、空间维度或其他结构化表示),同时减少参数数量和计算量。Ensemble 还开发了 NdLinear-LoRA,这是一种高效的适配方法,旨在减少微调大型模型所需的可训练参数。这些方法与其他效率技术(包括量化和向量量化)相辅相成。它们共同指向一个未来:开发者能够以显著更低的内存、计算和成本需求来运行功能强大的 AI 模型。
让 AI 推理更高效
Cloudflare Workers AI 让开发者能够在 Cloudflare 的全球网络上访问无服务器 GPU 驱动的推理。随着开发者构建更多 AI 原生应用,高效部署模型的能力成为平台的关键部分。推理成本是扩展 AI 应用的最大障碍之一。模型大小、内存占用、吞吐量和 GPU 利用率的每一次改进,都能让 AI 对开发者更易用,对客户更经济。这一点在 AI 工作负载从简单的文本生成扩展到 agent、多模态模型、个性化、微调、检索和强化学习时尤为重要。
我们正在深化对核心机器学习能力的投入,这些能力将使 Workers AI 更快、更灵活、更具成本效益。这建立在我们现有改进模型效率的工作基础之上,包括我们的推理引擎 Infire、像 Unweight 这样的张量压缩技术,以及我们运行超大型语言模型的平台。该团队将专注于改善大语言模型及其他先进 AI 架构的部署经济性,重点放在模型效率、GPU 利用率和可扩展部署上。
为下一代 AI 工作负载构建
AI 基础设施正在进入一个新阶段。开发者不再仅仅需要访问模型;他们需要能够可靠、经济地运行模型,并且靠近用户的基础设施。他们需要能够尝试不同的模型大小、微调方法和部署模式,而不受成本或操作复杂性的阻碍。Cloudflare 在帮助解决这个问题方面具有独特的优势。我们的全球网络、开发者平台和无服务器架构为我们提供了基础,使 AI 更接近应用已经运行的地方。Workers AI 机器学习工程团队将帮助我们改善该体验背后的效率层。通过将 Cloudflare 的全球基础设施与 Ensemble 在模型压缩和高效架构方面的工作相结合,我们可以继续构建一个平台,让开发者能够以更低的成本、更好的性能和更少的运营开销来部署 AI 应用。
下一步计划
我们将共同努力,继续构建所需的基础设施,让 AI 对世界各地的开发者更高效、更易用、更有用。我们的目标很简单:帮助开发者在全球范围内运行强大的 AI 工作负载,同时改善 Cloudflare 平台上推理的经济性。如果你想加入我们的使命,请查看我们的招聘页面。