Growing the Cloudflare AI team with talent from Ensemble AI

TL;DR · AI 摘要
Cloudflare 吸收 Ensemble AI 团队,推动 AI 基础设施发展,提升模型效率与部署能力。
核心要点
- Ensemble AI 开发了 NdLinear,用于减少参数数量并提升模型效率。
- Cloudflare Workers AI 提供无服务器 GPU 推理,降低 AI 应用成本。
- Ensemble AI 的方法与量化等技术结合,提升模型部署的经济性。
结构提纲
按章节快速跳转。
- §引言
Cloudflare 宣布吸收 Ensemble AI 团队,以增强 AI 基础设施能力。
Ensemble AI 致力于提升模型效率,开发了 NdLinear 和 NdLinear-LoRA 等方法。
NdLinear 是一种替代线性层的方法,可减少参数数量并提升模型效率。
Cloudflare Workers AI 提供无服务器 GPU 推理,降低 AI 应用成本。
模型效率提升有助于降低 AI 应用的内存、计算和成本需求。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Cloudflare AI 团队扩展
- Ensemble AI 技术整合
- NdLinear 方法
- NdLinear-LoRA 优化
- Cloudflare Workers AI
- 无服务器 GPU 推理
- 降低 AI 应用成本
金句 / Highlights
值得收藏与分享的关键句。
Ensemble AI 开发了 NdLinear,一种替代线性层的方法,可减少参数数量并提升模型效率。
Cloudflare Workers AI 提供无服务器 GPU 推理,使开发者能够更高效地部署 AI 模型。
模型效率提升有助于降低 AI 应用的内存、计算和成本需求,使 AI 更加经济实惠。
通过引入 Ensemble AI 的人才壮大 Cloudflare AI 团队
2026-06-15
- Alex Reneau
- Zach Albertson
- Michelle Chen
3 分钟阅读
今天,我们非常高兴地宣布,Ensemble AI 团队的关键成员将加入 Cloudflare,帮助我们加速在 AI 基础设施方面的工作,使开发者能够更高效地大规模运行强大的 AI 模型。
Ensemble AI 于 2023 年在旧金山成立,过去几年一直专注于 AI 领域最重要的挑战之一:在不牺牲质量的前提下,使大型模型运行得更快、更小、更经济。该团队开发了新的模型压缩和高效推理方法,旨在减少大型语言模型和多模态架构的内存、计算和部署开销。
随着 AI 成为开发者构建应用程序的核心部分,推理的经济性变得比以往任何时候都更加重要。模型正在变得更大;工作负载变得越来越动态。客户越来越期望 AI 能够无处不在:全球分布、快速、可靠且经济实惠。将 Ensemble AI 团队引入 Cloudflare 增强了我们实现这一目标的能力。
融合 Ensemble 的专业知识
Ensemble AI 团队专注于在减少运行成本的同时,保留现代 AI 模型内部的结构。他们没有将模型效率仅仅视为量化或硬件问题,而是探索了新的模型构建模块,使神经网络在架构层面更加紧凑和高效。
这项工作的核心是 NdLinear,它是 Transformer 模型中标准线性层的即插即用替代方案,可以直接在多维激活上运行,而不是将结构扁平化。这使模型能够保留有意义的轴,如头、通道、空间维度或其他结构化表示,同时减少参数数量和计算量。Ensemble 还开发了 NdLinear-LoRA,这是一种高效的适应方法,旨在减少微调大型模型所需的可训练参数。
这些方法补充了其他效率技术,包括量化和向量量化。它们共同指向一个未来,开发者可以用显著降低的内存、计算和成本要求来运行功能强大的 AI 模型。
提高 AI 推理的效率
Cloudflare Workers AI 为开发者提供了在 Cloudflare 全球网络上使用无服务器 GPU 推理的能力。随着开发者构建越来越多的 AI 原生应用,高效地提供模型成为平台的关键部分。
推理成本是扩展 AI 应用的最大障碍之一。模型大小、内存占用、吞吐量和 GPU 利用率的每一次改进,都能使 AI 对开发者更加可及,对客户更加经济。随着 AI 工作负载从简单的文本生成扩展到代理、多模态模型、个性化、微调、检索和强化学习,这一点尤为重要。
我们正在加大对核心机器学习能力的投资,以使 Workers AI 更加高效、灵活且成本更低。这建立在我们现有的工作基础之上,包括提高模型效率的工作,例如我们的推理引擎 Infire、张量压缩技术 Unweight,以及我们用于运行超大语言模型的平台。团队将专注于改进大型语言模型和其他先进 AI 架构的服务经济性,重点在于模型效率、GPU 利用率和可扩展部署。
为下一代 AI 工作负载构建基础设施
AI 基础设施正在进入一个新阶段。开发者不再仅仅需要访问模型,他们需要能够可靠、经济且贴近用户运行模型的基础设施。他们需要能够在不因成本或操作复杂性受阻的情况下,尝试不同模型规模、微调方法和部署模式。
Cloudflare 独特地处于帮助解决这一问题的有利位置。我们的全球网络、开发者平台和无服务器架构为我们提供了基础,使 AI 能够更接近应用程序已经运行的地方。Workers AI 机器学习工程团队将帮助我们改进这一体验背后的基础效率层。
通过结合 Cloudflare 的全球基础设施与 Ensemble 在模型压缩和高效架构方面的工作,我们可以继续构建一个平台,让开发者能够以更低的成本、更好的性能和更少的操作负担部署 AI 应用程序。
接下来是什么
我们将继续构建所需的基础设施,使 AI 更加高效、易于访问,并对全球各地的开发者更有用。我们的目标很简单:帮助开发者在全球范围内运行强大的 AI 工作负载,同时在 Cloudflare 平台上改进推理的经济性。如果你想加入我们,共同实现这一使命,请查看我们的职业页面。
[if astro]>server-island-start<![endif]
Workers AI
AI