Ensemble AI团队加入Cloudflare 加速AI基础设施建设

发布于

今天,我们非常高兴地宣布,Ensemble AI的核心团队成员加入Cloudflare,将助力我们在AI基础设施领域的工作,让开发者能更高效地运行强大的AI模型。

Ensemble AI成立于2023年,专注解决AI行业中的一个重大挑战:在不牺牲质量的情况下,使大型模型的运行速度更快、更小、更具性价比。该团队已开发出新方法,专注于模型压缩和高效推理,旨在减少大型语言模型和多模态架构的内存、计算和部署开销。

随着AI成为开发者构建应用程序的核心部分,推理的经济性变得比以往任何时候都重要。模型愈发庞大;工作负载变得更加动态。客户越来越期望AI无处不在:全球分布、快速、可靠且价格合理。Ensemble AI团队的加入将增强Cloudflare实现这一目标的能力。

### 融合Ensemble的专业知识

Ensemble AI团队专注于在降低运行成本的同时保留现代AI模型内部结构。Ensemble探讨了一种新的模型构建模块,除了量化或硬件问题外,还能在架构层面使神经网络更加紧凑和高效。

这项工作的核心是[NdLinear](https://github.com/ensemble-core/ndlinear),一个可替代标准线性层的替代品,专门针对多维激活而设计,避免了将结构扁平化。这使得模型能保留有意义的轴,例如头、通道、空间维度或其他结构化表示,同时减少参数数量和计算需求。同时,Ensemble还开发了NdLinear-LoRA,一个高效的适应方法,旨在减少微调大型模型所需的可训练参数。这些方法与其他高效技术相互补充,包括量化与向量量化,指向一个未来:开发者可以以显著更低的内存、计算和成本要求运行强大的AI模型。

### 提升AI推理的效率

Cloudflare Workers AI让开发者能够在Cloudflare全球网络上无服务器使用GPU进行推理。随着开发者构建越来越多的AI原生应用,效率将是平台的关键部分。

推理成本是扩展AI应用的最大障碍之一。每一个在模型大小、内存占用、吞吐量和GPU利用率上的改善,都能使AI对开发者更具吸引力、对客户更具经济性。特别是在AI工作负载超越简单文本生成,涵盖代理、多模态模型、个性化、微调、检索和强化学习时,这一点尤为重要。我们将深化对核心机器学习能力的投资,让Workers AI变得更快、更灵活、更具成本效益。这是在已有的工作基础上进行改进,包括我们的推理引擎[Infire](https://blog.cloudflare.com/cloudflares-most-efficient-ai-inference-engine/)、张量压缩技术[Unweight](https://blog.cloudflare.com/unweight-tensor-compression/)及我们的[大规模语言模型运行平台](https://blog.cloudflare.com/high-performance-llms/)。团队将专注于改善服务大型语言模型及先进AI架构的经济效益,强调模型效率、GPU利用率和可扩展部署。

### 为下一代AI工作负载而构建

AI基础设施正进入一个新阶段。开发者不再仅仅需要访问模型;他们需要能够可靠、经济地运行模型的基础设施,并在不同的模型规模、微调方法和部署模式上进行实验,而不受成本或操作复杂性的制约。

Cloudflare恰好在这方面具备独特优势。我们的全球网络、开发者平台和无服务器架构为将AI带入更接近应用程序的地方打下了基础。Workers AI机器学习工程团队将帮助我们改善这一体验下的效率层。

通过将Cloudflare的全球基础设施与Ensemble在模型压缩和高效架构方面的工作结合,我们将继续构建一个平台,使开发者能够以更低的成本、更好的性能和更少的运营开销部署AI应用。

### 接下来是什么?

我们将继续致力于构建使AI更高效、可获取且更有用的基础设施。我们的目标很简单:帮助开发者在全球范围内运行强大的AI工作负载,同时改善Cloudflare平台的推理经济效益。如果您想加入我们的使命,可以查看[我们的招聘页面](https://www.cloudflare.com/careers/jobs/)。

![image](http://pic.zhso.org/2026/07/08/0c1c6731597c.png)

---

原文链接:[点击查看](https://blog.cloudflare.com/ensemble-ai-talent-joins-cloudflare/)

评论

暂无评论。