科技逻辑 / 数字生态

构建AI原生云:企业架构师学到的艰难教训

生成式AI正在将企业云基础设施推向极限。那些先行者发现,传统云架构无法满足AI工作负载对算力、带宽和分布式部署的要求。企业架构师必须学习如何设计AI原生云,以支持大规模模型训练、实时推理和混合环境下的智能编排。

TSO 摘要

  • 生成式AI正在将企业云基础设施推向极限。那些先行者发现,传统云架构无法满足AI工作负载对算力、带宽和分布式部署的要求。企业架构师必须学习如何设计AI原生云,以支持大规模模型训练、实时推理和混合环境下的智能编排。
  • 科技逻辑 · 数字生态
  • 2026年8月12日
TSO 说明每篇文章都会结合独立报道进行交叉核验。原始信源链接与分析一并列出,读者可以直接检查依据。

信源透明

原始报道信源

  1. 构建AI原生云:企业架构师学到的艰难教训www.cio.com

几年前,企业云计算的讨论遵循着熟悉的模式。团队讨论迁移遗留应用、现代化基础设施以及降低数据中心成本。目标很明确:将工作负载迁移到可扩展的云平台,并获得运营灵活性。

但近几个月来,这些对话的基调发生了显著变化。

在我参与架构评审和基础设施规划会议中,现在问题听起来截然不同:

  • 模型训练在哪里运行?

  • 我们是否能访问GPU集群?

  • 我们的数据管道能否支持实时推理?

原因很简单:人工智能——尤其是生成式AI——正在将企业基础设施推向传统云架构无法处理的范围。许多组织正在发现,未来不仅是“云优先”,而是“AI原生”。

当AI成为压垮云的负载

在许多组织中,转折点出现在团队首次尝试大规模生成式AI部署时。

一个业务部门可能想要构建文档智能系统、内部知识助手或由大语言模型驱动的预测分析平台。从纸面上看,这看起来只是另一个云工作负载。但实施很快揭示了不同之处。

AI工作负载的行为与传统企业应用完全不同。它们需要海量数据集、GPU加速计算和高吞吐量数据管道,以便持续为机器学习模型提供数据。为事务性系统设计的基础设施通常难以应对这些条件。

我亲眼看到过团队发现这种情况:他们现有的云环境突然成为瓶颈——不是因为应用流量,而是因为AI模型训练工作负载。这是许多组织意识到这一点的时刻:AI不仅仅是云中的另一个应用,而是一种新的基础设施范式。

在某些情况下,即使是架构良好的微服务环境也难以跟上,暴露出存储I/O、网络延迟和工作负载隔离方面的限制。这些隐藏的约束往往只有在持续AI工作负载下才会显现,使其在初始规划阶段难以预测。

AI原生基础设施:GPU集群与高性能计算

传统企业云环境针对CPU工作负载和事务性应用进行了优化。相比之下,AI系统优先考虑GPU加速计算、高带宽网络、分布式存储和可扩展的训练管道。

像AMD ROCm这样的工具凸显了向GPU原生生态系统的转变,提供了一个专门为高性能AI工作负载设计的全栈平台。但采用GPU基础设施不仅仅是配置容量——而是要高效利用它。

许多组织低估了GPU调度、内存碎片和工作负载争用的复杂性。与易于分布的CPU工作负载不同,GPU工作负载需要仔细编排以避免利用率不足。

这些平台表明,AI工作负载正在重塑云基础设施的设计方式——从以CPU为中心的计算层转向为大规模并行和高吞吐量数据处理而优化的AI原生架构。

此外,专用AI加速器和定制硅片等新兴创新进一步使基础设施决策复杂化。架构师现在不仅要评估性能,还要评估可移植性和供应商锁定。

混合环境中分布式AI的兴起

企业AI部署中浮现的另一个模式是向分布式基础设施的转变。

早期云计算鼓励组织将工作负载整合到单一云提供商中。这简化了治理并降低了运维复杂性。

但AI工作负载常常引入新的约束。某些数据集必须保留在私有基础设施中以满足合规要求。训练大型模型需要仅在特定云区域可用的专用GPU集群。实时推理可能需要在数据生成的地方就近运行。因此,许多企业现在运营着混合和多云AI环境。

像Google Cloud Vertex AI这样的平台明确设计用于混合AI管道,使组织能够在本地系统和多个云环境中训练和部署模型。

在这些环境中,AI不局限于单一云环境。相反,智能分布在基础设施各层。

挑战从部署应用转变为跨多个环境编排AI系统。

这种分布式还引入了数据一致性、模型版本控制和延迟管理方面的新挑战。确保模型在不同环境中表现一致成为关键要求,尤其是在受监管行业。

智能编排变得至关重要

随着AI基础设施日益复杂,手动云管理变得越来越不切实际。

现代企业环境可能涉及数千个容器、分布式数据集和跨多个云平台运行的多个计算集群。

为了管理这种复杂性,组织开始依赖智能编排平台。这些系统使用机器学习来监控基础设施使用情况、预测计算需求并动态分配资源。

像UCUP这样的框架展示了下一代编排——能够协调多个AI代理、监控性能并实时调整执行策略的系统。这些平台超越了简单的调度,进入智能决策层。

具有讽刺意味的是,人工智能不仅正在改变企业工作负载——它还成为管理云基础设施本身的系统。

随着时间的推移,这可能会导致基本自治的基础设施环境,人类操作员更多关注政策和监督,而不是直接系统管理。

企业AI的成本现实

尽管AI承诺了所有创新,其财务影响却不容忽视。

大语言模型需要巨大的计算资源。GPU集群昂贵且常常稀缺。训练一个模型可能消耗大量云预算。

这迫使许多组织重新思考其对云计算的财务方法。

FinOps等实践(专注于管理和优化云支出)在AI驱动的环境中变得必不可少。

团队正在尝试各种策略,例如:

  • 模型优化和压缩

  • 分布式训练架构

  • 无服务器推理模型

  • 跨成本效益区域的工作负载调度

在某些情况下,组织甚至重新考虑混合策略,当经济性倾向于私有基础设施时,将某些AI工作负载迁回本地。

事实证明,AI创新需要金融架构和技术架构同等对待。

FinOps团队越来越多地与数据科学家和ML工程师直接合作,创建一个新的跨职能学科,专注于平衡性能与成本效率。

AI原生企业云的出现

也许最重要的转变是概念性的。

十多年来,云主要作为托管应用的基础设施。

但AI正在将云转变为更强大的东西。

它正在成为机器智能的平台。

云环境不再仅仅运行软件,而是支持系统从数据中学习、生成洞察并自动化决策。

有远见的组织开始意识到这一现实来设计他们的基础设施。

他们不仅仅在迁移工作负载。

他们在构建AI原生云生态系统,旨在支持大规模数据驱动的智能。

这也意味着将AI考虑因素嵌入到每一层架构——从数据摄取和存储到安全性、合规性和用户体验。

企业云架构的下一个篇章

第一波云转型专注于现代化。

下一波是关于支持增强人类决策、自动化运营和解锁全新数字能力的智能系统。

这种转变迫使企业架构师重新思考云基础设施的基础——从计算架构和数据管道到编排和治理。

适应最快的组织不会仅仅在云中运行AI工作负载。

他们将构建专为智能设计的云环境。

在这个过程中,他们将定义下一代企业基础设施的样子。

然而,那些未能适应的组织,可能会被陈旧的架构假设所束缚,这些假设已不再符合AI驱动创新的需求。

本文由Foundry专家贡献者网络发布。

科技逻辑