Microsoft Azure Blog

Azure IaaS:通过系统级方法部署高性能工作负载

8.5内容质量
Azure IaaS:通过系统级方法部署高性能工作负载

TL;DR · AI 摘要

Azure IaaS通过系统级优化计算、存储和网络协同,实现高性能工作负载的一致性和可扩展性,关键工具包括Azure Boost和Blob Storage。

核心要点

  • Azure Boost通过专用硬件和软件卸载存储/网络处理,减少CPU开销,提升AI工作负载吞吐量和延迟一致性
  • Azure Blob Storage和ADLS提供高吞吐低延迟存储,确保数据访问不成为AI训练/推理瓶颈
  • 系统级性能评估需关注尾延迟(P99/P99.9)、吞吐量、可扩展性和一致性,而不仅仅是峰值速度

结构提纲

按章节快速跳转。

  1. 现代云性能需通过计算、存储、网络的协同优化实现,而非孤立资源堆砌

  2. 包含尾延迟、吞吐量、可扩展性、一致性及时间到性能的五维评估体系

  3. 通过Azure Boost硬件加速和存储优化实现AI训练/推理的端到端性能提升

  4. Azure Boost通过专用硬件卸载虚拟化开销,释放CPU资源用于核心计算

  5. Azure Blob StorageADLS提供高吞吐存储,支持持续大数据访问需求

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Azure系统级性能优化
    • 核心架构
      • 计算层加速
      • 存储层优化
      • 网络协同
    • 评估维度
      • 尾延迟(P99)
      • 吞吐量
      • 可扩展性

金句 / Highlights

值得收藏与分享的关键句。

#Azure IaaS#高性能计算#AI优化#系统级架构
打开原文

云中的性能不再由单个资源定义——而是由计算、存储和网络的协同作用塑造。Azure IaaS 采用系统级方法,帮助组织在 AI、云原生及关键业务工作负载中实现一致且可扩展的性能表现。

_这是名为Azure IaaS的博客系列第三部分,将分享构建可信基础设施平台的最佳实践——涵盖性能、弹性、安全性、可扩展性及成本效益。_

如今,性能已成为决定应用程序在云端成功或失败的关键因素之一。 无论是训练AI模型、扩展Kubernetes平台,还是运行关键业务数据库,性能不再仅由CPU、存储或网络的单一决策决定。它是各组件协同工作的结果,需要系统级方法。

许多组织仍通过增加资源(更大虚拟机、更快磁盘或更高网络带宽)来应对性能问题。但现代工作负载的行为难以预测,这种策略已不再奏效。瓶颈会动态变化:数据库可能在某一刻受存储延迟限制,下一刻又因网络带宽不足受阻;AI流水线可能因节点间数据移动速度不足而停滞,而非计算资源不足。

因此,云中的性能已从资源层面的挑战演变为系统级难题。Azure 采用不同的方法,将性能设计到平台中,使客户无需手动调优每一层即可获得一致且可扩展的结果。

重新定义云中的性能

当今的性能不仅关乎峰值速度,更关乎真实场景下的稳定性、可扩展性和响应能力。

对于客户而言,需从多维度评估性能:

  • 延迟——包括尾部延迟(P99/P99.9),直接影响用户体验。
  • 吞吐量——单位时间可完成的工作量。
  • 可扩展性——需求增长时维持性能的能力。
  • 一致性——确保负载下性能不意外降级。

同样关键的是性能响应时间,即基础设施快速供应、扩展或恢复的能力。在许多情况下,应对变化的速度与系统运行速度同样重要。

Azure IaaS 将这些维度整合,将计算、存储和网络能力与特定工作负载需求对齐。最终实现的性能是协调一致的系统输出,而非孤立组件的简单拼接。

通过系统级性能加速AI工作负载

AI工作负载对性能要求极高。训练和推理流水线需要大规模并行计算、高吞吐量数据访问,以及分布式组件间的低延迟通信。

在这些场景中,性能的强弱取决于最薄弱的环节。Azure通过优化完整数据路径解决这一问题。

平台加速提升计算效率

Azure Boost 通过将存储和网络处理从主机CPU转移到专用硬件和软件组件,帮助提升VM性能。这减少了hypervisor开销,释放更多计算周期用于模型训练和推理,从而改善吞吐量和延迟一致性。

高吞吐量存储保障持续数据访问

AI工作负载依赖对大型数据集的持续访问。Azure存储选项(如Azure Blob Storage和ADLS)设计用于提供持续的IO性能,确保计算资源不会因等待数据而闲置。这些服务提供的高吞吐量、低延迟和大规模扩展能力,为AI工作负载构建了坚实的数据基础——支持快速摄取和检索训练及推理所需的大数据集。其优化的并行数据访问和与AI工具的无缝集成,可最大化计算利用率并消除流水线瓶颈。

低延迟、高带宽网络

分布式训练需要节点间的快速通信。Azure的网络服务(如Azure ExpressRoute)支持集群间快速数据移动,减少同步延迟并提升整体训练效率。这可避免计算资源闲置。

这些能力共同确保计算性能的提升不会受限于存储或网络瓶颈。组织因此能够处理更多数据、更快训练模型,且无需承担不必要的基础设施开销。

扩展云原生应用而不牺牲性能

面向 Kubernetes 的动态高性能存储

Azure Container Storage 允许 AKS 工作负载通过 Kubernetes 原生配置直接使用本地 NVMe 磁盘。这有助于消除手动磁盘配置的需求,同时为有状态服务提供亚毫秒级延迟和高 IOPS(每秒输入输出操作)。

Kubernetes 上的生产级数据平台

借助 CloudNativePG 等工具,企业可以直接在 AKS 上运行 PostgreSQL 等数据库,同时内置高可用性、故障转移和备份功能,且不牺牲性能。通过同时支持文件和对象存储的灵活数据访问方式,进一步强化了这一基础架构。应用程序可根据需求选择最合适的存储接口,同时简化跨环境的数据迁移和恢复。

低延迟的服务通信

微服务架构依赖组件间的高频通信。通过 Cilium 的 eBPF 主机路由和 高级容器网络服务,数据路径效率得到提升,降低了延迟并提高了吞吐量,从而支持大规模微服务环境的高性能通信。Azure 的网络基础设施确保服务间交互保持快速和稳定,避免因延迟问题成为系统瓶颈。

最终,这一平台使无状态和有状态工作负载都能在动态扩展的同时保持性能。由于资源可按需配置和扩展,企业能够通过按实际使用量付费的方式提升成本效益,同时维持应用响应能力。

保障关键业务系统的持续性能

对于关键业务负载(如企业数据库、SAP 环境和事务系统),性能不仅关乎速度,更需要稳定性和可靠性。

这些系统必须在持续负载下提供一致的性能,通常伴随着严格的延迟和可用性要求。即使是边缘的性能波动也可能对业务产生显著影响。

Azure 通过精准的控制和平台级优化解决这一挑战。

稳定的计算性能

Azure 通过专用虚拟机架构、智能部署和平台级编排,确保计算性能的一致性。虚拟机规模集 (VMSS) 可自动在故障域和更新域间分布和扩展工作负载,帮助在需求变化时维持可预测的性能。Azure 进一步通过 Azure Boost 增强一致性,该功能将虚拟化和 I/O 处理卸载到专用硬件,减少资源竞争并提升效率。

可调式存储性能

Azure Ultra Disk 和 Premium SSD v2 允许客户独立配置容量、IOPS 和吞吐量。这种解耦设计可精准匹配存储性能与工作负载需求,避免性能不足或不必要的成本。

除了 Ultra Disk 和 Premium SSD v2 等可调式块存储选项,Azure 还提供了高持久性对象和文件存储服务,例如 Azure Blob StorageAzure Files,这些服务通过跨区域冗余和长期数据保护,为非结构化数据和共享工作负载提供企业级耐用性和扩展能力。

可靠的低延迟网络

交易系统各应用层间的稳定通信至关重要。Azure 的网络基础设施通过加速网络(绕过虚拟交换机路径降低网络延迟)和邻近放置组(在数据中心内物理上将延迟敏感型工作负载靠近部署)等功能,确保跨环境的低且可预测的延迟。结合 Azure Boost(将网络处理卸载到专用硬件)以及优化型 VM 系列对高带宽多网卡配置的支持,这些功能共同实现了快速、确定性的数据传输,并帮助在大规模部署中保持一致的应用性能。

快速恢复能力

性能还包括系统恢复速度。即时访问快照(Instant Access Snapshots)支持磁盘立即恢复(无需等待数据加载),从而减少停机时间并加速故障后的恢复。

这一功能与 Azure Backup 的快速恢复能力相辅相成,进一步缩短恢复时间。而区域冗余存储(ZRS)通过跨可用区存储数据,可降低局部中断的影响。

对于更广泛的事件,Azure Site Recovery 能够跨区域协调故障转移,快速恢复工作负载。这些能力通过 Azure 磁盘增量快照进一步增强,仅捕获变更数据以减少恢复点目标(RPO),同时保持极低的开销,从而在各种场景下实现更快、更高效的恢复。

这种组合确保性能不仅在常规操作中得以维持,更在峰值需求和恢复场景等关键时刻保持稳定。

性能作为协同系统

无论是 AI、云原生还是关键业务工作负载,一个清晰的模式显现:性能并非通过孤立优化单一组件实现。

而是取决于计算、存储和网络如何协同调整以适配具体工作负载需求。

这种协同有助于减少瓶颈,确保各领域的改进能够相互强化。同时简化运维,使团队能够专注于工作负载设计和业务成果,而非基础设施调优。

实践指南:针对工作负载的优化

虽然 Azure 提供了坚实基础,但要实现最优性能仍需将基础设施选择与工作负载需求对齐:

  • 对于 AI 工作负载,需在计算、存储和网络之间平衡吞吐量,避免资源闲置并提升效率。
  • 对于云原生应用,设计水平扩展能力并利用 Kubernetes 原生存储,以保持有状态服务的性能。
  • 对于关键业务系统,需关注一致性和可预测性,通过可调式存储和优化型计算满足严格性能要求。
  • 在所有场景中,需全面评估性能表现,并利用平台能力降低开销、简化优化流程。

构建性能导向的基础设施

性能直接影响应用的各个方面——从用户体验到运营效率,再到创新扩展能力。

通过将计算、存储和网络整合为统一平台,Azure 帮助企业跨最严苛的工作负载实现高性能——无需单独管理每一层的复杂性。

探索 Azure 如何实现跨 AI、云原生及关键业务工作负载的高性能

深入了解更多,访问 Azure IaaS 资源中心,获取计算、存储和网络领域的教程、最佳实践和指南,帮助您更自信地设计和运维高弹性的基础设施。

错过这些 [Azure IaaS 系列](https://nam06.safelinks.protection.outlook.com/?url=https%3A%2F%2Fazure.microsoft.com%2Fen-us%2Fblog%2Ftag%2Fazure-iaas%2F&data=05%7C02%7Cv-hananirfan%40microsoft.com%7Cb5058b1bf4af44215ce008deb20271ca%7C72f988bf86f141af91ab2d7cd011db47%7C1%7C0%7C639143921106586040%7CUnknown%7CTWFpbGZsb3d8eyJFbXB0eU1hcGkiOnRydWUsIlYiOiIwLjAuMDAwMCIsIlAiOiJXaW4zMiIsIkFOIjoiTWFpbCIsIldUIjoyfQ%3D%3D%7C0%7C%7C%7C&sdata=OoIPSbadbeflAuSU8NM5vySzN30ao2bCSFEWQFsD4WU%3D&reserved=0) 文章吗?