1. 理解横向扩展架构
几十年来,默认策略很简单:需要更多容量时,就购买更大的设备。横向扩展架构则采用截然不同的方法,通过在众多互联节点间分配工作负载。这与现代应用程序的实际运行方式自然契合。AI训练、分布式数据库和容器化应用程序均受益于横向扩展,即增加节点可线性提升容量。
在大多数环境中,这两种方法将并存。关键在于理解每种架构适用于哪些用例,并确保网络基础设施同时支持两者。
建议:横向扩展并不自动意味着高效。若未针对通信、同步和延迟进行专门设计,将工作负载分散到更多节点上可能会降低整体效率。在大型AI系统中,规划不当的横向扩展架构可能导致GPU和XPU闲置,且随着集群规模扩大,收益递减。
2. 架构与硬件选择
你如今选择的架构将在未来数年内决定AI工厂的产出能力,智能设计应从满足AI工作负载和使用场景的增长及动态变化需求出发,而非仅着眼于当前需求。
设计灵活性与高可用性
现代横向扩展网络必须能够无缝扩展,且不中断服务。这要求采用这样的设计模式:增加容量只需连接新节点,而非重构现有基础设施。从设计之初,就要在架构中融入强大的遥测技术、快速故障检测和快速恢复机制。
建议:优化架构,而非追求表面指标。高端口速度并不保证更好的AI性能。系统常因延迟变化和负载下的不可预测行为而达到极限。硬件应根据确定性性能和一致性进行评估,而非仅看峰值吞吐量。
战略性硬件选择
硬件选择将在未来数年内影响整个基础设施,高密度交换是横向扩展网络的骨干,应寻找提供高端口密度且吞吐量以太比特每秒为单位的交换机。
现代部署越来越需要400GE连接,并具备明确的升级路径至800GE及以上。你的硬件必须能够扩展以支持数万个节点,且无瓶颈。不仅要评估表面速度,还要评估缓冲架构、交换结构和AI基础设施如何处理特定流量模式。
建议:通用硬件可能增加隐性开销,针对广泛企业用例优化的网络平台,往往携带对AI工作负载无益的功能和架构,从而增加延迟和功耗,专用设计通常能提供更好的每瓦性能和更可预测的行为。
确保投资面向未来
更新设备时,你不可避免地会同时运行多代产品。确保新硬件能够与遗留系统共存,而不会造成性能断崖或管理噩梦。
开放标准可防止供应商锁定,并实现真正的互操作性。关注新兴标准,如超以太网联盟(UEC)规范和统一以太网的IEEE标准。尽管专有解决方案可能提供短期优势,但开放标准通常能提供更好的长期灵活性和有竞争力的价格。
注意:标准的应用方式决定结果。开放标准实现互操作性,但实际效果取决于其在整个系统中的有效实施程度。要全面评估系统,包括卸载粒度、数据路径设计和与加速器的集成。
3. 性能工程
若网络无法在需要时持续提供原始带宽,则带宽意义不大。横向扩展环境中的性能工程需关注流量模式、拥塞管理和延迟控制。
流量管理与优化
传统网络强调AI客户端应用程序与AI服务器之间上下流动的南北向数据流量。横向扩展架构则关注AI服务器节点之间的东西向流量。动态、基于工作负载感知的流量控制和负载均衡对于智能地在可用服务器节点和通信路径上分配流量、防止热点至关重要。
高密度环境中的拥塞控制
当成千上万个节点同时通信时,如何管理拥塞决定了网络性能的一致性。
优先级流量控制(PFC)在缓冲区满时暂停流量,这对于无法容忍数据包丢失的远程直接内存访问(RDMA)等工作负载至关重要。
显式拥塞通知(ECN)则通过在拥塞发生时标记数据包提供更精细的方法,允许端点在缓冲区溢出前降低传输速率。这有助于以更小的广泛影响风险管理拥塞。现代实现还支持在极端拥塞时修剪数据包,以维持更高优先级的流量。
AI和高性能计算(HPC)工作负载常涉及紧密耦合的并行处理,即使网络性能的微小变化也会显著影响作业完成时间。
延迟管理
横向扩展网络通常比纵向扩展解决方案具有更高的延迟。物理定律决定了穿越多个网络跳数需要时间。通过适当设计,你可以保持一致的低延迟。
关键技术包括适当的缓冲区大小、精细的队列管理和战略性放置对延迟敏感的组件以最小化跳数。
注意:平均延迟掩盖了真正的瓶颈。许多AI工作负载受限于最坏情况和尾部延迟,而非平均值。延迟峰值可直接降低吞吐量、违反服务水平协议(SLA)并浪费GPU/XPU周期。
4. 物理与财务现实
网络架构必须应对可能使最佳技术设计脱轨的物理限制和财务现实。
基础设施三要素:空间、电力、冷却
进行诚实的部署前设施审计。有时,物理限制使得混合架构或云扩展比纯内部横向扩展更实用。
高密度网络设备产生大量热量并消耗大量电力。单个高端交换机可能耗电数千瓦。空间限制不仅限于物理机架容量。高密度连接意味着数百或数千根电缆,这使维护和气流复杂化。散热可能需要热量控制、行内冷却甚至液体冷却解决方案。
注意:网络可能成为隐藏的电力税。低效设计会增加电力和冷却需求,同时提供很少的额外性能。应根据交付的工作负载输出而非端口数量来评估效率。
理解总拥有成本
横向扩展网络改变了你对IT投资的看法。它可创造财务灵活性,但需要不同的预算方法。
资本支出不仅限于硬件购买价格。安装、集成和初始配置也增加大量成本。然而,横向扩展使投资能够分散到多个预算周期。
考虑多年来不断累积的电力和冷却成本,以及维护合同、软件许可和特殊技能人员成本。考虑开发一个AI效率指数,量化你的基础设施相对于总基础设施支出支持创收AI工作负载的有效性。
注意:总拥有成本(TCO)模型常忽略利用率损失。硬件价格本身并不反映真实成本。通信瓶颈导致的GPU/XPU闲置会显著增加每个工作负载的成本。在投资回报率计算中纳入利用率、效率和输出性能。
构建面向未来十年的网络
向横向扩展网络的转变不仅是一次技术升级,它是基础设施与现代应用程序实际运行方式的战略调整。将工作负载分散到多个节点意味着单个故障影响较小,但你必须有意设计以实现这一优势。成功需要平衡创新与稳定、灵活与成本控制以及即时需求与未来要求。
蓬勃发展的组织将把网络基础设施视为动态平台,而非静态资产,该平台随业务需求演变。战略性地实施横向扩展网络,正是提供了这样的基础。
企业网D1net(www.d1net.com):
国内头部to B IT门户,旗下运营国内头部的甲方CIO专家库和智力输出及社交平台-信众智(www.cioall.com)。旗下运营19个IT行业公众号(微信搜索D1net即可关注)。
版权声明:本文为企业网D1Net编译,转载需在文章开头注明出处为:企业网D1Net,如果不注明出处,企业网D1Net将保留追究其法律责任的权利。






























































































京公网安备 11010502049343号