公众号记得加星标⭐️,第一时间看推送不会错过。
随着光互连在 AI 集群连接中发挥越来越重要的作用,数据中心网络结构正在经历又一次架构转变,并扩展到规模化领域,影响整体拓扑设计。
以往对规模化部署的定义通常是:使用铜缆互连的单个机架,程序员使用内存语义进行编程。但这种定义正变得越来越模糊。
Rambus的研究员兼杰出发明家 Steven Woo 表示:“过去那种向上扩展用铜缆、向外扩展用光纤的规则正在变得模糊。随着机架内部数据速率的提升,铜缆在损耗、传输距离和功耗方面都面临着物理极限,这给铜缆在机架中的应用带来了挑战。从信号传输的角度来看,光纤可以在高数据速率下提供更清晰的扩展路径,但必须在相对较短的距离内保持可控的功耗和可靠性。”
降低延迟是这一切的关键,因为GPU在等待数据时无法充分利用其性能。“有很多报告指出,这些GPU的效率可能只有25%,因为它们只是闲置在那里等待数据,”Omnitron首席执行官兼联合创始人Eric Aguilar说道。
与此同时,谷歌实现了采用环形结构的光路交换(OCS)网络,其他公司也在考虑将OCS网络应用于其他网络架构。
这种架构转变也需要对人工智能数据中心网络中扩展术语的演变进行更精确的评估。
扩展方式不断演进
随着数据中心扩展层级的不断变化,尤其是在人工智能工作负载方面,已经出现了向上扩展、向外扩展和跨域扩展等多种方法。
最近,又出现了向下扩展。“这是一个近三个月才出现的术语,”Ayar Labs 产品管理负责人 Vishal Chandrasekar 表示,“它指的是单个机箱内 GPU 输出的带宽量。”
直到最近,这些概念的定义可以概括如下:
缩减是指在单个服务器或单个主板上的处理器之间进行扩展。
扩展型存储设备位于机架内,采用铜线连接,并允许使用内存语义进行编程。(剧透警告:此功能现已过时。)
横向扩展是指在机架之间进行扩展,并采用以太网 RDMA 语义。它越来越多地使用光互连。
跨域扩展是指在不同的数据中心园区之间进行扩展,并且涉及光纤。
除了缩减规模之外,纵向扩展也在不断发展。计算集群的规模不再局限于单个机架,而是扩展到相邻机架,部署服务器。互连距离越来越长,铜缆可能不再是最佳传输介质。因此,光纤正在逐渐应用于纵向扩展。
“如果只是在机架内部,你很可能会用铜缆,” Chandrasekar 解释说。“如果是相邻机架,那就有点勉强了,但假设你坚持用铜缆。如果超出相邻机架的范围,你就得用光纤了。”
至于链路需要光纤传输多远,Chandrasekar解释说:“假设他们使用200Gbps的信号传输速率,铜缆在5米以内可能适用,如果真的要加倍,7米也行。当然,一旦超过10米,就绝对必须使用光纤了。”
如前所述,规模化部署包含三个要素:单机架、铜缆和内存语义。前两个要素目前正在逐步淘汰,剩下的决定性因素是内存语义的使用。
Synopsys接口IP产品管理总监Priyank Shukla表示:“软件开发人员将纵向扩展定义为在一个操作系统域内使用单一内存。因此,如果您正在运行一个进程,处理器可以写入一个内存位置,而无需考虑该内存位于何处。”
典型的纵向扩展和横向扩展实现方式都旨在最大限度地减少跳数。“在纵向扩展领域,每个GPU与其他任何GPU之间都只有一次跳,” Chandrasekar说道。“如果是横向扩展,则需要两次跳。”
新的 UALink 标准强制执行了单跳扩展的预期。“UALink 扩展架构旨在保持加速器之间的单交换机跳连接,”Shukla 解释道。“即使扩展域扩展到单个机架之外,加速器之间的通信也仅需经过单个 UALink 交换机。因此,跨机架连接加速器本身并不需要引入额外跳数的交换机到交换机拓扑结构。该单个交换机可以位于机架架构中的不同位置,例如机架顶部 (ToR) 或机架中部 (MoR) 部署,但关键在于加速器流量在端点之间仍然仅需经过一个交换机。”
一旦扩展域扩展到机架之外,同样的延迟和跳数限制就会将注意力从互连介质转移到连接加速器、交换机和服务器的更广泛的网络拓扑结构。
网络架构
数据中心中服务器的互连方式会影响功耗和性能,但并不存在唯一正确的配置。不同的工作负载适合不同的配置方案。
最常见的网络架构之一是 Clos 或叶脊式网络。在这种架构中,两台服务器之间有一条最短路径。虽然这种架构应用广泛,但一家大型企业却在其人工智能网络中采用了其他架构。
Chandrasekar 指出:“谷歌的网络并非叶脊式结构,而是环面网络,这意味着每个 TPU 都与相邻的 TPU 相连,这些相邻 TPU 在三个方向上相连:向上、向下和向右,使其具有收缩状特征。”

两者之间的一个关键区别在于从任意服务器到其他服务器所需的跃点数。叶脊式拓扑只需要一跳,而环面拓扑则取决于服务器的位置。上面的路径显示了四跳。
Chandrasekar指出:“如果你想从一端的GPU传输到另一端的GPU,你需要经过很多跳。” 足够长的路径可以使用光纤实现,从而获得更高的功耗/性能。但每一跳都会带来一定的效率损失,因为这类网络通常采用数据包交换的方式构建。数据包的头部包含一些信息,需要在每个交换机或路由器上进行检查。
光技术无法理解数据包。因此,上述四跳路径需要在每一跳都将光信号转换为电信号。一旦信号进入电信号域,就可以确定下一跳的位置,但在信号进行下一跳之前,它必须再次转换回光信号。
每个节点反复进行这种转换会增加延迟并消耗大量能量。有没有更好的方法来构建光网络?
电路交换技术已经过时了
如今分组交换技术被人们习以为常,但它并非网络技术的起源。以前,全国性的电话系统就使用电路交换机。电路交换意味着开辟一条从源到目的地的完整路径,并独占一条线路供一个数据流使用。在过去,这条线路上的数据流就是线路两端用户的通话。除了共用线路之外,通话期间其他人无法使用该线路。
这里打个比方比较容易理解。假设你想从洛杉矶自驾游到波士顿。现实生活中,你会和其他很多车辆共用一条路,在每个十字路口或立交桥,你和其他所有人都有机会改变路线到达目的地。任何被红绿灯堵住过的人都知道,如果其他人都让路,把路留给你,那旅行该有多轻松啊。
如果预订从洛杉矶到波士顿的全程线路,不经停任何站点,就能更快更高效地到达目的地。这就是电路交换网络的作用。它配备一个速度较慢的后台网络,用于在通话开始前配置线路路径。对于电话系统而言,最新的电路交换网络称为第七代信令系统(S7)。
问题在于,即使你还在加州境内,沿途的其他道路,甚至包括波士顿郊外的道路,都不能通行。只有当你到达目的地后,这些道路才能腾出来供其他人使用,这听起来效率很低。
数据包来帮忙……在某些情况下
这就是数据包交换的用武之地,你可以把它想象成停车标志、红绿灯和高速公路立交桥,它们允许多人使用同一条道路,前往完全不同的目的地。把这些交叉路口换成路由器,把道路换成电线,你就得到了数据包交换网络的本质,它已经成为大多数网络的标准。
数据中心面临的新挑战是数据包路由过程中需要在光域和电域之间反复转换。“数据传输的流程是:选取一个带宽无限大的光纤信号,将其输入到电交换机,将光信号转换为电信号,读取数据包,然后将其路由到另一个GPU,”Aguilar解释道。“这种光-电-光环路会消耗大量电力,增加延迟,并推高数据中心的成本。大约15年前,谷歌开始研究这个问题,并在大约10年前,利用基于MEMS(微机电系统)的光路开关实现了这一目标。”
该公司在每个路由器上仅使用可调式MEMS微镜。这些微镜将来自源光纤的激光反射到特定路径的目标光纤上。每个节点都设置了这些微镜,以确保从源到目标的路径畅通无阻,无需任何转换。这种方法称为光路交换(OCS)。
谷歌的实践
谷歌的实践表明,OCS 技术优势显著。谷歌高级副总裁兼首席技术官(人工智能与基础设施)Amin Vahdat 在 2022 年的一篇论文中指出:“过去八年,我们一直致力于将 OCS 和波分复用 (WDM) 技术深度集成到 Jupiter 网络(谷歌的网络)中。OCS与我们的软件定义网络 (SDN) 架构相结合,带来了诸多全新功能:支持使用异构技术进行增量式网络构建;更高的性能、更低的延迟、成本和功耗;实时应用优先级和通信模式;以及零停机升级。Jupiter 在实现所有这些目标的同时,还能将流完成率降低 10%,吞吐量提高 30%,功耗降低 40%,成本降低 30%,停机时间比现有最佳方案减少 50 倍。”
节能效果体现在多项改进上。“我们省去了一半的收发器,省去了所需的液冷系统,以及交换机本身的专用集成电路/电子元件,并用光纤解决方案取而代之,”阿吉拉尔说道。
在 OCS 中,当大量数据需要在两台服务器之间传输时,后台网络首先会配置沿途的镜像,然后数据流即可顺利进行,无需任何转换或路由决策。关键在于,所有数据都来自同一位置,并最终到达同一位置。任何数据都不能分支到其他节点。因此,这种优化方式仅适用于特定工作负载。
如果采用这种方法处理短时、频繁的数据突发传输,那么设置和拆除路由所花费的时间将比发送数据本身还要多。以道路为例,如果车队长度超过从洛杉矶到波士顿的完整路线,那么预留整条道路或许是合理的。在这种情况下,道路被占用期间,其他人无法使用,但道路也不会闲置。这与需要使用 OCS 的长数据流类似。
“光路开关技术非常适合‘大象流’,我经常听到别人用这个词,”阿吉拉尔说。“它比这种‘老鼠流’的突发性处理方式要好得多。它更适用于人工智能和大型语言模型的学习和推理。”
由于 OCS 依赖于在有效载荷传输开始之前预留端到端的光路,因此其有效性也取决于配置这些路径的控制平面。
一种新的信令系统
后台网络会在数据流建立时配置镜像。它类似于信令系统 7,是一个基于以太网的低速控制网络,与光网络并行运行。“您可以使用低带宽以太网网络来重新配置交换机和数据路由,”Aguilar 说道。
重新配置网络虽然耗时不多,但确实需要一些时间,这也是为什么这种方法只适用于长时间传输数据的原因之一。即便如此,网络配置本身并不是限制新配置运行时间的瓶颈。“真正的瓶颈在于收发器锁定,”阿吉拉尔说道。
用两个网络替换一个网络看似更复杂,但控制网络本身并不复杂。“你仍然需要用以太网连接机架,将数据流路由到正确的位置,但这却是一个更简单、更优雅的解决方案,”他说道。而且,它也不会显著增加资本成本。“以太网交换机很便宜。以太网交换机只不过是一个简单的低带宽控制中心。”
混合数据包和电路交换
上图 1 中的环形网络使用点对点连接,而电路交换有利于多跳连接。但叶脊架构有所不同:它包含交换机和路由器。这种架构也能从 OCS 中受益吗?
在环面网络中,数据流是端到端的。这在叶脊架构中也可以实现,但跳数越少,节能效果就越差。一些公司正在研究,例如,叶脊网络的顶层是否可以采用光通信系统(OCS),源路由器和目标路由器在输入端接收多个数据包,并将它们捆绑在一起进行光传输,到达目标路由器后,数据包被提取出来,最终通过电信号发送到最终节点。
Synopsys 公司的 Shukla 表示:“OCS 光纤会连接到交换机,然后就变成电路了。”

只要流量足够稳定,源端向连接到最终路由器的节点发送多个数据包,那么在两个交换机之间建立光路就可能是有意义的。如图 2 所示,这看起来似乎很简单,但如果路由器之间的路径很复杂,并且经过许多节点,那么这样的电路就很有必要了。
谷歌的 OCS 架构已成定局,事实上,他们正从环形网络转向另一种名为“蜻蜓”的网络结构。其他公司尚未部署此类网络,无论是环形网络还是其他树状网络,但据传闻,一些公司正在考虑将 OCS 应用于不同的网络架构。
Chandrasekar 说:“人们正在研究这个问题,他们说,‘我们能否在叶脊式结构中使用这项技术,用 OCS 替换第二层,同时保留第一层的云分组交换?’”
初期向光纤传输的过渡是可控的。“数据中心无需进行大规模改造就能实现这一点,”阿吉拉尔说。“如果我能用这种方案改造我的数据中心,我就可以降低电力需求,或者提高现有数据中心的容量。”
光纤网络一旦建成,就不需要进一步升级。光纤本身并不了解所使用的收发器、存储器或处理器是哪一代的,因此更换这些组件无需更改网络。
业内人士仍在考虑这一想法。“目前还处于探索阶段,”钱德拉塞卡尔补充道,“还没有人实际应用过。”
光纤进一步渗透
这两项发展都意味着光纤在数据中心中的应用日益广泛。随着规模化部署的推进,光纤如今也开始与铜缆共同用于最长的连接,使得规模化部署连接的整体架构成为铜缆和光纤的混合体。
光学标准将有所帮助。“OCP 正在努力制定标准,以便所有人都能参与到这个生态系统中来,”阿吉拉尔说。“谷歌开发了很多专有技术,这些技术需要标准化才能被广泛采用,否则就无法正常运作。”
如果这项技术成功应用,是否会因需求激增而给光学供应商带来压力?Aguilar认为不会,因为他认为企业已制定了产能扩张计划,并且行业内也正在进行并购。“根据我们的预测,未来五年内我们都能应对自如,”他说道。“我们的代工厂合作伙伴已经因为预期增长而扩大了产能,同时英伟达也宣布向Lumentum投资20亿美元,并向Coherent投资20亿美元用于OCS业务。”
同时,OCS 提供了一种提高两目的地之间长距离光传输效率的方法,并为数据中心提供了一种配置光互连的新途径。“当你需要处理所有这些对内存延迟敏感的操作时,你会希望减少跳数,而完全在光域内传输确实有所帮助,”Aguilar 指出。
此外,新的联盟正在形成。例如,Lightmatter 最近加入了英伟达的 NVLink 生态系统。但工作仍在继续。
SignatureIP销售和业务发展高级副总裁Ewald Liess表示:“许多公司目前都在评估这种方案,从技术角度来看,这很有意义。但生产成本和可靠性方面,还有很多挑战需要解决。”
(来源:编译自semiengineering)
*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。
今天是《半导体行业观察》为您分享的第4498内容,欢迎关注。
加星标⭐️第一时间看推送


求推荐
