您订阅的产品有更新,请实时查阅
审查详情
宣布时间:2023-08-02
2023年,是AI人工智能手艺周全爆红的一年。
以ChatGPT、GPT-4、文心一言为代表的AIGC大模子,集文本撰写、代码开发、诗词创作等功效于一体,展现出了超强的内容生产能力,带给人们极大震撼。

AIGC,AI-Generated Content(人工智能生产内容)
作为一个通讯老司机,除了AIGC大模子自己之外,小枣君越发关注的,是模子背后的通讯手艺。究竟是一张怎样的强盛网络,在支持着AIGC的运转?别的,AI浪潮的周全来袭,将对古板网络带来怎样的厘革?
众所周知,数据、算法和算力,是人工智能生长的三大基本要素。

前面提到的几个AIGC大模子,之以是那么厉害,不但是由于它们背后有海量的数据投喂,也由于算法在一直进化升级。更主要的是,人类的算力规模,已经生长到了一定水平。强盛的算力基础设施,完万能够支持AIGC的盘算需求。
AIGC生长到现在,训练模子参数从千亿级飙升到了万亿级。为了完成这么大规模的训练,底层支持的GPU数目,也抵达了万卡级别规模。
以ChatGPT为例,他们使用了微软的超算基础设施举行训练,听说动用了10000块V100 GPU,组成了一个高带宽集群。一次训练,需要消耗算力约3640 PF-days(即每秒1万万亿次盘算,运行3640天)。
一块V100的FP32算力,是0.014 PFLOPS(算力单位,即是每秒1万万亿次的浮点运算)。一万块V100,那就是140 PFLOPS。
也就是说,若是GPU的使用率是100%,那么,完成一次训练,就要3640÷140=26(天)。
GPU的使用率是不可能抵达100%,若是按33%算(OpenAI提供的假设使用率),那就是26再翻三倍,即是78天。
可以看出,GPU的算力、GPU的使用率,对大模子的训练有很大影响。

那么问题来了,影响GPU使用率的最大因素,是什么呢?
谜底是:网络。
一万甚至几万块的GPU,作为盘算集群,与存储集群举行数据交互,需要极大的带宽。别的,GPU集群举行训练盘算时,都不是自力的,而是混淆并行。GPU之间,有大宗的数据交流,也需要极大的带宽。
若是网络不给力,数据传输慢,GPU就要期待数据,导致使用率下降。使用率下降,训练时间就会增添,本钱也会增添,用户体验会变差。
业界一经做过一个模子,盘算出网络带宽吞吐能力、通讯时延与GPU使用率之间的关系,如下图所示:

各人可以看到,网络吞吐能力越强,GPU使用率越高;通讯动态时延越大,GPU使用率越低。
一句话,没有好网络,别玩大模子。
为了应对AI集群盘算对网络的调解,业界也是想了不少步伐的。
古板的应对战略,主要是三种:Infiniband、RDMA、框式交流机。我们划分来简朴相识一下。
Infiniband(直译为“无限带宽”手艺,缩写为IB)组网,搞数据通讯的童鞋应该不会生疏。
这是现在组建高性能网络的最佳途径,带宽极高,可以实现无拥塞和低时延。ChatGPT、GPT-4所使用的,听说就是Infiniband组网。
若是说Infiniband组网有什么弱点的话,那就是一个字——贵。相比古板以太网的组网,Infiniband组网的本钱会贵好几倍。这项手艺较量关闭,业内现在成熟的供应商只有1家,用户没什么选择权。
RDMA的全称是Remote Direct Memory Access(远程直接数据存�。�。它是一种新型的通讯机制。在RDMA计划里,应用程序的数据,不再经由CPU和重大的操作系统,而是直接和网卡通讯,不但大幅提升了吞吐能力,也降低了时延。
RDMA最早提出时,是承载在InfiniBand网络中的。现在,RDMA逐渐移植到了以太网上。
现在,高性能网络的主流组网计划,是基于RoCE v2(RDMA over Converged Ethernet,基于融合以太网的RDMA)协议来组建支持RDMA的网络。
这种计划有两个主要的搭配手艺,划分是PFC(Priority Flow Control,基于优先级的流量控制)和ECN(Explicit Congestion Notification,显式拥塞通知)。它们是为了阻止链路中的拥塞而爆发的手艺,可是,频仍被触发,反而会导致发送端暂停发送,或降速发送,进而拉低通讯带宽。(下文还会提到它们)
外洋有部分互联网公司,寄希望于使用接纳框式交流机(DNX芯片+VOQ手艺),来知足构建高性能网络的需求。
DNX:broadcom(博通)的一个芯片系列
VOQ:Virtual Output Queue,虚拟输出行列
这种计划看似可行,但也面临以下几个挑战。
首先,框式交流机的扩展能力一样平常�;蚓尴赶拗屏俗畲蠖丝谑�,如想做更大规模的集群,需要横向扩展多个机框。
其次,框式交流机的装备功耗大�;蚰谙呖ㄐ酒abric芯片、电扇等数目众多,单装备的功耗凌驾2万瓦,有的甚至3万多瓦,对机柜供电能力要求太高。
第三,框式交流机的单装备端口数目多,故障域大。
基于以上缘故原由,框式交流机装备只适合小规模安排AI盘算集群。
前面说的都是古板计划。既然这些古板计划不可,那虽然就要想新步伐。
于是,一种名叫DDC的全新解决计划,闪亮登场了。
DDC,全名叫做Distributed Disaggregated Chassis(漫衍式疏散式机箱)。
它是前面框式交流机的“分拆版”�?蚴浇涣骰睦┱鼓芰θ狈�,那么,我们爽性把它给拆开,将一个装备酿成多个装备,不就OK了?

框式装备,一样平常分为交流网板(背板)和营业线卡(板卡)两部分,相互之间用毗连器毗连。
DDC计划,将交流网板酿成了NCF装备,将营业线卡酿成了NCP装备。毗连器,则酿成了光纤�?蚴阶氨傅墓芾砉π�,在DDC架构中,也酿成了NCC。
NCF:Network Cloud Fabric(网络云管理控制平面)
NCP:Network Cloud Packet Processing(网络云数据包处置惩罚)
NCC:Network Cloud Controller(网络云控制器)
DDC从集中式酿身漫衍式之后,扩展能力大大增强了。它可以凭证AI集群的巨细,无邪设计组网规模。
我们来举两个例子(单POD组网和多POD组网)。
单POD组网中,接纳96台NCP作为接入,其中NCP下行共18个400G接口,认真毗连AI盘算集群的网卡。上行共40个200G接口,最大可以毗连40台NCF,NCF提供96个200G接口,该规模上下行带宽为超速比1.1:1。整个POD可支持1728个400G网络接口,凭证一台服务器配8块GPU来盘算,可支持216台AI盘算服务器。

单POD组网
多级POD组网,规�?梢员涞酶�。
在多级POD组网中,NCF装备要牺牲一半的SerDes,用于毗连第二级的NCF。以是,此时单POD接纳48台NCP作为接入,下行共18个400G接口。
多POD组网
单个POD内,可以支持864个400G接口(48×18)。通过横向增添POD(8个),实现规模扩容,整体最大可支持6912个400G网络端口(864×8)。
NCP上行40个200G,接POD内40台NCF。POD内NCF接纳48个200G接口,48个200G接口分为12个一组上行到第二级的NCF。第二级NCF接纳40个平面(Plane),每个平面4台NCF-P,划分对应在POD内的40台NCF。
整个网络的POD内实现了1.1:1的超速比(北向带宽大于南向带宽),而在POD和二级NCF之间实现了1:1的收敛比(南向带宽/北向带宽)。

站在规模和带宽吞吐的角度,DDC已经可以知足AI大模子训练关于网络的需求。
然而,网络的运作历程是重大的,DDC还需要在时延对抗、负载平衡性、管理效率等方面有所提升。
网络在事情的历程中,可能会泛起突发流量,造成吸收端来缺乏处置惩罚,引起拥塞和丢包。
为了应对这种情形,DDC接纳了基于VOQ+Cell的转发机制。

发送端从网络吸收到数据包之后,会分类到VOQ(虚拟输出行列)中存储。
在发送数据包前,NCP会先发送Credit报文,确定吸收端是否有足够的缓存空间处置惩罚这些报文。
若是吸收端OK,则将数据包分片成Cells(数据包的小切片),并且动态负载平衡到中心的Fabric节点(NCF)。
若是吸收端暂时没能力处置惩罚报文,报文会在发送端的VOQ中暂存,并不会直接转发到吸收端。
在吸收端,这些Cells会举行重组和存储,进而转发到网络中。
切片后的Cells,将接纳轮询的机制发送。它能够充分使用到每一条上行链路,确保所有上行链路的传输数据量近似相等。

轮询机制
这样的机制,充分使用了缓存,可以大幅度镌汰丢包,甚至不会爆发丢包情形。数据重传镌汰了,整体通讯时延更稳固更低,从而可以提高带宽使用率,进而提升营业吞吐效率。
前面我们提到,RDMA无损网络中引入了PFC(基于优先级的流量控制)手艺,举行流量控制。
简朴来说,PFC就是在一条以太网链路上建设 8 个虚拟通道,并为每条虚拟通道指定响应优先级,允许单独暂停和重启其中恣意一条虚拟通道,同时允许其它虚拟通道的流量无中止通过。

PFC可以实现基于行列的流量控制,可是,它也保存一个问题,那就是死锁。
所谓死锁,就是多个交流机之间,由于环路等缘故原由,同时泛起了拥塞(各自端口缓存消耗凌驾了阈值),又都在期待对方释放资源,从而导致的“僵持状态”(所有交流机的数据流永世梗塞)。
DDC的组网下,就不保存PFC的死锁问题。由于,站在整个网络的角度,所有NCP和NCF可以看成一台装备。关于AI服务器来说,整个DDC,就是一个交流机,不保存多级交流机。以是,就不保存死锁。
图
另外,凭证DDC的数据转发机制,可在接口处安排ECN(显式拥塞通知)。
ECN机制下,网络装备一旦检测到RoCE v2流量泛起了拥塞(内部的Credit缓和存机制无法支持突发流量),就会向服务器端发送CNP(Congestion Notification Packets,拥塞通知报文),要求降速。
最后再看看守理控制平面。
前面我们提到,在DDC架构中,框式装备的管理功效酿成了NCC(网络云控制器)。NCC很是主要,若是接纳单点式的方法,万一泛起问题,就会导致整网故障。
为了阻止泛起这样的问题,DDC可以作废NCC的集中控制面,构建漫衍式OS(操作系统)。
基于漫衍式OS,可以基于SDN运维控制器,通过标准接口(Netconf、GRPC等)设置管理装备。这样的话,每台NCP和NCF自力管理,有自力的控制面和管理面,大大提升了系统的可靠性,也越发便于安排。
综上所述,相对古板组网,DDC在组网规模、扩展能力、可靠性、本钱、安排速率方面,拥有显著优势。它是网络手艺升级的产品,提供了一种倾覆原有网络架构的思绪,可以实现网络硬件的解耦、网络架构的统一、转发容量的扩展。
业界一经使用OpenMPI测试套件举行过框式装备和古板组网装备的比照模拟测试。测试结论是:在All-to-All场景下,相较于古板组网,框式装备的带宽使用率提升了约20%(对应GPU使用率提升8%左右)。
正是由于DDC的显著能力优势,现在这项手艺已经成为行业的重点生长偏向。例如97国际网络,他们就率先推出了两款可交付的DDC产品,划分是400G NCP交流机——RG-S6930-18QC40F1,以及200G NCF交流机——RG-X56-96F1。

RG-S6930-18QC40F1交流机的高度为2U,提供18个400G的面板口,40个200G的Fabric内联口,4个电扇和2个电源。
RG-X56-96F1交流机的高度为4U,提供96个200G的Fabric内联口,8个电扇和4个电源。
据悉,97国际网络会继续研发,一连推出更多适合智算中心网络场景的产品。
AIGC的崛起,已经掀起了互联网行业的新一轮手艺革命。
我们可以看到,越来越多的企业,正在加入这个赛道,加入角逐。这意味着,网络基础设施的升级,迫在眉睫。
DDC的泛起,将大幅提升网络基础设施的能力,不但可以有用应对AI革命对网络基础设施提出的挑战,更将助力整个社会的数字化转型,加速人类数智时代的周全到来。
