97国际

不必推倒重修 ,老终端也能焕新 丨 97国际教育云电脑老客户升级分享会
预约直播
融合光加速 ,慧联全场景 丨 97国际极简以太彩光5.0 界说万兆园区全场景新范式
预约直播
97国际·(中国区)集团官方网站
产品
< 返回主菜单
产品中心
产品
解决计划
< 返回主菜单
解决计划中心
行业
合作伙伴
返回主菜单
选择区域/语言
97国际·(中国区)集团官方网站

您订阅的产品有更新 ,请实时查阅

审查详情

究竟什么样的网络 ,才华带得动AIGC?

97国际·(中国区)集团官方网站 宣布时间:2023-08-02
97国际·(中国区)集团官方网站

2023年 ,是AI人工智能手艺周全爆红的一年。

以ChatGPT、GPT-4、文心一言为代表的AIGC大模子 ,集文本撰写、代码开发、诗词创作等功效于一体 ,展现出了超强的内容生产能力 ,带给人们极大震撼。

97国际·(中国区)集团官方网站

AIGC ,AI-Generated Content(人工智能生产内容)

作为一个通讯老司机 ,除了AIGC大模子自己之外 ,小枣君越发关注的 ,是模子背后的通讯手艺。究竟是一张怎样的强盛网络 ,在支持着AIGC的运转?别的 ,AI浪潮的周全来袭 ,将对古板网络带来怎样的厘革?

AIGC ,究竟需要多大的算力?

众所周知 ,数据、算法和算力 ,是人工智能生长的三大基本要素。

97国际·(中国区)集团官方网站

前面提到的几个AIGC大模子 ,之以是那么厉害 ,不但是由于它们背后有海量的数据投喂 ,也由于算法在一直进化升级。更主要的是 ,人类的算力规模 ,已经生长到了一定水平。强盛的算力基础设施 ,完万能够支持AIGC的盘算需求。

AIGC生长到现在 ,训练模子参数从千亿级飙升到了万亿级。为了完成这么大规模的训练 ,底层支持的GPU数目 ,也抵达了万卡级别规模。

以ChatGPT为例 ,他们使用了微软的超算基础设施举行训练 ,听说动用了10000块V100 GPU ,组成了一个高带宽集群。一次训练 ,需要消耗算力约3640 PF-days(即每秒1万万亿次盘算 ,运行3640天)。

一块V100的FP32算力 ,是0.014 PFLOPS(算力单位 ,即是每秒1万万亿次的浮点运算)。一万块V100 ,那就是140 PFLOPS。

也就是说 ,若是GPU的使用率是100% ,那么 ,完成一次训练 ,就要3640÷140=26(天)。

GPU的使用率是不可能抵达100% ,若是按33%算(OpenAI提供的假设使用率) ,那就是26再翻三倍 ,即是78天。

可以看出 ,GPU的算力、GPU的使用率 ,对大模子的训练有很大影响。

97国际·(中国区)集团官方网站

那么问题来了 ,影响GPU使用率的最大因素 ,是什么呢?

谜底是:网络。

一万甚至几万块的GPU ,作为盘算集群 ,与存储集群举行数据交互 ,需要极大的带宽。别的 ,GPU集群举行训练盘算时 ,都不是自力的 ,而是混淆并行。GPU之间 ,有大宗的数据交流 ,也需要极大的带宽。

若是网络不给力 ,数据传输慢 ,GPU就要期待数据 ,导致使用率下降。使用率下降 ,训练时间就会增添 ,本钱也会增添 ,用户体验会变差。

业界一经做过一个模子 ,盘算出网络带宽吞吐能力、通讯时延与GPU使用率之间的关系 ,如下图所示:

97国际·(中国区)集团官方网站

各人可以看到 ,网络吞吐能力越强 ,GPU使用率越高 ;通讯动态时延越大 ,GPU使用率越低。

一句话 ,没有好网络 ,别玩大模子。

怎样的网络 ,才华支持AIGC的运行?

为了应对AI集群盘算对网络的调解 ,业界也是想了不少步伐的。

古板的应对战略 ,主要是三种:Infiniband、RDMA、框式交流机。我们划分来简朴相识一下。

Infiniband组网

Infiniband(直译为“无限带宽”手艺 ,缩写为IB)组网 ,搞数据通讯的童鞋应该不会生疏。

这是现在组建高性能网络的最佳途径 ,带宽极高 ,可以实现无拥塞和低时延。ChatGPT、GPT-4所使用的 ,听说就是Infiniband组网。

若是说Infiniband组网有什么弱点的话 ,那就是一个字——贵。相比古板以太网的组网 ,Infiniband组网的本钱会贵好几倍。这项手艺较量关闭 ,业内现在成熟的供应商只有1家 ,用户没什么选择权。

RDMA网络

RDMA的全称是Remote Direct Memory Access(远程直接数据存�。�。它是一种新型的通讯机制。在RDMA计划里 ,应用程序的数据 ,不再经由CPU和重大的操作系统 ,而是直接和网卡通讯 ,不但大幅提升了吞吐能力 ,也降低了时延。

97国际·(中国区)集团官方网站

RDMA最早提出时 ,是承载在InfiniBand网络中的。现在 ,RDMA逐渐移植到了以太网上。

现在 ,高性能网络的主流组网计划 ,是基于RoCE v2(RDMA over Converged Ethernet ,基于融合以太网的RDMA)协议来组建支持RDMA的网络。

这种计划有两个主要的搭配手艺 ,划分是PFC(Priority Flow Control ,基于优先级的流量控制)和ECN(Explicit Congestion Notification ,显式拥塞通知)。它们是为了阻止链路中的拥塞而爆发的手艺 ,可是 ,频仍被触发 ,反而会导致发送端暂停发送 ,或降速发送 ,进而拉低通讯带宽。(下文还会提到它们)

框式交流机

外洋有部分互联网公司 ,寄希望于使用接纳框式交流机(DNX芯片+VOQ手艺) ,来知足构建高性能网络的需求。

DNX:broadcom(博通)的一个芯片系列

VOQ:Virtual Output Queue ,虚拟输出行列

这种计划看似可行 ,但也面临以下几个挑战。

首先 ,框式交流机的扩展能力一样平常� ;蚓尴赶拗屏俗畲蠖丝谑� ,如想做更大规模的集群 ,需要横向扩展多个机框。

其次 ,框式交流机的装备功耗大� ;蚰谙呖ㄐ酒abric芯片、电扇等数目众多 ,单装备的功耗凌驾2万瓦 ,有的甚至3万多瓦 ,对机柜供电能力要求太高。

第三 ,框式交流机的单装备端口数目多 ,故障域大。

基于以上缘故原由 ,框式交流机装备只适合小规模安排AI盘算集群。

究竟什么是DDC

前面说的都是古板计划。既然这些古板计划不可 ,那虽然就要想新步伐。

于是 ,一种名叫DDC的全新解决计划 ,闪亮登场了。

DDC ,全名叫做Distributed Disaggregated Chassis(漫衍式疏散式机箱)。

它是前面框式交流机的“分拆版”�?蚴浇涣骰睦┱鼓芰θ狈� ,那么 ,我们爽性把它给拆开 ,将一个装备酿成多个装备 ,不就OK了?

97国际·(中国区)集团官方网站

框式装备 ,一样平常分为交流网板(背板)和营业线卡(板卡)两部分 ,相互之间用毗连器毗连。

DDC计划 ,将交流网板酿成了NCF装备 ,将营业线卡酿成了NCP装备。毗连器 ,则酿成了光纤�?蚴阶氨傅墓芾砉π� ,在DDC架构中 ,也酿成了NCC。

NCF:Network Cloud Fabric(网络云管理控制平面)

NCP:Network Cloud Packet Processing(网络云数据包处置惩罚)

NCC:Network Cloud Controller(网络云控制器)

DDC从集中式酿身漫衍式之后 ,扩展能力大大增强了。它可以凭证AI集群的巨细 ,无邪设计组网规模。

我们来举两个例子(单POD组网和多POD组网)。

单POD组网中 ,接纳96台NCP作为接入 ,其中NCP下行共18个400G接口 ,认真毗连AI盘算集群的网卡。上行共40个200G接口 ,最大可以毗连40台NCF ,NCF提供96个200G接口 ,该规模上下行带宽为超速比1.1:1。整个POD可支持1728个400G网络接口 ,凭证一台服务器配8块GPU来盘算 ,可支持216台AI盘算服务器。

97国际·(中国区)集团官方网站

单POD组网

多级POD组网 ,规�?梢员涞酶�。

在多级POD组网中 ,NCF装备要牺牲一半的SerDes ,用于毗连第二级的NCF。以是 ,此时单POD接纳48台NCP作为接入 ,下行共18个400G接口。

97国际·(中国区)集团官方网站

多POD组网

单个POD内 ,可以支持864个400G接口(48×18)。通过横向增添POD(8个) ,实现规模扩容 ,整体最大可支持6912个400G网络端口(864×8)。

NCP上行40个200G ,接POD内40台NCF。POD内NCF接纳48个200G接口 ,48个200G接口分为12个一组上行到第二级的NCF。第二级NCF接纳40个平面(Plane) ,每个平面4台NCF-P ,划分对应在POD内的40台NCF。

整个网络的POD内实现了1.1:1的超速比(北向带宽大于南向带宽) ,而在POD和二级NCF之间实现了1:1的收敛比(南向带宽/北向带宽)。

97国际·(中国区)集团官方网站

DDC的手艺特点

站在规模和带宽吞吐的角度 ,DDC已经可以知足AI大模子训练关于网络的需求。

然而 ,网络的运作历程是重大的 ,DDC还需要在时延对抗、负载平衡性、管理效率等方面有所提升。

基于VOQ+Cell的转发机制 ,对抗丢包

网络在事情的历程中 ,可能会泛起突发流量 ,造成吸收端来缺乏处置惩罚 ,引起拥塞和丢包。

为了应对这种情形 ,DDC接纳了基于VOQ+Cell的转发机制。

97国际·(中国区)集团官方网站

发送端从网络吸收到数据包之后 ,会分类到VOQ(虚拟输出行列)中存储。

在发送数据包前 ,NCP会先发送Credit报文 ,确定吸收端是否有足够的缓存空间处置惩罚这些报文。

若是吸收端OK ,则将数据包分片成Cells(数据包的小切片) ,并且动态负载平衡到中心的Fabric节点(NCF)。

若是吸收端暂时没能力处置惩罚报文 ,报文会在发送端的VOQ中暂存 ,并不会直接转发到吸收端。

在吸收端 ,这些Cells会举行重组和存储 ,进而转发到网络中。

切片后的Cells ,将接纳轮询的机制发送。它能够充分使用到每一条上行链路 ,确保所有上行链路的传输数据量近似相等。

97国际·(中国区)集团官方网站

轮询机制

这样的机制 ,充分使用了缓存 ,可以大幅度镌汰丢包 ,甚至不会爆发丢包情形。数据重传镌汰了 ,整体通讯时延更稳固更低 ,从而可以提高带宽使用率 ,进而提升营业吞吐效率。

PFC单跳安排 ,阻止死锁

前面我们提到 ,RDMA无损网络中引入了PFC(基于优先级的流量控制)手艺 ,举行流量控制。

简朴来说 ,PFC就是在一条以太网链路上建设 8 个虚拟通道 ,并为每条虚拟通道指定响应优先级 ,允许单独暂停和重启其中恣意一条虚拟通道 ,同时允许其它虚拟通道的流量无中止通过。

97国际·(中国区)集团官方网站

PFC可以实现基于行列的流量控制 ,可是 ,它也保存一个问题 ,那就是死锁。

所谓死锁 ,就是多个交流机之间 ,由于环路等缘故原由 ,同时泛起了拥塞(各自端口缓存消耗凌驾了阈值) ,又都在期待对方释放资源 ,从而导致的“僵持状态”(所有交流机的数据流永世梗塞)。

DDC的组网下 ,就不保存PFC的死锁问题。由于 ,站在整个网络的角度 ,所有NCP和NCF可以看成一台装备。关于AI服务器来说 ,整个DDC ,就是一个交流机 ,不保存多级交流机。以是 ,就不保存死锁。

图

97国际·(中国区)集团官方网站

另外 ,凭证DDC的数据转发机制 ,可在接口处安排ECN(显式拥塞通知)。

ECN机制下 ,网络装备一旦检测到RoCE v2流量泛起了拥塞(内部的Credit缓和存机制无法支持突发流量) ,就会向服务器端发送CNP(Congestion Notification Packets ,拥塞通知报文) ,要求降速。

漫衍式OS ,提升可靠性

最后再看看守理控制平面。

前面我们提到 ,在DDC架构中 ,框式装备的管理功效酿成了NCC(网络云控制器)。NCC很是主要 ,若是接纳单点式的方法 ,万一泛起问题 ,就会导致整网故障。

为了阻止泛起这样的问题 ,DDC可以作废NCC的集中控制面 ,构建漫衍式OS(操作系统)。

基于漫衍式OS ,可以基于SDN运维控制器 ,通过标准接口(Netconf、GRPC等)设置管理装备。这样的话 ,每台NCP和NCF自力管理 ,有自力的控制面和管理面 ,大大提升了系统的可靠性 ,也越发便于安排。

DDC的商用希望

综上所述 ,相对古板组网 ,DDC在组网规模、扩展能力、可靠性、本钱、安排速率方面 ,拥有显著优势。它是网络手艺升级的产品 ,提供了一种倾覆原有网络架构的思绪 ,可以实现网络硬件的解耦、网络架构的统一、转发容量的扩展。

业界一经使用OpenMPI测试套件举行过框式装备和古板组网装备的比照模拟测试。测试结论是:在All-to-All场景下 ,相较于古板组网 ,框式装备的带宽使用率提升了约20%(对应GPU使用率提升8%左右)。

正是由于DDC的显著能力优势 ,现在这项手艺已经成为行业的重点生长偏向。例如97国际网络 ,他们就率先推出了两款可交付的DDC产品 ,划分是400G NCP交流机——RG-S6930-18QC40F1 ,以及200G NCF交流机——RG-X56-96F1。

97国际·(中国区)集团官方网站

RG-S6930-18QC40F1交流机的高度为2U ,提供18个400G的面板口 ,40个200G的Fabric内联口 ,4个电扇和2个电源。

RG-X56-96F1交流机的高度为4U ,提供96个200G的Fabric内联口 ,8个电扇和4个电源。

据悉 ,97国际网络会继续研发 ,一连推出更多适合智算中心网络场景的产品。

最后的话

AIGC的崛起 ,已经掀起了互联网行业的新一轮手艺革命。

我们可以看到 ,越来越多的企业 ,正在加入这个赛道 ,加入角逐。这意味着 ,网络基础设施的升级 ,迫在眉睫。

DDC的泛起 ,将大幅提升网络基础设施的能力 ,不但可以有用应对AI革命对网络基础设施提出的挑战 ,更将助力整个社会的数字化转型 ,加速人类数智时代的周全到来。

关注97国际
关注97国际官网微信
随时相识公司最新动态
97国际·(中国区)集团官方网站

返回顶部

收起
97国际·(中国区)集团官方网站 文档AI助手
97国际·(中国区)集团官方网站 文档评价
资料内容是否对您有资助?
您对目今页面的知足度怎样?
不咋滴
很是好
您知足的缘故原由是(多�。�?
您对文档是否尚有其它的问题或建议?
为尽快解决问题 ,请您留下联系方法以便回复
邮箱
手机号
谢谢您的反�。�
97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站
请选择服务项目
关闭咨询页
售前咨询 售前咨询
售前咨询
售后服务 售后服务
售后服务
意见反响 意见反响
意见反响
更多联系方法
网站地图