您订阅的产品有更新,请实时查阅
审查详情
宣布时间:2017-12-22
克日,工信部印发《增进新一代人工智能工业生长三年行动妄想(2018-2020年)》,意在加速人工智能从战略到落地,推感人工智能和实体经济深度融合。在新工业革命的配景下,大数据、盘算力、算法等快速迭代,正驱感人工智能进入新阶段。2017年Q3,全球AI公司融资金额突破77亿美元,是2012年的70余倍�?赡芑嵊腥怂嫡馐�“泡沫”,而我更愿意相信这是人工智能生长的一定效果。
在AI手艺的应用历程中,各个企业都在寻找能够更好支持高性能盘算的基础网络解决计划。在《数据中心基础网络架构乐成实践及未来生长趋势》这篇文章中,我分享了怎样设计一个稳固可靠的数据中心网络,下面我们再来探讨支持AI应用的高性能无损网络应该怎样设计。
前面提到大数据、盘算力、算法等快速迭代,正驱感人工智能进入新阶段,而这些手艺的实现对网络的低时延、无丢包、高性能这三个方面提出更高要求。
▲ AI应用的手艺系统及对数据中心网络的要求
高性能和无丢包较量好明确,就是指网络带宽性能的提升以及网络中不保存拥塞导致的丢包。爆发时延的环节较多,要实现端到端的低时延,需要多角度剖析:
其中,光电传输时延和数据串行时延相对较小,且很难通过架构设计来优化,我们应重点关注主机处置惩罚时延和装备转发时延。在各大企业起劲追求的高性能盘算计划中,基于以太网的RDMA(Remote Direct Memory Access)依附其高性能和低本钱优势逐渐取代InfiniBand而成为主流手艺。RoCEv2(RDMA over Converged Ethernet)手艺基于UDP协议,关于建设支持AI应用的高性能无损以太网络变得尤为主要。
团结装备转发层面的时延优化手段,高性能无损网络的实现取决于两个要素:
综上,AI集群高性能盘算和网络计划实践思绪如下图所示:
▲ AI集群高性能计划要害手艺组合
在这里,我以25G网络为例,团结业界主流产品形态,分享AI网络架构设计和实现思绪。
主要设计理念:
网络架构设计:
1.中小型(集群规模1000台)
▲ 架构设计
架构特征:
2.中型(集群规模2000台)
▲ 架构设计
架构特征:
3.大型(集群规模2000-18000台)
▲ 架构设计
架构特征:
4.超大型(集群规模20000+台)
▲ 架构设计
架构特征:
在数据中心网络中,PFC和ECN功效将安排在Leaf和Spine装备上。PFC作用于装备互联端口,通过反压影响上游端口行列的发送速率,而ECN是作用在装备转发历程,最终影响的是数据流的发送方,通过降低某条数据流发送速率规避数据丢包。
从外卖订单和叫车订单的智能调理,到电商平台的智能推荐,再到人脸识别支付以及即将实现的全自动无人驾驶汽车量产,AI手艺的应用已在方方面面影响着人们的生涯和事情,让各人的生涯越来越便捷、时间使用越来越合理。可是,这都离不开基础设施的支持。97国际网络将依附在数据通讯领域近20年的手艺积累和行业履历,立异出更好的产品息争决计划,助力AI手艺的蓬勃生长。
