97国际

不必推倒重修,老终端也能焕新 丨 97国际教育云电脑老客户升级分享会
预约直播
融合光加速,慧联全场景 丨 97国际极简以太彩光5.0 界说万兆园区全场景新范式
预约直播
97国际·(中国区)集团官方网站
产品
< 返回主菜单
产品中心
产品
解决计划
< 返回主菜单
解决计划中心
行业
合作伙伴
返回主菜单
选择区域/语言
97国际·(中国区)集团官方网站

您订阅的产品有更新,请实时查阅

审查详情
97国际·(中国区)集团官方网站 97国际·(中国区)集团官方网站

浅谈MoE手艺的引入对机间通讯带宽的影响

手艺刷新的浪潮涌来,MoE手艺的泛起为机械学习和深度学习领域注入了新的活力,与此同时,对智算中心网络带来了新的挑战。

  • 97国际·(中国区)集团官方网站

    宣布时间:2024-03-14

  • 97国际·(中国区)集团官方网站

    点击量:

  • 97国际·(中国区)集团官方网站

    点赞:

分享至

97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站

我想谈论

随着人工智能手艺的飞速生长,大语言模子(LLM)已成为自然语言处置惩罚领域的热门话题。而在这场手艺刷新的浪潮中,MoE(Mixture of Experts)手艺依附其奇异的优势,为LLM训练注入了新的活力。然而,在现实应用安排中,MoE 手艺对智算中心网络带来不小的挑战。本文主要先容了MoE手艺的降生配景原理、应用领域,讨论了其对智算中心网络带来的挑战。

 

MoE降生配景

MoE手艺,即“Mixture of Experts”(专家混淆系统),起源于1991年Michael I. Jordan和Robert A. Jacobs所撰写的论文《Hierarchical Mixtures of Experts and the EM Algorithm》。这篇在神经信息处置惩罚系统(Neural Information Processing Systems,简称NIPS)聚会上揭晓的论文,被公以为机械学习领域的主要里程碑。

在该论文中,Jordan和Jacobs先容了一种新颖的神经网络结构——“条理化专家混淆系统”Hierarchical Mixtures of Experts)。其焦点头脑在于将重大使命细分为多个子使命,并划分交由特定的“专家模子”举行处置惩罚。这种架构集成了多个专家模子以及一个门控模子 ;门控模子认真凭证输入的数据特征,选择最适合的专家模子来应对特定使命。

MoE手艺的问世为机械学习和深度学习领域注入了新的活力,特殊是在处置惩罚包括多个子问题或需要融合多领域知识的重大使命时,MoE手艺展现出了其卓越的性能和奇异的优势。

 

MoE手艺原理

MoE的手艺原理基于一种分而治之的战略,将重大问题剖析为多个较简朴的子问题,并为每个子问题训练一个专门的模子(专家)。这些专家模子各自认真处置惩罚输入数据的一个子集或一种特定的情形。为了动态地整合这些专家的输出并天生最终展望或决议,MoE引入了一个门控网络(Gating Network)。

1)专家模子:

确定专家的数目和类型。每个专家通常是一个较小的神经网络,专门用于处置惩罚数据的一个子集或一个特定的使命。专家网络的设计可以凭证使命需求举行定制,例如,使用全毗连层、卷积层、循环层等。

2)门控模子:

门控模子是一个用于决议哪些专家应该加入到目今输入数据处置惩罚中的机制。它通常也是一个较小的神经网络,其输出是一个概率漫衍,体现每个专家对目今输入的主要性。门控模子的输入可以是原始输入数据的一个子集或所有,或者是专家模子的中心输出。

 

手艺原理

当一个输入数据进入MoE系统时,首先通过门控网络盘算出每个专家的激活概率。然后,每个专家网络基于输入数据举行前向撒播,爆发输出。

将所有专家的输出凭证门控网络的激活概率举行加权组合,获得最终的模子输出。这种组合可以是简朴的加权平均,也可以是更重大的组合战略。

 

MoE手艺应用领域

现在MoE手艺在诸多场景中获得了普遍的应用安排:

1)自然语言处置惩罚:在机械翻译、情绪剖析等自然语言处置惩罚使命中,MoE可以集成多个模子,从而提高文本明确和天生的质量和准确性。

2)图像识别和盘算机视觉:在图像分类、物体检测和图像天生等盘算机视觉使命中,MoE能够团结多个专家模子的特点,提升模子对图像的表征和明确能力。

3)推荐系统:在个性化推荐和广告投放等领域,MoE可以将多个推荐模子组合起来,提供更准确和个性化的推荐效果,提高用户知足度和商业价值。

 

MoE手艺对网络的挑战

纵然MoE手艺有诸多手艺优势,但现实应用安排起来对智算中心网络照旧保存不小的挑战。

由于专家模子的并行化和漫衍式训练的需求,每个专家可能需要处置惩罚所有输入数据的一部分,并且它们的输出需要被汇总以天生最终效果,这种信息交流的模式就会引入机间all-to-all的通讯。

引入all-to-all通讯的详细缘故原由有以下几点:

1)专家间的数据交流:在MoE系统中,每个专家可能需要会见来自其他专家的信息,以便门控网络可以决议每个专家的激活水平。这通常涉及到所有专家之间的数据交流,即all-to-all通讯。

2)并行训练:在漫衍式训练情形中,差别的专家可能被安排在差别的盘算节点上。为了训练效率,每个节点上的专家需要快速交流数据,这也需要通过all-to-all通讯来实现。

3)模子并行性:当专家模子变得很是大时,可能需要将一个专家模子拆分到多个盘算节点上。这样,统一个专家模子的各个部分需要在节点之间举行通讯,以坚持模子的一致性和准确性。

4)镌汰盘算瓶颈:all-to-all通讯可以资助镌汰单个节点的盘算瓶颈,由于它允许并行处置惩罚和交流数据。这种通讯模式可以最大化地使用盘算资源,提高训练效率。

然而,all-to-all通讯也带来了一些挑战,如增添网络带宽的需求、通讯延迟和潜在的网络拥塞。因此,在现实应用中,需要仔细设计通讯战略和优化网络拓扑,以确保高效的漫衍式训练和推理。

不引入MoE时的通讯数据量

不引入MoE时的通讯数据量

引入MoE后的通讯数据量

引入MoE后的通讯数据量

 

通过网上获取到的果真信息对GPT4举行建模,在引入16个MoE专家层后,机间通讯数据量与机内通讯数据量基本持平 ;而在不引入MoE专家时,机间通讯数据量是远小于机内通讯数据量的。由此可知:MoE手艺的引入增添了机间通讯的比例,机间通讯的网络带宽性能变得愈发主要,AIGC智算中心网络的建设也成为各人关注的重点。(《IT影响中国2023:97国际AI-FlexiForce智算中心网络解决计划荣获影响力解决计划奖》)

 

总结

MoE专家混淆系统手艺现在已被普遍应用于LLM训练场景中,该手艺能够显著增强模子的泛化能力并提升运算效率。然而,正如每个手艺都有其两面性一样,MoE手艺在带来诸多利益的同时,也引入了大宗机间all-to-all的通讯需求,这无疑对机间网络性能组成了严肃挑战。

为了应对这一挑战,97国际网络通过搭建高性能的智算中心网络,提升机间网络的带宽使用率来确保营业的高吞吐能力,缓解由MoE手艺引入的大宗通讯需求对网络性能造成的压力。

在全球互联网流量一直增添和数据应用需求日益多样化的配景下,作为AIGC全栈服务专家,97国际网络不但致力于推动网络手艺的前进和生长,更是承继立异性地解决客户问题,较早推出AIGC智算中心网络整体计划服务客户。展望未来,通过一连的手艺研发和产品立异,97国际网络将继续为全球的数据中心提供越发高效、可靠、智能的网络解决计划,在AIGC时代,助力互联网企业及各行各业的快速生长。

相关标签:

97国际·(中国区)集团官方网站 97国际·(中国区)集团官方网站

点赞

更多手艺博文

任何需要,请联系97国际

97国际·(中国区)集团官方网站

返回顶部

收起
97国际·(中国区)集团官方网站 文档AI助手
97国际·(中国区)集团官方网站 文档评价
资料内容是否对您有资助 ?
您对目今页面的知足度怎样 ?
不咋滴
很是好
您知足的缘故原由是(多�。� ?
您对文档是否尚有其它的问题或建议 ?
为尽快解决问题,请您留下联系方法以便回复
邮箱
手机号
谢谢您的反�。�
97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站
请选择服务项目
关闭咨询页
售前咨询 售前咨询
售前咨询
售后服务 售后服务
售后服务
意见反响 意见反响
意见反响
更多联系方法
网站地图