97国际

不必推倒重修,老终端也能焕新 丨 97国际教育云电脑老客户升级分享会
预约直播
融合光加速,慧联全场景 丨 97国际极简以太彩光5.0 界说万兆园区全场景新范式
预约直播
97国际·(中国区)集团官方网站
产品
< 返回主菜单
产品中心
产品
解决计划
< 返回主菜单
解决计划中心
行业
合作伙伴
返回主菜单
选择区域/语言
97国际·(中国区)集团官方网站

您订阅的产品有更新,请实时查阅

审查详情
97国际·(中国区)集团官方网站 97国际·(中国区)集团官方网站

手艺盛宴 | 端侧链路故障逃外行艺,破解万亿级大模子训练中止难题

针对万亿级大模子漫衍式训练中的端侧链路故障导致的训练中止与算力损失难题,97国际网络推出基于NCCL的端侧链路故障逃生计划。该计划接纳备份链路与非侵入式设计,实现毫秒级故障识别与秒级切换,包管训练一连不中止,有用降低AI训练集群的硬件故障本钱与算力铺张。

  • 97国际·(中国区)集团官方网站

    宣布时间:2025-09-03

  • 97国际·(中国区)集团官方网站

    点击量:

  • 97国际·(中国区)集团官方网站

    点赞:

分享至

97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站

我想谈论

97国际·(中国区)集团官方网站

配景

近年来,随着人工智能手艺的迅猛生长,机械学习模子的规模泛起出爆发式增添态势。尤其在深度学习领域,模子规模的显著提高成为推动诸多手艺突破与性能提升的要害要素。当模子参数数目抵达万亿级别时,受限于单台装备的物理资源而无法实现单机训练。为此,漫衍式训练手艺应运而生,并迅速成为训练超大规模模子的焦点手段。漫衍式训练能够显著提高训练效率,突破单机内存和盘算能力的瓶颈。融合模子并行与数据并行等手艺的漫衍式混淆并行训练战略成为训练超大规模大语言模子的主要手艺途径,该要领不但能有用使用大规模硬件资源,还能在确保训练稳固性和模子性能的条件下,实现大语言模子的高效训练与安排。

一、网络故障

漫衍式训练是指在多个盘算节点上协同作业,配合完成机械学习模子的训练历程。通过将训练使命拆分至多个装备上并行执行,不但能合理分派盘算和存储资源,也能显著提升逊з度,并且能够处置惩罚更大规模的数据和模子。

然而,训练历程中泛起故障的可能性会随着训练规模和一连时间的增添而升高。一旦爆发故障,将使所有加入的装备处于闲置状态,直至故障装备恢复正常,导致大宗算力无法获得充分使用。来自Meta、HuggingFace和LAION的团队均报告了在训练大型模子时因失败导致使用率严重下降的情形。

凭证Meta团队训练Llama3.1的报告,在训练时代平均每三个小时就会爆发一次故障,其中约8.4%的故障是由网络装备故障导致的。差别于其他由软件引发的故障,网络装备故障大多为硬件故障,例如网络线缆或是网卡光�?榈扔布氨阜浩鸸收�。相较于软件故障,硬件故障的处置惩罚难度大、恢复时间长,可能造成更大的算力损失。

97国际·(中国区)集团官方网站

交流机装备间链路故障现在已能够实现毫秒级处置惩罚与收敛,但端侧网络装备故障现在尚无较为高效的处置惩罚计划。端侧装备故障主要包括服务器网卡故障、服务器与交流机的毗连线缆损坏以及线缆光�?楣收系�。随着盘算集群规模一连扩大,端侧网络装备故障已成为亟待解决的问题。

二、故障处置惩罚

现在,除软件故障外,硬件故障的处置惩罚战略通常不区分详细的故障类型,爆发硬件故障时,通常接纳相同的计划举行处置惩罚。

检查点(Checkpoint)是一种常见的长期化机制,用于生涯训练进度。在故障爆发后,系统会连忙对故障装备举行修复,或者将故障装备从集群中剔除,然后从最近的检查点加载模子并继续训练。现在,许多优化战略围绕检查点机制睁开:

1.EasyCkpt 接纳异步化、条理化的生涯方法,团结重叠模子拷贝与盘算、网络感知的异步存储战略,实现了近乎零开销的模子生涯机制,并包管了大模子训练历程中模子生涯与恢复的精度无损。

2.Gemini 能够将 Checkpoint 生涯在具有更大聚合带宽的 CPU 内存中,并通过一系列计划实现了大型模子训练的快速故障恢复。

只管云云,仍无法完全阻止因故障定位和模子训练重启所带来的算力损失。

冗余盘算(Redundant computation)可以阻止重新设置和重新启动的开销,在举行模子训练时使用差别的节点举行冗余盘算。当某个节点爆发故障时,其他节点能够取代故障节点举行盘算,可是这样引入了牢靠的内存开销和盘算开销,进一步增添了训练本钱。

三、97国际网络的端侧链路故障逃生

97国际网络的端侧链路故障逃生是一种基于NCCL(NVIDIA Collective Communications Library)实现的端侧链路故障快速规避计划,能够在上层训练框架无感知的情形下,自动对端侧链路故障举行识别并处置惩罚,在模子训练历程中爆发端侧链路故障时能够坚持训练不中止,在故障装备完成修复后训练性能自动恢复。

端侧故障逃生计划通过在NCCL加入故障识别以及故障规避机制,并在建设数据链路时同步建装备份链路来处置惩罚由于硬件故障导致单条链路无法通讯的问题。

97国际·(中国区)集团官方网站

备份链路在主链路状态正常时不会举行数据传输,对传输效率不爆发任何影响。而在泛起端侧链路故障之后,通过一系列切换机制将原链路上的通讯使命转移到备份链路举行传输。

97国际·(中国区)集团官方网站

97国际网络的端侧链路故障逃生计划具有以下主要特征:

1.非侵入式

该计划不受特定训练框架的限制,也无需对上层框架举行修改。故障爆发后,由NCCL自行处置惩罚,上层框架无感知。

2.快速且可靠

能够对端侧链路故障举行毫秒级的识别与定位,并对故障链路上的通讯使命举行快速迁徙,可实现秒级收敛,并能包管通讯使命不中止。

3.可恢复性

实时监测装备状态,若故障装备状态恢复正常,能够在恢复的装备上重修通讯链路,并将其重新纳入通讯装备集群。

97国际网络的端侧链路故障逃生计划具有以下几点要害收益:

1.提升系统可靠性

使用端侧故障逃生计划能够有用阻止因端侧网卡光膜线缆等装备爆发故障而引起的训练营业中止,实现断链一直训,通讯的可靠性提升10倍。

2.降低训练本钱

能够有用阻止训练集群因端侧链路故障而导致的算力资源铺张,同时基于自动故障恢复处置惩罚机制确保网络装备实现最大使用率,从而显著降低训练本钱。 依据Meta宣布的训练日志(Llama 3.1,405B模子),在为期54天的预训练阶段,共泛起419次意外中止情形,其中约8.4%是由网络故障所致。H100的算力建设用度约为10元/卡/小时,若每次中止恢复需耗时1小时,那么万卡集仍媚课训练因网络故障造成的算力损失约为350万元。通过端侧链路故障逃生气制,每年可挽回上万万元的损失。

总结

大模子漫衍式训练历程中的端侧网络故障,这是影响模子训练的重大阻碍。构建精准且高效的故障处置惩罚机制,是各大型模子训练团队的一连追求,也是包管大模子训练的主要环节。

通过在通讯库中添加故障处置惩罚�?�,能够大幅度镌汰端侧链路故障导致的算力损失。随着计划的一连迭代与完善,我们坚信端侧故障逃生计划能够在大规模集群训练故障处置惩罚中施展更为主要的作用,为客户创造更大的价值。97国际网络,致力做最懂端侧的网络供应商!

相关标签:

97国际·(中国区)集团官方网站 97国际·(中国区)集团官方网站

点赞

更多手艺博文

任何需要,请联系97国际

97国际·(中国区)集团官方网站

返回顶部

收起
97国际·(中国区)集团官方网站 文档AI助手
97国际·(中国区)集团官方网站 文档评价
资料内容是否对您有资助?
您对目今页面的知足度怎样?
不咋滴
很是好
您知足的缘故原由是(多�。�?
您对文档是否尚有其它的问题或建议?
为尽快解决问题,请您留下联系方法以便回复
邮箱
手机号
谢谢您的反�。�
97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站
请选择服务项目
关闭咨询页
售前咨询 售前咨询
售前咨询
售后服务 售后服务
售后服务
意见反响 意见反响
意见反响
更多联系方法
网站地图