您订阅的产品有更新,请实时查阅
审查详情
宣布时间:2023-03-20
AIGC(AI-Generated Content,人工智能生产内容)近期生长迅猛,迭代速率更是泛起指数级的爆发式增添。其中,GPT-4和文心一言的推出引起了人们对其商业价值和应用场景的高度关注。随着AIGC的生长,训练模子参数规模从千亿到万亿级别,底层GPU支持规模也抵达了万卡级别。由此导致的网络规模一直增大,网络节点间通讯面临着越来越大的挑战。在此配景下,怎样提升AI服务器盘算能力和组网通讯能力并兼顾本钱,已成为目今人工智能领域的主要研究偏向之一。
97国际网络针对AIGC算力、GPU使用率与网络的关系,以及主流HPC组网面临的挑战,推出了业界先进的“智速”DDC(Distributed Disaggregated Chassis,漫衍式疏散式机箱)高性能网络计划,为AIGC营业买通“任督二脉”,助力算力突飞猛进。
97国际网络DDC产品毗连方法示意图
以ChatGPT为例,在算力方面,使用微软Azure AI超算基础设施(由10000块 V100 GPU组成的高带宽集群)上举行训练,总算力消耗约3640PF-days(即每秒一万万亿次盘算,运行3640天),这里做个公式换算一下10000块V100需要训练多久:

ChatGPT算力和训练时间表
注:ChatGPT算力需求为网上获�。诖私龉┎慰�。OpenAI 在他们的文章“AI and Compute”中假设使用率为 33%。NVIDIA、斯坦福和微软的一组研究职员在漫衍式系统上训练大型语言模子的使用率抵达了 44% 到 52%。

ChatGPT关于训练时间的回覆
凭证ChatGPT的回复来看,较量切合上面表格盘算出来的时间,使用率应该会在50%左右。
可以看出影响一个模子的训练时长主要因素在于GPU的使用率,以及GPU集群处置惩罚能力。而这些要害指标又与网络效率亲近相关。网络效率是影响AI集群中GPU使用率的一个主要因素。在AI集群中,GPU通常是盘算节点的焦点资源,由于它们可以高效地处置惩罚大规模的深度学习使命。然而,GPU的使用率受到多个因素的影响,其中网络效率是一个要害因素。
网络在AI训练中饰演着至关主要的角色。AI集群通常由多个盘算节点和存储节点组成,这些节点需要频仍地举行通讯和数据交流。若是网络效率低下,这些节点之间的通讯将会变得缓慢,这将直接影响到AI集群的算力。
低效的网络可能导致以下问题,从而降低GPU使用率:
数据传输时间增添:在低效的网络中,数据传输的时间将会增添。当GPU需要期待数据传输完成后才华举行盘算时,GPU使用率将会降低;
网络带宽瓶颈:在AI集群中,GPU通常需要频仍地与其他盘算节点举行数据交流。若是网络带宽缺乏,GPU将无法获得足够的数据举行盘算,从而导致GPU使用率降低;
使命调理不平衡:在低效的网络中,使命可能会被分派到与GPU差别的盘算节点上。当需要大宗的数据传输时,这可能会导致GPU闲置期待,从而降低GPU使用率。
为了提高GPU使用率,需要优化网络效率。这可以通过接纳更快的网络手艺、优化网络拓扑结构、合理设置带宽等要领来实现。在训练模子中,漫衍式训练的并行度:数据并行、张量并行与流水并行决议了GPU处置惩罚的数据之间的通讯模子。模子之间的通讯效率受到以下几个因素的影响:

影响通讯的因素
其中,带宽和装备转发时延受到硬件限制,端处置惩罚时延受手艺选择(TCP or RDMA)影响,RDMA会更低,排队和重传则受到网络优化和手艺选择的影响。
凭证量化模子[1]:GPU使用率 = GPU内迭代盘算时间/(GPU内迭代盘算时间+网络总体通讯时间)来盘算得出以下结论:

带宽吞吐与GPU使用率的曲线图 动态时延和GPU使用率的曲线图
可以看到网络带宽吞吐、动态时延(拥塞/丢包)对GPU使用率影响显着。
凭证通讯总时延的组成来看:

通讯总时延组成图
静态时延相较之下影响更�。允歉Ω米胖厝ニ剂吭跹蕴毖樱庋梢杂杏玫奶嵘鼼PU的使用率,从而抵达提升算力的目的。
Infiniband组网是目今高性能网络的效果最优解,使用超高带宽和基于Credit的机制确保无拥塞和超低时延,可是也是最腾贵的解法,相比同带宽下古板以太网的组网会贵数倍。同时Infiniband手艺关闭,业内现在成熟供应商仅1家,关于最终用户来说,无法实现第二货源。
以是业内大大都用户会选择古板以太网组网的计划。
目今高性能网络主流组网计划是基于RoCE v2来组建支持RDMA的网络。其中主要的两项搭配手艺是PFC和ECN,两者均是为了阻止链路中的拥塞而爆发的手艺。
多级PFC组网下会针对交流机入口(Ingress)拥塞,逐级反压到源端服务器暂停发送,缓解网络拥塞,规避丢包;但该计划在多级组网下可能碰面临PFC Deadlock导致RDMA流量阻止转发的危害。
图片
PFC事情机制示意图
而ECN则会基于对交流机出口(Egress)拥塞的目的端感知,直接天生一个RoCEv2 CNP包通知源端降速,源服务器收到CNP报文,精准降低对应QP的发送速率,缓解拥塞的同时阻止无差别降速。

ECN标记位示意图
这两项手艺自己并没有什么问题,都是为相识决拥塞而降生的手艺,可是接纳这种手艺后可能会被网络中可能爆发的拥塞而频仍触发,最终会导致源端暂�;蚪邓俜⑺停ㄑ洞砘峤档停岫訥PU使用率爆发较量大的影响,从而造成整个高性能网络的算力被拉低。
在AI训练盘算中会有All-Reduce和All-to-All两种主要的模子,两种模子都需要频仍的从一个GPU到另外多个GPU举行通讯。

All-to-All模子 All-Reduce模子
在古板组网下,ToR和Leaf装备接纳路由+ECMP的组网模式,ECMP会基于流举行哈希负载选路,有一种极端情形就是某一条ECMP链路由于一条大象流而跑满,其余多条ECMP链路相对空闲,造成负载不均的情形。

古板ECMP安排图
在内部模拟8条ECMP链路的测试情形下,测试效果如下:

ECMP流量测试效果
可以看出,基于流的ECMP会造成较显着的某几条链路占用(ECMP1-5和1-6)和空闲(ECMP1-0至1-3较空闲),而在All-Reduce和All-to-All的两种模子下, 就很容易造成一条蹊径由于ECMP的负载不均而拥塞,一旦拥塞造成重传,就会提升总体的通讯总时延,从而降低GPU使用率。
以是,为相识决此类问题,研究界提出了phost、Homa、NDP、1RMA 和 Aeolus等富厚的解决计划,它们在差别水平上解决了 incast, 还解决了负载平衡和低延迟请求/响应流量的问题。可是也带来了新的挑战,往往这些研究的计划都是需要端到端来解决问题,对主机、网卡、网络的改动较大,关于一样平常用户而言,本钱较高。
外洋有部分互联网公司寄希望于使用接纳DNX芯片支持VOQ手艺的框式交流机来解决负载不平衡带来的带宽使用率低的问题,但也面临以下几个挑战。
扩展能力一样平常,机框巨细限制了最大端口数,如想做更大规模的集群,需要横向扩展多个机框,也会爆发多级PFC和ECMP的链路,以是框只适合于小规模安排;
装备功耗大,机框内线卡芯片、Fabric芯片、电扇等数目众多,单装备的功耗极大,轻松凌驾2万瓦,有的甚至3万多瓦,对机柜电力要求高;
单装备端口数目多,故障域大。
以是基于以上缘故原由,框式装备只适合小规模安排AI盘算集群。
DDC是一种漫衍式解耦机框装备的解决计划,接纳的芯片和要害手艺与古板框式交流机险些相同,但DDC架构简朴支持弹性扩展和功效快速迭代、更易安排、单机功耗低。
如下图所示,营业线卡作为前端成为NCP角色,交流网板作为后端成为NCF角色,原先两者之间的毗连器组件现在被光纤线缆取代,原有框式装备的管理引擎在DDC架构中也成为了NCC集中/漫衍式的管理组件。

DDC产品毗连方法示意图
DDC架构相较于框式架构的优势在于可以提供弹性可扩展性,组网规�?梢云局I集群巨细来无邪选择。
单POD组网中,接纳96台NCP作为接入,其中NCP下行共36个200G接口,认真毗连AI盘算集群的网卡。上行共40个200G接口最大可以毗连40台NCF,NCF提供96个200G接口,该规模上下行带宽为超速比1.1:1。整个POD可支持3456个200G网络接口,凭证一台服务器配8块GPU来盘算,可支持432台AI盘算服务器。

单POD组网架构图
多级POD组网中,可以实现基于POD的按需建设。由于该场景POD中NCF装备要牺牲一半的SerDes用于毗连第二级的NCF,以是此时单POD接纳48台NCP作为接入,下行共36个200G接口,单POD内可以支持1728个200G接口。通过横向增添POD实现规模的扩容,整体最大可支持10368多个200G网络端口。
NCP上行40个200G接POD内40台NCF,POD内NCF接纳48个200G接口下行,48个200G接口分为16个一组上行到第二级的NCF。第二级NCF接纳40个平面,每个平面3台的设计,划分对应在POD内的40台NCF。
整个网络的POD内实现了超速比1.1:1,而在POD和二级NCF之间实现了1:1的收敛比。
200G的网络端口兼容100G网卡接入,特殊情形下可使用1分2或1分4线缆兼容25/50G网卡。
依托分片后的Cells转发机制举行动态负载平衡,实现延迟的稳固性,降低了差别链路的带宽峰值差。
转发流程如图所示:
首先发送端从网络中吸收数据包并分类到VOQs中存储,在发送数据包之前会先发送Credit报文确定吸收端是否有足够的缓存空间处置惩罚这些报文;
若是可以则将数据包分片成Cells并且动态负载平衡到中心的Fabric节点。这些Cells在吸收端会举行重组和存储,进而转发到网络中。
Cells是基于数据包的切片手艺,一样平常巨细为 64-256Byte。
切片后的Cells凭证reachability table 中 cell destination 的盘问来决议怎样转发,并接纳轮询的机制发送。这样做的利益相比ECMP按流举行哈希盘算后选择某一条路的模式,切片后的Cells负载会充分使用到每一条上行链路,所有上行链路的传输数据量会近似相等。
若是吸收端暂时没能力处置惩罚报文,报文会在发送端的VOQ中暂存,并不会直接转发到吸收端导致丢包问题的爆发,每片DNX芯片可以提供芯片内OCB缓存以及片外8GB的HBM高速缓存,对200G端口相当于可以缓存150ms左右的数据。只有当对端Credit报文明确可以接受时才会发送。这样的机制下,充分使用缓存可以大幅度镌汰丢包,甚至不会爆发丢包情形。镌汰数据重传,整体通讯时延更稳固更低,从而可以提高带宽使用率,进而提升营业吞吐效率。
凭证DDC的逻辑来看,所有NCP和NCF可以看成一台装备,以是在此网络中安排RDMA域后,只在针对服务器的接口处保存1级的PFC,不会像古板网络一样爆发多级PFC的压制与死锁。另外凭证DDC的数据转发机制,可在接口处安排ECN,一旦在内部的Credit缓和存机制无法支持突发流量,可以向服务器端发送CNP报文要求降速(通常情形下在AI的通讯模子下,All-to-All和All-Reduce+Cell切片可以将流量尽可能的平衡,很难泛起1个端口被打满的情形,以是ECN在大都情形可以不设置)。
在管理控制平面上,为相识决管理网故障以及NCC单点故障的影响,我们作废了NCC的集中控制面,构建了漫衍式OS,通过SDN运维控制器通过标准接口(Netconf、GRPC等)设置管理装备,每台NCP和NCF自力管理,有自力的控制面和管理面。
从计划理论上说,DDC拥有支持弹性扩展和功效快速迭代、更易安排、单机功耗低等众多优势;但从现实角度出发,古板组网也拥有诸如市面可选品牌和产品蹊径较多、可支持更大规模的集群等手艺成熟带来的优势。因此在客户面临项目需求时事实是选择更高性能的DDC,照旧更大规模安排的古板组网,可以参考下面的比照及测试效果:

古板组网与DDC测试比照效果图
同时我们使用OpenMPI测试套件举行了框式装备(框式装备和DDC原理相同,本次接纳框式测试)和古板组网装备的比照模拟测试,结论是在All-to-All场景下,相较于古板的组网,框式装备带宽使用率提升约20%(对应GPU使用率提升8%左右)。

框式装备和古板组网装备的比照模拟测试
基于对客户需求的深刻明确,97国际网络已经率先推出了两款可交付产品,划分是200G NCP交流机和200G NCF交流机。
该交流机2U高度,提供36个200G的面板口,40个200G的Fabric内联口,4个电扇和2个电源。
该交流机4U高度,提供96个200G的Fabric内联口,8个电扇和4个电源。
未来97国际网络还会继续研发、推出400G端口形态产品,敬请期待。
97国际网络(证券代码:301165)作为行业向导者,一直致力于提供高品质、高可靠性的网络装备息争决计划,以知足客户关于智算中心一直提高的需求。在推出“智速“DDC解决计划的同时,97国际网络也在起劲探索和开发古板组网中的端网优化计划,通过充分使用服务器智能网卡搭配网络装备协议的优化,实现整网带宽使用率提升,资助客户更快迎来AIGC智算时代。
参考文献:
[1]Deepak Narayanan, Mohammad Shoeybi, Jared Casper,Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM,arXiv:2104.04473v5 [cs.CL] 23 Aug 2021
