97国际

不必推倒重修,老终端也能焕新 丨 97国际教育云电脑老客户升级分享会
预约直播
融合光加速,慧联全场景 丨 97国际极简以太彩光5.0 界说万兆园区全场景新范式
预约直播
97国际·(中国区)集团官方网站
产品
< 返回主菜单
产品中心
产品
解决计划
< 返回主菜单
解决计划中心
行业
合作伙伴
返回主菜单
选择区域/语言
97国际·(中国区)集团官方网站

您订阅的产品有更新,请实时查阅

审查详情

支持AI的高性能数据中心网络架构怎样设计?

97国际·(中国区)集团官方网站 宣布时间:2017-12-22
97国际·(中国区)集团官方网站

克日,工信部印发《增进新一代人工智能工业生长三年行动妄想(2018-2020年)》,意在加速人工智能从战略到落地,推感人工智能和实体经济深度融合。在新工业革命的配景下,大数据、盘算力、算法等快速迭代,正驱感人工智能进入新阶段。2017年Q3,全球AI公司融资金额突破77亿美元,是2012年的70余倍�?赡芑嵊腥怂嫡馐�“泡沫”,而我更愿意相信这是人工智能生长的一定效果。

在AI手艺的应用历程中,各个企业都在寻找能够更好支持高性能盘算的基础网络解决计划。在《数据中心基础网络架构乐成实践及未来生长趋势》这篇文章中,我分享了怎样设计一个稳固可靠的数据中心网络,下面我们再来探讨支持AI应用的高性能无损网络应该怎样设计。

前面提到大数据、盘算力、算法等快速迭代,正驱感人工智能进入新阶段,而这些手艺的实现对网络的低时延、无丢包、高性能这三个方面提出更高要求。

▲ AI应用的手艺系统及对数据中心网络的要求

高性能和无丢包较量好明确,就是指网络带宽性能的提升以及网络中不保存拥塞导致的丢包。爆发时延的环节较多,要实现端到端的低时延,需要多角度剖析:

其中,光电传输时延和数据串行时延相对较小,且很难通过架构设计来优化,我们应重点关注主机处置惩罚时延和装备转发时延。在各大企业起劲追求的高性能盘算计划中,基于以太网的RDMA(Remote Direct Memory Access)依附其高性能和低本钱优势逐渐取代InfiniBand而成为主流手艺。RoCEv2(RDMA over Converged Ethernet)手艺基于UDP协议,关于建设支持AI应用的高性能无损以太网络变得尤为主要。

团结装备转发层面的时延优化手段,高性能无损网络的实现取决于两个要素:

  • 无带宽收敛(1:1)的网络架构设计
  • 基于PFC(Priority-Based Flow Control)和ECN(explicit congestion notification)功效的优先行列管理和拥塞管理

综上,AI集群高性能盘算和网络计划实践思绪如下图所示:

▲ AI集群高性能计划要害手艺组合

在这里,我以25G网络为例,团结业界主流产品形态,分享AI网络架构设计和实现思绪。

主要设计理念:

  • 焦点装备全线速高性能转发,焦点之间不互联,接纳Fabric架构,隔离焦点故障,有用降低焦点故障的影响;
  • 三层路由组网,通过ECMP提高冗余度,降低故障危害;
  • TOR上下行收敛比严酷实现1:1,通过提高焦点装备接口密度扩展单集群服务器规模;
  • 应用PFC+ECN功效,实现低延时无损网络。

网络架构设计:

1.中小型(集群规模1000台)

▲  架构设计

架构特征:

  • 每台TOR接纳8*100GE上联8台32口100G BOX交流机,OSPF/BGP组网
  • 适用集群规模1000台
  • 每台TOR下联32台Servers,IDC内收敛比1:1 ,集群带宽25Tbps

2.中型(集群规模2000台)

▲  架构设计

架构特征:

  • 每台TOR接纳8*100GE上联8台64口100G BOX,OSPF/BGP组网
  • 适用集群规模2000台
  • 每台TOR下联32台Servers,IDC内收敛比1:1 ,集群带宽50Tbps

3.大型(集群规模2000-18000台)

▲  架构设计

架构特征:

  • 每台TOR接纳8*100GE上联4~8台焦点(机框式),BGP组网
  • 适用集群规模2000~18000台
  • 每台TOR下联32台Servers,IDC内收敛比1:1 ,集群带宽50~450Tbps

4.超大型(集群规模20000+台)

▲  架构设计

架构特征:

  • 单POD集群规模1000~2000台,数据中心集群规模20000+,BGP组网
  • POD内收敛比1:1,单POD集群带宽25Tbps,总集群带宽500Tbps+
  • POD内收敛比和上行带宽凭证集群带宽需求无邪设置,适用与非AI应用混淆安排

在数据中心网络中,PFC和ECN功效将安排在Leaf和Spine装备上。PFC作用于装备互联端口,通过反压影响上游端口行列的发送速率,而ECN是作用在装备转发历程,最终影响的是数据流的发送方,通过降低某条数据流发送速率规避数据丢包。

  • PFC 机制将以太链路上的流量区分为差别的品级,基于每条流量单独发送“不允许证”。相关于PAUSE帧而言,PFC可以将链路虚拟出8条差别品级的虚拟通道,当某条通道泛起拥塞后不会影响其它通道。
  • RoCEv2 界说了 RoCEv2 Congestion Management ( RCM ),其中拥塞管理用的特征ECN(RFC 3168)是在交流机出口(egress port)提倡的拥塞控制机制。当交流机的出口buffer抵达设定的阈值时,交流机会改变数据包头中的ECN位来给数据打上ECN标签,当带ECN标签的数据抵达吸收端以后,吸收端会天生CNP(Congestion Notification Packet)并将它发送给发送端。CNP包括了导致拥塞的flow或QP的信息,当发送端收到CNP后,会接纳步伐降低发送速率。
  • 由于PFC作用于整个行列,而ECN只针对爆发拥塞的详细会话,在设置PFC和ECN相关水线时,应做到先触发ECN后再触发PFC。

从外卖订单和叫车订单的智能调理,到电商平台的智能推荐,再到人脸识别支付以及即将实现的全自动无人驾驶汽车量产,AI手艺的应用已在方方面面影响着人们的生涯和事情,让各人的生涯越来越便捷、时间使用越来越合理。可是,这都离不开基础设施的支持。97国际网络将依附在数据通讯领域近20年的手艺积累和行业履历,立异出更好的产品息争决计划,助力AI手艺的蓬勃生长。

关注97国际
关注97国际官网微信
随时相识公司最新动态
97国际·(中国区)集团官方网站

返回顶部

收起
97国际·(中国区)集团官方网站 文档AI助手
97国际·(中国区)集团官方网站 文档评价
资料内容是否对您有资助?
您对目今页面的知足度怎样?
不咋滴
很是好
您知足的缘故原由是(多�。�?
您对文档是否尚有其它的问题或建议?
为尽快解决问题,请您留下联系方法以便回复
邮箱
手机号
谢谢您的反�。�
97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站
请选择服务项目
关闭咨询页
售前咨询 售前咨询
售前咨询
售后服务 售后服务
售后服务
意见反响 意见反响
意见反响
更多联系方法
网站地图