97国际

生产无周游  ,智造更从容 丨 从扬子江药业看企业无线零周游落地之道
预约直播
融合光加速  ,慧联全场景 丨 97国际极简以太彩光5.0 界说万兆园区全场景新范式
预约直播
97国际·(中国区)集团官方网站
产品
< 返回主菜单
产品中心
产品
解决计划
< 返回主菜单
解决计划中心
行业
合作伙伴
返回主菜单
选择区域/语言
97国际·(中国区)集团官方网站

您订阅的产品有更新  ,请实时查阅

审查详情
97国际·(中国区)集团官方网站 97国际·(中国区)集团官方网站

聊聊下一代25G/100G数据中心网络

本文用了大宗篇幅先容下一代25G/100G超大规模数据中心  ,其中主要的要害点在于古板的Chassis交流机已经成为DCN架构未来一连快速演进的阻碍  ,无论是在性能、本钱、迭代能力上  ,都比高性能、高密度的单芯片Box交流机拉开越来越大的差别。

  • 97国际·(中国区)集团官方网站

    宣布时间:2019-09-25

  • 97国际·(中国区)集团官方网站

    点击量:

  • 97国际·(中国区)集团官方网站

    点赞:

分享至

97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站

我想谈论


古板的Chassis交流机已经成为DCN架构未来一连快速演进的阻碍  ,单芯片Box交流机是否能一统天下?

配景

数据中心网络作为互联网营业快速一连生长的主要基础设施  ,已经从各人熟知的千兆网络到万兆网络  ,再到今天已经规模安排的25G/100G网络  ,网络性能的快速提升  ,知足了营业对带宽的迫切需求。那么既然已经是25G/100G网络了  ,为什么还要谈所谓的“下一代25G/100G数据中心网络”呢  ,这个“下一代”岂非只是一个噱头?

今天的数据中心网络究竟遇到了什么挑战?

营业的“不确定性”对数据中心网络手艺的演进提出严肃挑战。

各人都熟悉营业生长驱动了手艺的一直前进。可是从营业自己特点看  ,会发明营业是很难被看清  ,体现出许多的“不确定性”  ,包括营业内容的不确定性、营业手艺的不确定性以及营业安排的不确定性。从基础网络的角度去看营业  ,着实是很难看得懂  ,也很难跟得上  ,这就对古板被动演进的数据中心网络提出了重大的挑战。

面临这些”不确定性”  ,我们的网络究竟应该怎样做?若是照旧被动地追随、演进  ,在时间和架组成熟度上很难包管  ,以是网络架构设计必需寻找一个“确定性”的战略自动应对这些营业的“不确定性”  ,详细体现在以下几点:

  • 网络性能的一连提升  ,提供更高的转发性能  ,包括服务器接入带宽和上行带宽  ,以及更低的网络收敛 ;同时基于RDMA手艺的超低延时转发也是性能提升的主要方面 ;
  • 网络稳固性的一连提升  ,特殊是在高带宽下  ,网络稳固性越发主要  ,任何单点故障都会带来重大的损失。除了网络自己组网的高可靠  ,还需要进一步提升运维能力  ,实现简朴、标准、统一组网 ;
  • 一连提高单集群服务器规模  ,降低每服务器的网络建设本钱。建议单集群可以支持10万台服务器  ,焦点在于实现流量的大集中  ,大大镌汰DCI的链路本钱  ,提供更高性能的转发能力和更低的转发时延 ;

以是总结来看  ,未来网络的架构演进  ,面临营业的种种“不确定性”  ,必需在网络性能、稳固性、网络规模上一连、快速迭代  ,走在营业的前面  ,挣脱网络层面的被动时势后  ,才华有更多精神和能力去探索、研究越发有价值的、贴近营业的手艺研究和立异。

正基于此  ,25G/100G数据中心网络已经成为目今主流的网络形态。

97国际·(中国区)集团官方网站
▲ 图 1-1 古板25G/100G数据中心网络架构

如上图所示  ,古板25 G/100G数据中心网络可以实现服务器25G或100G接入  ,通过三级组网可以实现大规模组网  ,单集群服务器规�?梢粤杓�5万台� ;赥1+T2组合的Server-Pod可以像搭积木一样无邪地横向扩展  ,按需建设  ,整体看起来似乎已经很完善  ,若是不思量未来带宽升级400G/800G  ,这个架构尚有须要再去折腾吗?

为什么25G/100G数据中心网络还需要迭代升级?

古板25G/100G数据中心网络之以是还需要进一步演进的要害就在于图 1-1 中T3装备。

古板大型10G及25G/100G数据中心网络中  ,T3条理的装备类型是多接纳了多槽架构的框式交流机  ,即Chassis。虽然Chassis在以往的数据中心及MAN(Metropolitan Area Network  ,城域网)中可以很好地服务营业  ,可是关于未来网络架构一连快速演进、追求更大规模、更低本钱、更快交付等层面  ,Chassis已经成为我们的障碍。

97国际·(中国区)集团官方网站
▲ 图 2-1 Chassis交流机

Chassis交流机多芯片结构消耗更多的转发时延

Chassis交流机接纳的是多芯片的设计  ,在接口板卡和Fabric板卡上大多接纳多个交流机芯片组合  ,实现更高性能和更高端口密度  ,如下图:

97国际·(中国区)集团官方网站
▲ 图 2-2 36个100G接口线卡

可是这种多芯片的结构会消耗更多的转发时延  ,如下图 2-3 所示:

97国际·(中国区)集团官方网站
▲ 图 2-3 Chassis多芯片内部转发示意图

在上面的示意图中有两条流  ,无论是跨板卡转发照旧统一个板卡的两个端口转发  ,在Chassis交流机内部至少有三跳  ,理论爆发的时延在10us左右。10us看似很小  ,可是营业是有感知的  ,由于基于RDMA的超低延时转发营业  ,优化过的端到端延时是1us  ,以是多芯片结构消耗的延时很主要。

Chassis交流机阻碍每服务器组网本钱的一连降低

基于古板Chassis交流机组网时  ,相比单芯片Box交流机  ,每服务器的组网本钱差别较量大  ,特殊是在单集群服务器规模较小的情形。

97国际·(中国区)集团官方网站
▲ 图 2-4 Chassis交流机和单芯片
Box交流机的每服务器组网整天职析
(蓝色实线代表Chassis交流机  ,红色实线代表单芯片Box交流机)

图 2-4是模拟盘算在差别规模的服务器组网下  ,接纳Chassis交流机(576个100G接口)和单芯片Box交流机(128个100G接口)的每服务器组网本钱差别  ,这里包括交流机、线缆等组件  ,举行归一化的处置惩罚  ,利便直寓目到差别。

各人会发明  ,在单集群服务器规模2万台以下时  ,两种交流机组网思绪的每服务器本钱差别很大  ,纵然到了单集群10万台服务器规模  ,两者的每服务器组网本钱仍然有20%以上的差别。

备注1:模拟盘算凭证1台Chassis交流机对标4台单芯片Box交流机  ,包管总端口数相等  ,这种较量模子也有一定的假设  ,4台单芯片Box交流机对标1台Chassis交流机时不需要通过自力的Fabric互联形成一个整体。

另外  ,Chassis交流机组网带来的间接本钱高  ,且无法支持未来一连迭代。

首当其冲的是Chassis交流机的高功耗阻碍基础网络的快速交付  ,且无法一连支持。由于Chassis交流机多板卡、多芯片的特征  ,随着接口速率及接口密度的升级  ,整机的功耗逐渐上升  ,整机576个100G接口的Chassis交流机(16槽)典范功耗已经抵达20kW左右  ,若是再升级到全400G接口  ,整机的功耗预计抵达50kW  ,这会导致机房的供电线路刷新事情十分重大  ,周期也很是长  ,甚至基础无法刷新  ,这就严重影响营业对基础网络快速交付的要求  ,这就带来时间本钱、物料本钱的大宗支出。Chassis交流机的大功耗  ,还带来散热的问题  ,需要特殊设计  ,这也涉及本钱的增添。

Chassis交流机体积更大  ,目今16槽位36口100G交流机高度最低可以做到21U  ,可是16槽位36口400G交流机高度凌驾30U  ,需要占用更多的机柜空间  ,也是本钱问题 ;

另外  ,由于Chassis芯片的特殊性及产品结构重大性  ,关于架构同砚和运维同砚来讲  ,需要思量的越发周全  ,自动化运维平台可能也需要做特殊的思量  ,大大增添手艺学习本钱和运维本钱  ,倒运于网络简朴、稳固、可靠的设计目的。

Chassis交流机阻碍网络架构一连快速迭代

Chassis交流机由于所接纳芯片的特殊性、产品开发设计的高难度等问题  ,导致Chassis交流机自身更新迭代速率相对Box交流机慢  ,成为整网架构演进速率的短板。

Chassis交流机芯片与Box交流机芯片由于手艺系统差别导致芯片迭代差别步。Chassis交流机通常接纳专用的芯片  ,提供大容量的缓存及信元切片等特征  ,可以提供更强盛的QoS能力  ,相比Box交流机接纳的芯片  ,Chassis交流机接纳的芯片架构、手艺越发重大  ,也就导致芯片的转发性能、功效特征迭代的周期长。而Box级交流机芯片手艺相比简朴  ,虽然不提供大缓存等能力  ,可是其转发性能、功效特征迭代更快  ,越发轻量级  ,险些每1~1.5年可以升级一代。当Chassis交流机与Box交流机混淆组网时  ,可能会泛起性能及特征的不匹配  ,导致类似INT等新特征无法整网统一安排  ,造成一定水平的资源铺张。

Chassis交流机与Box交流机由于芯片差别及结构差别导致整机产品开发周期差别步。Chassis交流机一样平常由主控板、接口板、交流板等多个要害组件组成  ,整机多板卡+每板卡多芯片  ,许多功效需要依托集中式盘算+漫衍式处置惩罚  ,同时需要实现跨板卡、跨芯片的表项同步等  ,导致Chassis产品的商业化开举事度和周期相比单芯片Box交流神秘重大N个量级  ,以是产品开发周期也很是长  ,这就会严重影响整体组网架构的迭代速率。

97国际·(中国区)集团官方网站
▲ 图 2-5 Chassis交流机重大的硬件结构

总结
通过比照Chassis交流机和单芯片Box交流机  ,从转发性能、建网本钱、运维本钱、产品迭代等几个方面  ,说明Chassis交流机在DCN内部已经成为网络快速迭代的瓶颈。

总体上看  ,未来数据中心网络若是要快速平滑迭代、升级  ,Chassis交流机的问题必需要解决  ,接纳基于单芯片Box交流机组网  ,去框化将成为未来的主流。

所谓的单芯片Box究竟长什么样子?  

前面我们花了大宗的篇幅说明Chassis交流机已经成为未来架构一连演进的障碍  ,需要基于单芯片Box交流机替换  ,实现去框化  ,那么这个可以替换Chassis交流机的单芯片Box交流机究竟长什么样子呢?

现在在古板的DCN架构  ,如图 1-1所示  ,在T3条理接纳的就是Chassis交流机  ,一样平常接纳16槽位  ,设置36口100G的板卡  ,整机可以提供576个100G接口  ,如下图:

97国际·(中国区)集团官方网站
▲ 图 3-1 97国际网络Chassis焦点交流机RG-N18018-X

以是适合替换古板Chassis交流机的单芯片Box交流机应该具备只管高的转发性能  ,可以提供更高密度的100G接口。凭证目今交流机芯片工业界的情形  ,已做生意用的最高单芯片转发性能是12.8Tbps  ,整机最高可以提供128个100G接口  ,1台古板16槽位Chassis对等4台单芯片Box交流机  ,详细如下:

97国际·(中国区)集团官方网站
▲ 图 3-2 97国际网络单芯片
高密100G交流机RG-S6920-4C

以97国际网络的RG-S6920-4C为例  ,整机接纳一颗高性能交流机芯片  ,提供单向12.8Tbps的转发性能 ;提供4个可插拔的子卡  ,每个子卡提供32个100G接口  ,未来随着400G光�?榈钠占�  ,可以替换8个400G接口的子卡  ,整机提供32个400G接口。

基于单芯片Box交流机+多平面组的下一代超大规模数据中心网络

基于单芯片Box交流机的下一代25G/100G网络架构究竟是什么样子?如下所示:

97国际·(中国区)集团官方网站
▲ 图 4-1 下一代25G/100G超大规模数据中心网络架构

整体归纳综合来说  ,未来可以支持规模一连平滑扩展的高性价比网络架构就是正交多平面的架构。

备注2:这里给出的只是一个建议的组网模子和思绪  ,针对详细项目  ,需要凭证收敛比的妄想来调解相关平面和装备的数目

整个集群基于Leaf+Pod-Spine+Spine三级组成  ,其中Leaf+Pod-Spine组成Server-Pod  ,每个Server-Pod支持标准数目的服务器规模  ,作为标准化�?�  ,整网通过横向扩容Server-Pod实现单集群服务器规模的平滑扩容  ,就像群集木一样。

多个Server-Pod之间的网络通讯  ,是通过与上层正交的多平面Spine装备举行互联。

同时  ,在Server-Pod和Spine层级  ,都接纳磷七性能单芯片Box装备  ,即整机提供128个100G接口  ,整网交流机装备只有两种规格  ,大大简化组网、运维。

标准化、横向可扩展的Serve-Pod

Sever-Pod由Leaf+Pod-Spine组成  ,关于25G网络来说  ,Leaf层产品端口形态一样平常是48x25G+8x100G  ,收敛比是1.5:1 ;Leaf装备上行通过8个100G接口毗连到本Server-Pod内的8台Pod-Spine。

每个Server-Pod详细可以支持几多台服务器的毗连?在Pod-Spine装备端口数目一定的情形下  ,就取决于Pod-Spine装备的收敛比妄想设计。

古板网络在Pod-Spine这个层面的收敛比设计一样平常为3:1  ,可是未来营业需要更低的收敛比  ,以更好地知足盘算与存储疏散、在线与离线混部带来的超大工具向流量需求(跨Server-Pod) ;同时思量Leaf层交流机收敛比一样平常都是1.5:1  ,以是建议Pod-Spine最低也能支持1.5:1的收敛比  ,通过盘算  ,关于128口100G的单芯片Pod-Spine装备  ,接纳80个100G端口下行  ,48个100G端口上行  ,最终收敛比可以做到1.67:1左右。可是思量初期建设本钱及网络流量的增添是逐渐升级的  ,以是可以先接纳2.5:1收敛比  ,即接纳下行80个100G端口  ,上行32个100G端口  ,镌汰Spine层面装备数目  ,Pod-Spine装备剩余空闲的端口可以知足未来扩展  ,进一步降低收敛比。

在这样的妄想下  ,每个Server-Pod中  ,若是每台服务器接纳双25G链路上行  ,那么单Server-Pod可以支持48x(80/2)=1920台服务器  ,若是每台服务器接纳单25G链路上行  ,单Server-Pod可以支持48x80=3840台服务器。

关于这样的收敛比设计  ,若是单集群要支持10万台服务器  ,只需要横向扩展52个Server-Pod  ,若是要扩展支持更大的服务器规模  ,无非是Spine层面128口单芯片交流机装备划分更多的下行端口毗连更多的Pod-Spine  ,至于最大能支持几多Server-Pod  ,这又取决于Spine层面的收敛比设计。

统一、高性价比的多平面Spine

讲到这里  ,我们会发明Spine层面装备在古板DCN设计中接纳的多槽位Chassis装备  ,可是在我们下一代25G/100G架构中  ,被单芯片128口100G的Box交流机替换  ,实现去框化。以是在思量Spine层面的收敛比设计时  ,基于128口100G的装备妄想。

关于Spine层面  ,也是平行多平面设计  ,与Server-Pod泛起平面正交的毗连  ,目的是包管为所有Pod-Spine之间提供最大化的冗余毗连  ,整体基于ECMP实现相同的跳数  ,包管最短的路径转发  ,也简化了网络的妄想。

关于Spine层平面的数目  ,从图 4-1中可以看到  ,Spine平面的数目着实对应每个Server-Pod中Pod-Spine装备的数目。凭证目今Server-Pod的妄想  ,整网需要设计8个Spine平面  ,每个Pod-Spine上行对应一个自力的Spine平面。

每个Spine平面有几多台装备  ,取决于Pod-Spine的收敛比设计。凭证之前Pod-Spine建议的收敛比设计  ,每个Spine平面需要妄想32台Spine装备  ,那么8个Spine平面  ,一共需要妄想256台的Spine装备。

之前已经提到  ,Server-Pod最终可以扩展几多  ,取决于Spine装备的收敛比设计  ,凭证业内的一些履历  ,同时思量各集群之间的工具向流量  ,即DCI的流量  ,建议单集群Spine层面至少可以扩展支持到3:1的收敛比性能。凭证单集群10万台服务器规模最终有52个Server-Pod  ,关于每个Spine装备来讲下行偏向至少分派52个100G接口  ,上行偏向分派16个100G端口毗连MAN装备就可以提供3:1的收敛比  ,未来可以随着Server-Pod规模的调解和收敛比的需求  ,无邪调解上、下行100G端口的分派  ,整体来说  ,Spine的128个端口数目很是的充裕。

一个完整的数据中心不但是Leaf和Spine

我们之前详细形貌的内容只是针对一个DCN的最受关注的部分  ,即Leaf、Leaf-Spine及Spine  ,可是只有这三个部分是不完整的  ,怎样实现集群之间的互访、怎样对外提供营业呢?以是关于一个整体的数据中心园区来讲  ,整体架构应该是什么样子?

针对整个园区来说  ,我们建议的完整架构是基于内网和外网疏散的方法  ,建设超大规模的数据中心园区。

97国际·(中国区)集团官方网站
▲ 图 4-2 基于单芯片Box交流机组网的超大规模园区架构

首先  ,内外网疏散。外网就是毗连运营商  ,实现最终用户会见数据中心营业的网络。内网主要是实现数据中心内部服务器之间的工具向流量。接纳内外网疏散的组网建议  ,目的在于包管本钱增添较少的情形下  ,让网络的界线越发清晰  ,简化网络装备的数据妄想和管理  ,实现运维的自力。
第二  ,建议以园区为单位建设一个集中、自力的GW(Gateway  ,网关)区域  ,例如Load-Balance、NAT(Network Address Translation  ,网络地址转换)、专线接入网关等  ,这种设计的思量一方面在于GW营业对服务器的设置和性能要求与通俗营业差别  ,并且两者对网络性能的要求也有较大差别  ,自力建设利便妄想、运维  ,获得更好的收益。
第三  ,在园区一级建设MAN平面  ,实现同园区各集群之间工具向高速互联  ,或者通过MAN毗连其他园区。关于MAN平面网络装备  ,若是确认对交流机大容量缓存等能力没有强需求  ,则也可以思量去框  ,接纳基于单芯片128口100G的Box交流机建设  ,实现建设本钱和运维本钱的降低。这里假设了每个平面安排6台  ,一共8平面举行建设。

之前园区的架构是一个三维立体的示意图  ,为了利便各人明确  ,这里展示的是二维平面图  ,详细如下:

97国际·(中国区)集团官方网站
▲ 图 4-3 基于单芯片Box
交流机组网的超大规模园区架构(二维图)

总结:基于单芯片Box交流机组网的收益

基于单芯片Box交流机+多平面组网  ,实现超大规模的下一代25G/100G数据中心网络组网  ,其焦点头脑是在DCN内部基于单芯片Box交流机实现去框化  ,可以知足未来网络一连演进  ,无论是在网络规模、本钱、性能上都获得更大的收益  ,详细收益总结如下:

97国际·(中国区)集团官方网站
▲ 图 5-1 单芯片Box交流机收益总结

  • 超大规模

• 单Server-Pod支持的服务器规模2000台  ,单集群可以支持10万台服务器 ;

• 基于Server-Pod的方法按需无邪扩展 ;

  • 高性能

• 每台服务器提供50Gbps上行带宽(针对25G服务器接入) ;

• 每组服务器提供1.6Tbps上行带宽  ,每个Server-Pod提供25.6Tbps上行带宽 ;

• 提供更低收敛比设计 ;

• 端到端提供统一的RDMA营业承载  ,为营业提供高性能吞吐和超低时延转发 ;

  • 高可靠

• 整网CLOS组网  ,无单点故障 ;

• 去Chassis  ,单点故障对营业影响更低 ;

• 接纳Leaf“去堆叠”设计  ,知足服务器可靠接入的同时简化Leaf的运维管理 ;

  • 手艺统一

• 统一芯片手艺  ,基于一致的手艺盈利为营业实现统一的能力支持 ;

• 基于统一架构能力  ,简化运维  ,实现运维能力、运维履历的融合  ,降低本钱 ;

  • 低本钱

• 大幅度降低硬件本钱  ,相比同端口密度的Chassis交流机  ,单芯片Box交流机的硬件本钱降低47% ;

• 大幅度降低电力本钱  ,相比同端口密度的Chassis交流机  ,单芯片Box交流机的功耗降低71%  ,不需要单独的电力刷新  ,也降低对散热的需求  ,加速项目交付周期 ;

• 降低空间本钱  ,相比同端口密度的Chassis交流机  ,单芯片Box交流机可以节约24% ;

基于单芯片Box组网尚有其他收益吗?

通过上面的深入剖析  ,在DCN内部接纳单芯片Box交流机替换古板Chassis  ,在扩展性、本钱、可靠性等几个方面都可以获得较大的收益  ,可是这部分更多是底层相关的  ,对营业有更多感知的还在于芯片统一后  ,在架构及运维包管方面的能力荟萃  ,详细如下:

97国际·(中国区)集团官方网站
▲ 图 6-1 开放统一的下一代互联网数据中心能力地图

如上图所示  ,除了架设一张高性价比的超大规模数据中心基础网络  ,在面向营业层面的能力  ,包括提供RDMA营业端到端的安排  ,提供数据中心IPv4&IPv6营业双栈 ;在此基础上  ,基于全新一代的交流机芯片手艺架构  ,提供统一、标准的运维能力  ,包括可视运维、统一运维、开放运维、智能运维。

由于篇幅缘故原由  ,本文暂时不睁开这些手艺细节  ,敬请期待后续解说文章。

写在最后

本文用了大宗篇幅先容下一代25G/100G超大规模数据中心  ,其中主要的要害点在于古板的Chassis交流机已经成为DCN架构未来一连快速演进的阻碍  ,无论是在性能、本钱、迭代能力上  ,都比高性能、高密度的单芯片Box交流机拉开越来越大的差别。

可是不是Chassis交流机已经没价值了呢?单芯片Box交流机可以一统天下了呢?效果一定是否定。事实Chassis交流机由于芯片的手艺优势  ,具有单芯片Box交流机无法相比的超大容量缓存  ,配合Cell切片及VoQ可以提供强盛的QoS管理能力  ,避免在带宽瓶颈下营业突发导致的丢包问题。

以是通过现在业界大型互联网公司的选择效果上看  ,在集群内部  ,适合接纳单芯片Box交流机替换古板的Chassis交流机  ,可是在MAN及DCI主干平面的建设  ,更多选择Chassis交流机  ,关注大容量缓存能力及单机的端口密度。

可以大胆展望  ,未来营业对数据中心网络的性能、规模、可靠性、本钱有更高的需求  ,随着单芯片Box交流机的性能进一步提升  ,未来单芯片性能抵达25.6Tbps、51.2Tbps的Box会更多地应用在DCN组网中  ,甚至实验延展到MAN或者DCI平台。

 

相关推荐:

更多手艺博文

任何需要  ,请联系97国际

97国际·(中国区)集团官方网站

返回顶部

收起
97国际·(中国区)集团官方网站 文档AI助手
97国际·(中国区)集团官方网站 文档评价
资料内容是否对您有资助?
您对目今页面的知足度怎样?
不咋滴
很是好
您知足的缘故原由是(多�。�?
您对文档是否尚有其它的问题或建议?
为尽快解决问题  ,请您留下联系方法以便回复
邮箱
手机号
谢谢您的反�。�
97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站
请选择服务项目
关闭咨询页
售前咨询 售前咨询
售前咨询
售后服务 售后服务
售后服务
意见反响 意见反响
意见反响
更多联系方法
网站地图