97国际

不必推倒重修 ,老终端也能焕新 丨 97国际教育云电脑老客户升级分享会
预约直播
融合光加速 ,慧联全场景 丨 97国际极简以太彩光5.0 界说万兆园区全场景新范式
预约直播
97国际·(中国区)集团官方网站
产品
< 返回主菜单
产品中心
产品
解决计划
< 返回主菜单
解决计划中心
行业
合作伙伴
返回主菜单
选择区域/语言
97国际·(中国区)集团官方网站

您订阅的产品有更新 ,请实时查阅

审查详情
97国际·(中国区)集团官方网站 97国际·(中国区)集团官方网站

【第三十四期】大型数据中心网络路由协议选择

【网络路由协议选择】如作甚数据中心三层组网选择合适的路由协议?本文聚焦于大型数据中心场景 ,力争给出确切的谜底 。

  • 97国际·(中国区)集团官方网站

    宣布时间:2019-06-12

  • 97国际·(中国区)集团官方网站

    点击量:

  • 97国际·(中国区)集团官方网站

    点赞:

分享至

97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站

我想谈论

数据中心网络互联手艺

为了知足数据中心虚拟机(Vm)、容器(Docker)之间大二层通讯的需求 ,数据中心网络生长历程中泛起了众多依托网络装备硬件实现的互联组网手艺——例如借鉴路由协议实现的大二层组网手艺:多链接透明互联(TRILL)、最短路径桥接(SPB) ;虚实团结的Overlay手艺:可扩展虚拟局域网(VXLAN)、使用通用路由封装的网络虚拟化(NVGRE)等等 。但由于手艺的重大性、装备能力的狼籍不齐 ,这些手艺均没有在网络设惫亓到大规模应用 。

到今天 ,我们看到数据中心(IDC)网络返璞归真 ,与营业解耦 ,简朴、可靠成为焦点诉求 ,数据中心只需要提供简朴、可靠的三层Underlay组网 ,二层Overlay网络更多依赖主机侧软件或智能网卡实现 。

那么问题来了 ,如作甚数据中心三层组网选择合适的路由协议?本文聚焦于大型数据中心场景 ,力争给出确切的谜底 。

IDC网络架构演进

经济基础决议上层修建 。同样的 ,数据中心(物理)网络架构很洪流平上决议了路由协议的妄想 。关于架构的设计 ,推荐阅读《手艺盛宴 | 互联网数据中心网络25G组网架构设计》 。本文对IDC网络架构仅做简要先容 ,目的在于理清基础架构与路由协议选择的关系 。

古板数据中心网络架构

97国际·(中国区)集团官方网站

图1:古板数据中心网络架构(内部 ,不含网关区)

图1展示的是古板数据中心的网络架构:

古板IDC承载的大多是数据中心提供对外会见的营业 ;

流量漫衍切合80/20模子 ,且以南北向为主 ,工具向流量� � ;

网络架构设计接纳焦点-汇聚-接入三级结构 ,汇聚往下接纳大二层组网 ,汇聚及焦点横向接纳厂商私有虚拟化手艺 ,包管可靠性 ;

流量瓶颈在出口 ,IDC内部可以维持高收敛比(10:1甚至更大) 。

近年来 ,随着云盘算、大数据等营业的兴起 ,漫衍式盘算、漫衍式存储等手艺最先在IDC内部大规模安排 。从网络视角看 ,IDC内部的工具向流量急剧上升 ,流量的80/20模子转酿成以工具向流量为主 。

此时 ,古板网络架构最先力所不逮 ,展现出诸多误差:

扩展能力差:网络规模受限于焦点交流机端口数目 ,无法平滑Scale-out(横向扩展) ;

收敛比过高:为南北向流量设计的流量模子 ,收敛模子呈三角型 ,越往上性能越低 ,工具向带宽严重缺乏 ;

单控制面运维重大:汇聚及焦点的可靠性依赖于厂商的横向虚拟化手艺 ,虚拟化手艺的单控制面保存显着误差 ,很难做到不中止营业升级版本(ISSU  ,In-Service Software Upgrade) 。

Fabric网络架构

为解决古板IDC网络面临的问题 ,一种新的组网手艺:Fabric网络架构 ,最先逐步兴起 。

Fabric一词 ,网工同砚都不生疏:基于CLOS架构的机框式交流机 ,就是依赖于Fabric(交流网板)作为Line card(线卡)在装备内部的转发桥梁(如图2) 。

97国际·(中国区)集团官方网站

图2:IDC网络架构设计——Network as A Fabric

而时下数据中心火热的Fabric组网架构 ,与CLOS交流机有异曲同工之妙 。

Line card:作为输入输出源 ,搜集所有服务器的流量 ,可以等同于IDC的柜顶交流机(TOR) ;

Fabric card:在中心层构建的高速转发通道 ,跨TOR流量通过Fabric举行高速转发 。

把图2半数看 ,就是当下数据中心最盛行的叶脊(Leaf-Spine)网络架构 。

97国际·(中国区)集团官方网站

图3:Leaf-Spine叶脊网络架构

Leaf-Spine的两层结构 ,即可组成一个简朴的叶脊网络 。在IDC建设时 ,我们也会以最小交付单位(POD ,Point Of Delivery)为单位举行网络建设 。虽然 ,为了提升这种网络架构的Scale-out能力 ,一样平常会在POD之上增添一层 ,用于横向毗连各个数据中心POD ,扩大整个数据中心集群的规模 。

Leaf-Spine架构因其强盛的Scale-out能力、极高的可靠性、精彩的可运维能力而备受推许 。着名的全球互联网巨头 ,基本都使用了这种组网架构 。

Fabric网络架构用什么路由协议?

97国际·(中国区)集团官方网站

图4:使用Fabric构建的大型数据中心网络

Facebook在2014年开放了其数据中心网络设计(从F4演进到F16 ,但基本架构同图4):接纳典范的Fabric网络 。那么Fabric网络架构使用哪种路由协议更合适呢?

在RFC 7938《Use of BGP for Routing in Large-Scale Data Centers》中 ,作者提出了使用界线网关协议(BGP)作为数据中心内唯一起由协议的看法 ,并做了详细的剖析 ,有兴趣的同砚可以阅读RFC原文 。

团结这篇RFC ,以及目今海内外互联网公司的接纳BGP组网的实践 ,我们剖析下为什么BGP会更受青睐?

大型IDC网络路由设计原则

路由设计作为数据中心网络设计中很是主要的一环 ,其设计理念也需要和数据中心整体原则坚持一致 。有如下设计要点:

1、可扩展性

数据中心设计要点:大型互联网公司单园区最大服务器规模已经突破300K ,许多大型园区服务器规模在20K到100K之间 。数据中心网络在设计之初就需要思量平滑的Scale-out能力 ,能按POD举行数据中心网络的交付(镌汰前期投入) ,并最终具备扩展到承载大规模、超大规模集群的能力 。

路由协议设计要点:凭证交流机和服务器数目1:20的比例(48口交流机 ,服务器双归网络典范的比例) ,超大型数据中心运营的网络装备数目是数以千计的 。路由协议的设计需要思量一致性 ,无论是初期的小规模 ,照旧到上万万元构建的路由域 ,均能简朴好用 ,能快速撒播、收敛 。

2、带宽和流量模子

数据中心设计要点:数据中心工具向流量爆发式增添 ,古板DC高收敛比模子已经无法知足工具向流量需求 。新的网络架构中要尽可能地设计无收敛(Microsoft甚至安排了超速比网络 ,即上行带宽大于下行带宽) �K剂康酵缃ㄉ璧男约郾� ,我们推荐安排每级收敛比1:1到3:1 。

路由协议设计要点:关于Fabric网络 ,低收敛主要是依赖上行多链路负载来实现(例如典范的25G TOR交流机RG-S6510-48VS8CQ ,其下行带宽48*25Gbps=1200Gbps ,上行带宽8*100Gbps=800Gbps ,端口全使用的情形下 ,收敛比为1.5:1) 。关于数据中心路由设计 ,很是主要的一点 ,是能简朴地在数据中心多链路之间实现等价多路径路由(ECMP) 。在正常情形下 ,ECMP多链路可以匀称分担流量 ,链路新增或者剔除时 ,也能快速收敛而不影响现网营业 。

3、CAPEX Minimization

数据中心设计要点:最大限度降低资天性支出 。要领有:

只管标准化网络装备的软硬件要求 ,基于统一架构镌汰装备类型 ;

简化网络特征要求 ,降低研发本钱和时间本钱 。

路由协议设计要点:接纳成熟的 ,通用的路由协议 ,并且需要在主流型号上支持 ,笼罩接入、焦点、主干装备 。

4、OPEX Minimization

数据中心设计要点:最大限度降低运营本钱 。大型数据中心网络的运营本钱往往会比基础设施的建设本钱更高 ,镌汰运营本钱也是架构设计之初就必需思量的问题 。

路由协议设计要点:镌汰网络中故障域的巨细 。

网络故障时 ,路由收敛影响面小 ,收敛时间快 ;

整个数据中心只使用一种路由协议:更好地简化运维 ,降低学习本钱 。运营知识库也可以更容易积累 ,资助快速定位问题 ,恢复故障 。

大型IDC网络路由协议选择

1、路由协议需要具备的能力

围绕前文剖析的路由协议的设计要点 ,总结出大型IDC路由协议需要具备如下能力:

超大规模:思量可扩展性 ,从建设之初到集群最终满配 ,都使用同样的协议组网 ,协议需要具备支持横向扩展到“超大规模”数据中心的能力 ;

简朴:选择足够简朴、成熟、通用的路由协议 ,使用更少的软件特征 ,从而引入更多可供选择的装备厂商 ;

简单:数据中心只管使用简单起由协议 ,降低重漂后 ,镌汰学习本钱 ,也利于运营履历的积累 ;

减小故障域:当爆发故障时 ,镌汰影响规模 ,提升网络的结实性 ;

负载平衡:不依赖专用的负载平衡装备 ,在DC内部形成等价多路径 ;

无邪的战略控制:关于特定营业流需求 ,可提供富厚的路由战略控制手段 ;

快速收敛:在爆发故障时 ,能镌汰影响面 ,快速收敛 。

2、现有路由协议匹配度

我们看下现有路由协议的匹配度 。

路由信息协议(RIP):不适用大规模数据中心 ;

增强内部网关路由协议(EIGRP):私有协议 ,不切合需求2、3 ;

内部BGP协议(IBGP):一样平常需要配合内部网关协议(IGP)一起使用 ,不知足需求2、3 ;

开放式最短路径优先(OSPF)、中心系统到中心系统(ISIS)、BGP:起源看这三种路由协议基本能知足1-7所有需求 。其中ISIS和OSPF同属于链路状态IGP协议 ,相似度较高 ,选取应用更为普遍的OSPF举行比照 。以下着重剖析OSPF和BGP两种路由协议 。

3、OSPF VS BGP

以下是维基百科对OSPF和BGP协议的界说 。

OSPF:开放式最短路径优先(Open Shortest Path First) ,是对链路状态路由协议的一种实现 ,隶属内部网关协议(IGP) ,运作于自治系统内部 。接纳戴克斯特拉算法(Dijkstra's algorithm)被用来盘算最短路径树 。它使用“价钱(Cost)”作为路由怀抱 。链路状态数据库(LSDB)用来生涯目今网络拓扑结构 ,路由器上属于统一区域的链路状态数据库是相同的 。

BGP:是互联网上一个焦点的去中心化自治路由协议 。它通过维护IP路由表或‘前缀’(Prefix)表来实现自治系统(AS)之间的可达性 ,属于矢量路由协议 。BGP不使用古板的内部网关协议(IGP)的指标 ,而使用基于路径、网络战略或规则集来决议路由 。因此 ,它更适合被称为矢量性协议 ,而不是路由协议 。

OSPF和BGP都是应用很是普遍的路由协议 ,手艺自己没有优劣之分 。我们仅限于在大型/超大型的数据中心这个场景 ,来剖析下两种路由协议适用度 。

     协议类型

比照项

OSPF

BGP

路由算法

Dijkstra algorithm 

Best path algorithm

算法类型

链路状态

距离矢量

承载协议

IP

TCP ,有重传机制 ,包管了协议数据可靠性

需求一:大规模组网

适用度:★★★

理论上无跳数限制 ,可以支持较大规模的路由组网 ;但OSPF需要按期整网同步链路状态信息 ,关于超大规模数据中心 ,链路状态信息库过大 ,网络装备盘算时性能消耗大 ;同时网络震荡影响面大

适用度:★★★★★

只转达盘算好的最优路由信息

适用于大型/超大型数据中心 ,在超大规模园区已有成熟实践

 

需求二:简朴

适用度:★★★

安排简朴 ,运维中等

 

适用度:★★★★

安排简朴、维护较简朴

 

需求三:IDC内安排简单类型的路由协议

适用度:★★★★

知足

IDC内部可以只安排OSPF单路由协议

在Server上也有富厚的软件支持

适用度:★★★★

知足

IDC内部可以只安排BGP单路由协议

在Server上也有软件支持

外部自治系统之间也是使用BGP互联

需求四:镌汰故障域

适用度:★★

域内要同步链路状态信息 ,所有的Failure需要同步更新

适用度:★★★★

BGP外地只撒播盘算好的最佳路径 ,当网络爆发转变时 ,只转达增量信息

需求五:负载平衡

适用度:★★★★

妄想好COST值 ,多链路时形成ECMP ,某一链路故障时需要同步域内装备盘算

 

适用度:★★★★★

妄想好跳数、AS后 ,多链路时可形成ECMP ,某一链路故障时将链路对应的下一跳从ECMP组内移除

需求六:无邪控制

适用度:★★★

使用Area、lSA类型举行路由撒播的控制 ,相对重大

 

★★★★

使用富厚的选路原则 ,对路由举行过滤、控制路由的收、发

需求七:收敛快

适用度:★★★

路由数目少时 ,通过BFD联动可实现毫秒级收敛

通告的是链路状态信息 ,路由域大时 ,盘算消耗大导致收敛会变慢

适用度:★★★★

路由数目少时 ,通过BFD联动可实现毫秒级收敛

通告的是外地盘算好的路由 ,路由域大也不会显着影响性能 ;同时BGP有基于AS的快速切换手艺

表1 大型数据中心路由协议比照

通过上表剖析 ,团结业界的一些实践 ,我们以为在中小型数据中心 ,路由域内网络装备数目未几的情形下 ,使用OSPF协议是较量合适的 ;而关于大型/超大型的数据中心 ,BGP的适用度会更高一些 ,建议安排BGP路由协议 。

写在最后

限于篇幅缘故原由 ,本文只先容了大型IDC首选BGP路由协议组网的缘故原由 ,并未涉及BGP协议详细妄想 。97国际网络在海内TOP3的互联网公司 ,均承建了大型/超大型数据中心网络 ,且使用BGP路由协议组网 。关于BGP路由协议的详细妄想 ,这里先抛出几个问题 ,期待后续与各人配合探讨:

BGP私有AS号数目有限 ,关于大型数据中心,AS应该怎样妄想?

BGP使用什么接口建设邻人?ECMP/LACP场景下怎样妄想?

BGP选路原则很是多 ,怎么合理使用?

BGP性能、可靠性、收敛速率有哪些优化的要领?


本期作者:颜晓波
97国际网络互联网系统部行业咨询

97国际·(中国区)集团官方网站

 

往期精彩回首  

  • 【第一期】浅谈物联网手艺之通讯协议的纷争
  • 【第二期】怎样通过网络遥测(Network Telemetry)手艺实现细腻化网络运维?
  • 【第三期】泛论数据中心网络运维自动化
  • 【第四期】基于Rogue AP反制的无线清静手艺探讨
  • 【第五期】流量可视化之ERSPAN的宿世今生
  • 【第六期】怎样实现数据中心网络架构“去”堆叠
  • 【第七期】运维可视化之INT功效详解
  • 【第八期】浅析RDMA网络下MMU水线设置
  • 【第九期】第七代无线手艺802.11ax详解
  • 【第十期】数据中心自动化运维手艺探索之交流机零设置上线
  • 【第十一期】 浅谈数据中心100G光�?�
  • 【第十二期】数据中心网络等价多路径(ECMP)手艺应用研究
  • 【第十三期】如作甚RDMA构建无损网络
  • 【第十四期】基于EVPN的漫衍式VXLAN实现计划
  • 【第十五期】数据中心自动化运维手艺探索之NETCONF
  • 【第十六期】一文读懂网络界新贵Segment Routing手艺化繁为简的神秘
  • 【第十七期】浅谈UWB(超宽带)室内定位手艺
  • 【第十八期】PoE以太网供电手艺详解
  • 【第十九期】机框式焦点交流机硬件架构演进
  • 【第二十期】 IPv6基础篇(上)——地址与报文名堂
  • 【第二十一期】IPv6系列基础篇(下)——邻人发明协议NDP
  • 【第二十二期】IPv6系列清静篇——SAVI手艺剖析
  • 【第二十三期】IPv6系列清静篇——园区网IPv6的接入清静战略
  • 【第二十四期】Wi-Fi 6真的很“6”(概述篇)——不但是更高的传输速率
  • 【第二十五期】 Wi-Fi 6真的很“6”(手艺篇) ——前方高能 ,小白慎入
  • 【第二十六期】IPv6系列应用篇——数据中心IPv4/IPv6双栈架构探讨
  • 【第二十七期】你不可忽视的园区网ARP清静防护
  • 【第二十八期】企业办公网接入认证手艺详解
  • 【第二十九期】互联网数据中心网络25G组网架构设计
  • 【第三十期】数据中心网络运维的"巨人之剑"
  • 【第三十一期】相识gRPC手艺 ,这一篇就够了
  • 【第三十二期】你真的足够相识Wi-Fi吗?
  • 【第三十三期】关于自动化仓储Wi-Fi网络无缝周游设计
  • 【第三十四期】大型数据中心网络路由协议选择

 

相关推荐:

相关标签:

97国际·(中国区)集团官方网站 97国际·(中国区)集团官方网站

点赞

更多手艺博文

任何需要 ,请联系97国际

97国际·(中国区)集团官方网站

返回顶部

收起
97国际·(中国区)集团官方网站 文档AI助手
97国际·(中国区)集团官方网站 文档评价
资料内容是否对您有资助?
您对目今页面的知足度怎样?
不咋滴
很是好
您知足的缘故原由是(多� 。�?
您对文档是否尚有其它的问题或建议?
为尽快解决问题 ,请您留下联系方法以便回复
邮箱
手机号
谢谢您的反� 。�
97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站
请选择服务项目
关闭咨询页
售前咨询 售前咨询
售前咨询
售后服务 售后服务
售后服务
意见反响 意见反响
意见反响
更多联系方法
网站地图