97国际

不必推倒重修,老终端也能焕新 丨 97国际教育云电脑老客户升级分享会
预约直播
融合光加速,慧联全场景 丨 97国际极简以太彩光5.0 界说万兆园区全场景新范式
预约直播
97国际·(中国区)集团官方网站
产品
< 返回主菜单
产品中心
产品
解决计划
< 返回主菜单
解决计划中心
行业
合作伙伴
返回主菜单
选择区域/语言
97国际·(中国区)集团官方网站

您订阅的产品有更新,请实时查阅

审查详情
97国际·(中国区)集团官方网站 97国际·(中国区)集团官方网站

大型数据中心BGP路由协议妄想

【BGP路由协议】本文借鉴了海内外大型互联网公司的实践履历,总结了一些妄想和运营BGP网络的要领。

  • 97国际·(中国区)集团官方网站

    宣布时间:2019-08-29

  • 97国际·(中国区)集团官方网站

    点击量:

  • 97国际·(中国区)集团官方网站

    点赞:

分享至

97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站

我想谈论

本文借鉴了海内外大型互联网公司的实践履历,总结了一些妄想和运营BGP网络的要领

前言

在之前的文章《大型数据中心路由协议选择》中,先容到界线网关协议(BGP)已经成为大型数据中心(IDC)优先选择的路由协议。众所周知,BGP最初是为差别自治系统之间的互通设计的,而并非面向IDC内部。在BGP引入到数据中心场景时,也一经泛起“水土不平”,问题诸多。面临这些问题,智慧的网络工程师们对BGP做了哪些优化?数据中心BGP网络妄想需要思量哪些问题?本文借鉴了海内外大型互联网公司的实践履历,抛砖引玉,粗浅剖析一二。

大型数据中心组网架构

97国际·(中国区)集团官方网站

▲ 图1:大型数据中心Spine-Leaf组网架构(内网)

面临数据中心营业对可靠性近乎苛刻的要求,现代数据中心网络的主要设计要领是假定网络装备和链路都是不可靠的:目的在于当这些不可靠的装备或者链路泛起故障时,也能通过自愈消除对营业爆发的不良影响�;诖�,Leaf-Spine (Leaf:叶节点,Spine:脊节点)的组网架构已经成为数据中心主流。如图1所示,这种CLOS多级交流网络为数据中心带来的显著转变是爆发了大宗的等价装备和路径,从而消除了单点故障,使得网络架构具备高可靠、高性能以及强盛的横向扩展(Scale-out)能力。

在这样的数据中心架构下,BGP路由协议往往会被安排到CLOS网络的所有层级(如图1的TOR,Leaf,Spine等装备),用来为数据中心形成简朴、统一的超大规模网络。关于BGP的安排来说,除了知足IPv4、IPv6路由转达的基本能力外, BGP的快速收敛、无邪控制、利便运维等能力也是安排设计的要害点。

BGP安排设计要点

本文的目的在于为IDC的BGP路由安排设计提供一些要领参考,场景聚焦在IDC内部Underlay路由设计。

97国际·(中国区)集团官方网站
▲ 图2:数据中心BGP安排设计要点

如图2所示,在一个典范的三级CLOS数据中心组网中,BGP设计要点大致可以分为两部分:

一、BGP基础能力妄想,包括:

  • 为Tier 1-3装备妄想AS number;
  • 基础BGP参数设置,装备间建设BGP邻人;
  • 为CLOS网络天生ECMP等价路由;
  • 对差别类型的BGP路由举行路由属性控制;
  • 制订路由转达的规则;
  • 提供IPv4/IPv6双栈能力;


二、BGP运维能力妄想,包括:

  • 使用双向转发检测协议(BFD)加速故障收敛;
  • 提供不中止的营业能力。

BGP基础能力妄想

1、AS number妄想

BGP的AS number分为公共AS和私有AS。在IDC内部,虽然AS号不会通告给外部网络,但为了包管清静性,以及延续使用习惯,仍推荐使用私有AS号。

旧的BGP版本(RFC1771界说)留给AS号的长度规模是2个字节,其中用于私有的AS号为1023 个(64512~65534),缺乏以应付大型IDC成千上万的网元数目。关于这个问题现在有两种解决计划:

  • 新的RFC4893《BGP Support for Four-octet AS Number Space》界说了4字节的BGP AS number。这使得AS number和IPv4地址一样多,其中可用于私有AS的规模抵达9万万个(4200000000~4294967294)。足以为IDC内部的每台网络装备,甚至每台主机分派一个自力的AS number。
  • 思量到AS number使用的精练,并确保所有装备都能支持,推荐使用64512~65534的私有AS号,并对AS号码举行全局妄想,统一个AS number可以被多个装备重复使用。

以下是一个推荐的AS number分派示例:

97国际·(中国区)集团官方网站

▲ 图3:IDC AS number分派示例


2、BGP基础参数设置

这部分是数据中心实现BGP互通的基础,推荐如下设置:

BGP邻人建设

BGP是基于TCP来建设毗连的,因此需要为BGP指定一个IP地址用于建设BGP会话。
在IDC内部推荐使用装备的直毗连口地址建设BGP会话。

BGP的Router-id

仅仅是一个标识,设置为交流机的管理口地址或者loopback地址都是不错的要领。

BGP计时器

BGP需要使用keepalive新闻来实现会话的�;�,确定下一跳的可达性。如前文所述,BGP最早是设计应用于差别自治系统(服务商)之间互联的。差别AS之间路由的稳固性比快速收敛更为主要,为了避免路由震荡,BGP协议默认的计时器很是长,其keepalive/hold timer划分是60S和180S。而在数据中心内部,故障的快速收敛更为主要,推荐接纳1S/3S的BGP计时器设置加速收敛。BGP尚有另外一个主要的计时器:Advertisement Interval,即宣布路由通告的距离。在这个周期内的BGP事务会被缓存起来,期待计时器到了后再统一发送。BGP默认的通告距离是30S。在数据中心需要连忙通告转变,因此推荐的设置是0 S。

以97国际RGOS软件为例,需要在BGP历程下,对计时器举行设置:

97国际·(中国区)集团官方网站

其他推荐的设置

bgp log-neighbor-changes :不翻开 debug 的情形下纪录BGP 的状态转变信息。


3、BGP ECMP

关于CLOS网络而言,等价多路径是修建网络可靠性、稳固性的基石。

BGP形成等价路由的条件是开启“多径”multipath的特征,以97国际RGOS为例,需要设置:

97国际·(中国区)集团官方网站

以上只是开启了BGP的多路径能力,接下来需要使用BGP选路的原则,把把多条链路的的下一跳都放入路由表中形成ECMP。13条BGP选路原则中,两条路由等价并执行负载平衡的判断标准是:前8个条件都相同。在数据中心BGP妄想中,这前8个条件只需要思量AS_PATH即可,由于其他条件在IDC都是一致或者无需体贴的。

关于AS-PATH属性,在缺省情形下是要求准确较量的,只有AS-PATH的长度和详细AS Number相同时才可能成为等价路径。依据前面的AS Number妄想,每台TOR都具备差别的AS号。这样Leaf南向去往同组两台TOR装备的路由无法实现负载分担。上述问题的解决计划是在Leaf装备上使能AS-PATH 宽松较量,以97国际RGOS为例,需要设置:

97国际·(中国区)集团官方网站

如前文的AS妄想,在统一Pod中,所有Leaf的AS number相同,因此无论是哪一台Leaf装备发送路由,在TOR上看到的AS-PATH总是一致的。因此Leaf上无需开启宽松较量模式。

别的,Leaf和TOR之间保存大宗的等价邻人,拥有一致的设置战略。现实的安排历程中推荐使用BGP peer-group功效来简化设置。

在97国际RGOS做如下设置实现该功效:

97国际·(中国区)集团官方网站

4、BGP路由属性妄想

BGP具备富厚的扩展属性,可以实现强盛的路由控制,目今IDC中用的较多的是BGP community属性,可以很洪流平简化路由战略。在IDC当中,我们常�;崾褂玫剿接械恼迨粜�,用来为前缀加上管理的标记。私有community使用的是AS:number的名堂,其中AS是指外地AS号或者对等体AS号,而number是指外地分派好的,用来体现可以应用战略的一组整体。现实使用中我们可以用更精练的community标记,好比为营业网段打上1:1属性,为内网汇总路由打上2:2属性等,并基于此做路由转达的细腻控制。

5、制订路由转达规则

97国际·(中国区)集团官方网站
▲ 图4:数据中心BGP路由通告妄想

如图4所示,多组TOR+Leaf组成一个POD(最小交付单位,Point of delivery,作为数据中心基本物理设计单位)。Spine认真横向毗连多个POD,而MAN/DCI认真提供跨区域的互联。IDC的BGP路由妄想建议如下:

  • 北向路由转达

TOR至Leaf至Spine至MAN/DCI,逐级通告营业网段+管理网段+Loopback,在去堆叠场景时TOR需要向Spine通告主机路由。

  • 南向路由转达

MAN/DCI至Spine至Leaf,转达整个内网的汇总路由,好比10.0.0.0/8;172.16.0.0/12;192.168.0.0/16。而Leaf至TOR,除了通告内网汇总路由外,还需要通告本Pod的营业网段+管理网段+Loopback(当Leaf上行链路故障时,同POD的流量仍可以匹配明细路由,通过Spine转发)。

值得注重的是

现在TOR层级越来越多地使用了去堆叠手艺实现服务器双归(推荐参考手艺盛宴的另一篇文章《怎样实现数据中心网络架构“去”堆叠》)。在去堆叠场景下,Leaf会从ToR交流机上吸收到大宗的主机路由(取决于Pod内主机数目,可能是数以万计),Leaf在TOR之间转达主机路由,很可能导致TOR交流机路由容量超限,因此需要在TOR的收偏向做战略,过滤掉其他TOR发过来的主机路由。

6、BGP双栈妄想

近年来国家鼎力大举推动IPv6建设,现实上大型IDC私网地址也面临枯竭。因此在IDC内安排IPv4/IPv6双栈,也是迫在眉睫的需求。

BGP自己支持多协议,可以在统一个BGP历程中支持v4/v6双栈。一样平常的做法是为BGP v4和v6邻人划分建设BGP会话,但这样相当于增添了一倍的设置和维护事情量。现实上,BGP v4的update新闻可以通过v6建设的 TCP毗连来发送,反之亦然,即单个毗连允许多种协议族的新闻通告。

97国际·(中国区)集团官方网站
▲ 图5:在IPv6 Session上通告IPv4路由信息

如图5所示,97国际网络提供了一种优化计划:只建设单会话来承载双栈的路由,这样做的利益除了简化设置、节约IP,还为类似BFD for BGP等协议的安排镌汰了一半的性能消耗。

BGP运维能力妄想

除了要思量BGP基础能力的妄想,数据中心关于BGP网络可运维能力也提出了很高的要求。常见的BGP运维能力的设计包括如下几点:

1、使用BFD手艺加速BGP网络收敛

虽然IDC网络是以高度冗余来构建的,但网络的可靠性仍受限于网络装备检测出故障,并重新将流量路由到其他的路径的能力(尤其是在光�?榛蛘吖庀朔浩鸬ネǖ募饲樾蜗拢�。当下数据中心,故障收敛时间要求越低越好(云营业要求做到亚秒级)。如前文所述,可以通过修改BGP计时器加速收敛,但这种慢hello机制收敛时间尽快也是秒级,还缺乏以知足要求。

而BFD可以提供毫秒级的检测精度,通过与BGP联动,可以实现BGP路由快速收敛,确保营业一连。在数据中心IDC中推荐开启BFD for BGP的设置,思量到装备性能,全端口开启时推荐接纳300ms*3设置。

以97国际RGOS软件为例,BFD主要设置如下:

97国际·(中国区)集团官方网站

2、不中止营业能力-BGP快速切换

BGP路由收敛需要在路由表中删除失效路由,并增添新的路由,同时在芯片转揭晓中实现对应的增、删。在保存大宗路由的情形下,逐条删除并刷新路由表需要一定的时间,收敛时间可能抵达数秒甚至数十秒。97国际RGOS软件在路由收敛上提供了优化的手段:支持前缀无关收敛。如图6所示,Leaf 1装备到Spine装备所有EBGP邻人都失效时,Leaf 1会向所有TOR通告去往Spine的 AS不可达。TOR吸收到此新闻,查找预先分派好的对应的ID索引(依据Spine的AS号及Leaf的Router-ID分派),通告转揭晓举行下一跳切换,从而实现营业的快速收敛,其收敛速率不再受限于路由条目数。(某大型互联网公司实测12K路由,收敛时间0.7秒)

97国际·(中国区)集团官方网站
▲ 图6:BGP前缀无关收敛


3、不中止营业能力-BGP NSR

数据中心的Leaf/Spine装备对可靠性要求较量高,大大都设置了双管理板;关于TOR装备,在堆叠组网场景下,也实现了类似双管理板的效果。主备管理板在爆发切换时,由于状态信息的纷歧致很容易引起协议震荡。

NSR(None-Stop-Routing,不中止路由),是为了实现交流机管理板主备切换时,在协议的重新启动历程中路由不中止而设计的。使能NSR功效后,会翻开TCP nss(none-stop-service)服务,最先备份相关邻人以及路由信息到从板。在管理板主备切换历程中,NSR 功效使网络拓扑坚持稳固,维持邻人状态和转揭晓,包管要害营业不中止。

4、不中止营业能力-BGP平滑退出和延迟宣布

BGP平滑退出:在CLOS数据中心网络中,在对装备举行隔离升级等类似操作时,使用BGP平滑退出功效可以确保营业一直流或者很少断流。
着实现办法是:

  • 首先向邻人装备通告优先级低的路由(local-preference 值为0 或med 值为4294967295),并且会携带着名的gshut community,从而使邻人装备举行路由更新,使其流量预先切换到备份链路或其他等价链路上。
  • 接着再延迟一准时间,确保路由学习完成之后,断开与邻人装备间的BGP 毗连。

BGP延迟宣布:在装备重启时,可能会保存路由表还未下发到外地的硬件表项,却将路由信息通告给邻人,从而提前引流导致流量转发异常的情形。为阻止此问题,可以设置BGP在整机重启时把宣布的路由调解为低优先级
该能力建议在装备中预设置,以97国际RGOS为例,需设置:

97国际·(中国区)集团官方网站

写在最后

妄想、建设和运营好数据中心BGP网络,是一件很是禁止易的事情,这需要大宗的实践履历积累。所幸的是BGP在IDC的应用已经日趋成熟,大型互联网公司、运营商有很是多实践案例可以参考。97国际网络也有幸加入其中,为腾讯、阿里巴巴、字节跳动等客户交付了多个大型BGP数据中心网络。

关于BGP性能优化以及更多BGP运维特征,敬请期待手艺盛宴后续分享。

 

相关推荐:

相关标签:

97国际·(中国区)集团官方网站 97国际·(中国区)集团官方网站

点赞

更多手艺博文

任何需要,请联系97国际

97国际·(中国区)集团官方网站

返回顶部

收起
97国际·(中国区)集团官方网站 文档AI助手
97国际·(中国区)集团官方网站 文档评价
资料内容是否对您有资助?
您对目今页面的知足度怎样?
不咋滴
很是好
您知足的缘故原由是(多�。�?
您对文档是否尚有其它的问题或建议?
为尽快解决问题,请您留下联系方法以便回复
邮箱
手机号
谢谢您的反�。�
97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站
97国际·(中国区)集团官方网站
请选择服务项目
关闭咨询页
售前咨询 售前咨询
售前咨询
售后服务 售后服务
售后服务
意见反响 意见反响
意见反响
更多联系方法
网站地图