GGSLB全局负载均衡策略详解

📅 2026/8/4 15:22:00
GGSLB全局负载均衡策略详解
GSLB全局负载均衡核心策略全景指南在实际部署中GSLB策略通常不是单一使用的而是分层组合例如先过滤不健康的再根据区域圈定范围最后用RTT或权重进行精细调度。以下是完整的策略体系按“筛选过滤 → 静态调度 → 动态调度 → 高级粘性”四个层次划分。第一层健康与可用性过滤前置“红线”策略此类策略不直接参与“选优”而是用于剔除“不合格”的节点是其他所有策略执行的前提。策略名称核心说明业务举例1.第四/七层健康检查对VIP或RS进行TCP/UDP四层和HTTP/HTTPS七层探测。探测失败的站点直接移出候选池。场景某电商大促前后端数据库连接数过高导致七层返回502。GSLB七层健康检查探测到/health.html失败自动将该机房IP从DNS应答中剔除用户流量不再导入故障节点。2.会话能力阈值通过私有协议同步各地负载均衡设备的当前会话数/最大会话数。当比值超过阈值如80%时该站点不再被选择。场景某游戏机房会话数已达最大值的90%即将过载。GSLB探测到后临时将其“摘除”新用户被调度到其他空闲机房,有效避免服务器崩溃。3.活动服务器数量指一个VIP背后真正在线的“真实服务器RS”数量。优先选择活动服务器最多的站点。场景北京机房因运维停机缩容只剩2台RS上海机房正常有10台RS。GSLB优先将流量导向上海确保新用户能获得更充沛的计算资源。4.当前可用会话数直接比较各站点当前剩余的可用会话连接数选择剩余容量最大的站点。场景IDC-A当前剩余会话数还有5万IDC-B只剩5千。调度器会将新来的用户DNS解析指向DC-A实现细水长流的负载分摊。第二层静态与预定义调度策略基于“已知信息”的分配此类策略基于IP库、权重、预设优先级等固定数据进行决策计算开销小速度快。策略名称核心说明业务举例5.地理区域/用户自定义区域根据用户LDNS的IP所属IP地址段将特定区域如华东、华北的用户指向指定站点。注意DNS弱点——只能看到LDNS IP用户配错DNS会导致调度不准。场景华东用户解析域名LDNS为上海电信IP。GSLB匹配IP段后直接返回上海机房的VIP。反面案例某教育网学生手动将电脑DNS改为北京联通DNSGSLB误以为是联通用户将其调度到了联通机房导致跨网访问卡顿。6. IP地址权重为DNS应答中返回的每个具体IP地址设置不同的权重如IP-A权重70IP-B权重30权重决定流量比例。场景北京机房有两台物理机IP-A性能强悍权重80IP-B性能较弱权重20。GSLB解析时有80%的请求返回IP-A20%返回IP-B实现异构硬件下的合理利用。7.站点Site权重针对整个数据中心设置权重决定与其他站点相比该站点承担的总流量比例。场景杭州新建了双路机房带宽成本低希望多承担流量权重50成都老旧机房带宽贵权重20。GSLB确保每10个新用户中约5个去杭州2个去成都。8.站点管理优先级/故障转移顺序为站点预设主备顺序如P1P2P3。只要P1健康流量全部去P1P1挂了才去P2。场景某金融核心业务严格要求“同城双活”。主数据中心P1承载100%流量同城备份中心P2平时不接收流量。只有当GSLB检测到P1整体机房掉电时才将所有流量瞬时切换到P2。9.基于拓扑的策略不仅看地理区域更结合AS自治域号或运营商内部层级如城域网、骨干网来选择路径最短的站点。场景用户LDNS属于中国电信AS4134。GSLB对比发现Site-A与LDNS同属一个城域网跳数最少Site-B虽地理近但需跨骨干网。拓扑策略优先选择Site-A极大降低延迟。10.基于成本根据机房的带宽单价、电力成本或租用成本进行调度优先选择“服务成本最低”的健康站点。场景某视频网站夜间流量高峰时海外昂贵带宽的机房成本飙升。GSLB自动将该机房权重降低将更多非实时下载请求调度到国内低价带宽机房日省数万元。第三层动态性能与负载感知策略基于“实时测量”的智能选择此类策略依赖于实时探测或实时负载数据能自适应网络波动和服务器压力变化。策略名称核心说明业务举例11.往返时间RTT主动模式LDNS请求时GSLB通知各站点主动Ping/DNS Query该LDNS选RTT最小的站点。被动模式采集用户真实建立TCP连接时SYN-ACK的时间差无需额外流量更精准。同样存在DNS配置错误的弱点场景广州用户解析域名。主动RTT测得深圳机房响应5ms上海机房响应30msGSLB将用户导向深圳。被动RTT进阶上海机房因网络偶发拥塞虽然Ping值正常但TCP握手ACK延迟突增至100ms被动RTT检测到后立即降低其命中率,用户自动流向延迟更低的北京机房。12.基于流量吞吐量监测站点当前的出/入口带宽利用率。当某站点带宽利用率超过设定阈值如90%时不再向其分配新用户。场景某下载站成都机房出口带宽已跑满95%。GSLB监测到后后续用户的DNS解析将跳过成都机房优先分配到带宽空闲的武汉机房防止成都机房网络瘫痪。13.基于新建连接速率监测站点每秒处理的新建TCP/UDP连接数CPS。当CPS超过阈值时该站点暂停接收新用户。场景秒杀活动开始时杭州机房CPS瞬间飙升至10万/秒阈值设定8万。GSLB自动将杭州标记为“繁忙”后续秒杀用户被调度到南京机房确保杭州机房已建立的会话不受影响且不崩溃。第四层高级分发算法与会话粘性策略解决“选谁”和“怎么选”的问题此类策略决定了在候选节点中具体如何选取唯一的那一个并保证用户后续请求的连续性。策略名称核心说明业务举例14.轮询按顺序循环选择健康节点。简单公平不考虑任何性能差异。场景测试环境或内部管理后台所有机房配置完全一致按A-B-C-A的顺序轮流分配流量。15.最少选择调度器内部维护一个计数器每次选择历史上被选中次数最少的节点。场景业务刚上线3个新机房初始计数均为0。第一个用户去A第二个用户发现A计数为1B和C为0于是选B以此类推实现绝对均衡避免轮询的固定顺序弊端。16.随机选择从所有健康站点中随机抽取一个返回。场景对延迟不敏感的非关键日志上报接口使用随机策略简单粗暴地打散流量降低调度器计算开销。17.一致性哈希根据客户端IP或LDNS IP进行哈希计算确保同一用户每次解析都指向同一站点。若支持ECSEDNS Client Subnet可使用真实用户IP。场景用户将商品加入购物车会话存储在Site-A的Redis中。此时网络波动如果改用轮询可能会把用户解析到Site-B导致购物车丢失。采用一致性哈希只要Site-A健康该用户永远去Site-A完美保持会话。18.站点Cookie持久性GSLB在首次DNS解析时通过HTTP重定向或Set-Cookie在用户浏览器中植入站点标识。后续请求根据Cookie直接解析到对应站点。场景用户首次访问官网被分配到北京机房浏览器Cookie写入sitebeijing。5分钟后用户再次刷新GSLB读取Cookie即使北京机房当前负载稍高仍将其解析回北京确保用户本地缓存的登录票据有效。总结实际生产中的策略组合拳在真实世界中GSLB策略通常是层层递进的例如一个典型的视频流媒体调度流程如下1.健康检查过滤掉宕机的边缘节点2.会话能力阈值剔除快满载的节点3.基于成本排雷掉昂贵的海外劣质节点4.地理区域锁定用户所在省份的节点池5.被动RTT精确测量出其中网络延迟最低的节点6.一致性哈希确保同一用户在不同网络环境下尽量保持在同一节点以防中断播放。