- 故障现象:令人困惑的“时好时坏”
网络运维人员收到用户反馈:访问核心业务时断时续,ping包延迟忽高忽低且伴有大量丢包。检查核心设备(如PE路由器),其物理端口指示灯正常常亮,但网络性能却极不稳定,呈现一种“似通非通”的诡异状态。 - 拓扑背景:看似高可用的设计
两台核心PE路由器之间通过链路聚合(如LACP) 技术将两条物理链路捆绑为一个逻辑通道(如Port-channel/EtherChannel)。
设计初衷:提高带宽、实现负载均衡和冗余备份。
预期效果:当一条物理链路故障宕机(Down)时,流量会自动、无缝地切换到另一条链路,用户无感知。 - 根因分析:最棘手的“亚健康”状态
问题并非发生在链路完全宕机时,而是出现在一种“亚健康” 状态。如下图所示,这种状态通常有两种致命场景:
导致这种“亚健康”状态的具体原因包括:
物理层问题:光模块故障、光纤弯曲半径过小、端口硬件故障、单纤中断等,导致链路光衰过大或误码率极高。物理层可能保持Up,但数据链路层协议(LACP)无法正常维持。
配置错误:两端聚合模式(如ON vs. Active)、速率、双工模式、VLAN允许列表不一致。
协议超时:LACP报文因网络拥塞或设备CPU过高而丢失,导致对端认为邻居失效。 - 影响与症状:为何负载均衡成为“帮凶”
负载均衡机制的缺陷:聚合链路默认采用基于流的负载均衡(如基于源IP、目的IP哈希)。计算引擎通常只检查物理端口的Up/Down状态,而无法有效感知其协议状态或链路质量。
流量黑洞:如图所示,当一条链路处于“亚健康”状态时,设备依然会根据哈希算法将一部分流量转发到该故障链路上,而这部分流量实际上无法通过,从而造成部分用户、部分业务随机性中断,故障现象难以捉摸。 - 排查与解决:四步定位法
6.第一步:查看聚合状态
Cisco设备
show etherchannel summary# 查看聚合组中所有端口的标志位,健康状态应为 ‘P’ (Port-channel) 或 ‘SU’(Stand-up)。# 若发

中单条链路故障引发的网络震荡&spm=1001.2101.3001.5002&articleId=150931130&d=1&t=3&u=7082b4193daa4533a038216689c32d1b)
80

被折叠的 条评论
为什么被折叠?



