SD-WAN 是如何解决网络卡顿和掉线问题的?

分支门店开视频会议卡成 PPT、ERP 输单一直转圈、远程桌面隔几分钟掉一次线——这是多分支网络最常见的两类投诉。传统组网下运维能做的往往是“重启试试”或者“再加带宽”,但根因通常不在带宽不够,而在链路质量和切换机制。SD-WAN 的价值就在这里:它不动业务系统,只在传输层把选路、纠错、切换这三件事做对。

先分清:卡顿和掉线是两种病

两者根因不同,解法也不同。混在一起排查,最常见的结局是加了一年带宽,问题照旧。

  • 卡顿:链路没断,但延迟高、抖动大、有丢包。表现是应用慢、音画不同步、输入有延迟感。根因多为出口拥塞、跨运营商互联质量差、跨境链路绕路,或者内网有大流量抢占。
  • 掉线:会话真的中断,需要重连。表现是远程桌面断开、VPN 重拨、收银终端离线。根因多为单链路故障、PPPoE 重拨、线路瞬断、NAT 会话表老化。

卡顿怎么解:把“能通”变成“走得对”

按应用选路,而不是按目的地选路

传统路由器看目标 IP 查路由表,SD-WAN 先识别应用,再按策略挑链路。视频会议、VoIP 这类实时流量走低延迟链路,文件同步、备份这类大流量走低成本宽带,ERP 等关键业务走专线或者质量最好的那条。结果是同一条宽带上,关键业务不再被后台下载挤掉。

FEC 前向纠错:用带宽换确定性

丢包是卡顿的主因,而 TCP 重传一个包至少要等一个 RTT,实时业务等不起。FEC 的做法是发送端多发冗余包,接收端丢了几个包能直接算回来,不走重传。对音视频和实时交互效果最明显。代价是多占一部分上行带宽,不同方案的实现差异较大,建议用真实流量实测后再定冗余档位,别直接按厂商标称值规划容量。

关键小包双发,先到先用

对 SSH、远程桌面、交易报文、信令这类小包敏感的业务,可以把同一个包在两条链路上同时发一份,谁先到用谁,重复的直接丢弃,抖动被显著削平。代价是双份带宽,所以只针对关键小流开启,不做全局启用。

QoS 与带宽预留

在边缘 CPE 上做队列调度和流量整形:给关键业务留保底带宽,给非关键业务设上限。避免“一个门店夜间备份把第二天早上的收银全拖垮”这种典型事故。

掉线怎么解:让切换赶在用户察觉之前

多链路捆绑:一条断不等于网络断

SD-WAN 边缘设备可以同时接入宽带、专线、4G/5G,把多条物理链路聚合成一条逻辑隧道。任意一条中断,流量自动落到剩余链路。5G 在这里特别划算:主用低成本宽带,5G 只做备份链路,平时不走流量,主链路故障或质量劣化时才启用,成本远低于再拉一条专线做冗余。

亚秒级探测与会话保持

传统方案靠路由协议收敛,动辄几秒到几十秒,TCP 会话早就超时断掉了。SD-WAN 在 overlay 层做毫秒级质量探测,检测到劣化立刻切换。更关键的是会话保持:overlay 隧道给业务分配的是虚拟地址,切换底层链路不改变业务的五元组,TCP 会话不断。用户侧的感知是“顿了一下”,而不是“掉线重连”。

对抗 NAT 老化与线路瞬断

链路瞬断重连后 NAT 会话表会重建,长连接业务表现为假死。SD-WAN 通过隧道保活机制绕开底层 NAT 超时;同时切换判据用的是质量阈值而不是“彻底断”——延迟和丢包恶化到阈值就切,把“重连”提前消灭在“劣化”阶段。

还有一层:看得见,才修得快

集中管理平台持续记录每条链路的延迟、抖动、丢包、利用率和切换事件。排查时可以直接回答“昨天下午两点门店卡,是因为那条宽带丢包率上去了,还是备份链路没起来”,而不是凭经验猜。对只有两三个人的运维团队,这一项往往比功能本身更省时间。

SD-WAN 救不了的情况

边界提前说清楚,免得期望落空:

  • 所有链路同时拥塞或同时中断(同一运营商出口故障、机房断电)。SD-WAN 只能在可用的链路里挑最好的,变不出链路。
  • 内网侧问题:交换机环路、ARP 风暴、终端中毒、WiFi 信号差。SD-WAN 管的是广域网这一段,局域网自身的毛病它不解决。
  • 应用自身缺陷:服务端性能瓶颈、数据库慢查询、前端设计不合理。换什么网络都卡。
  • 总带宽真的不够。智能选路和 FEC 能优化分配,但不能凭空变出带宽,该扩容还是得扩容。

落地建议

先采一周链路质量基线,再定策略。多数场景下,用现有宽带加一条低成本 5G 备份,配合应用级选路和 FEC,就能覆盖大部分卡顿与掉线问题;专线只在确实有 SLA 硬要求的站点上叠加。别一上来就全站专线,那笔钱通常花得不值。