公司动态 · 发布时间:
带宽快到上限时,单纯增加应用服务器通常解决不了网络链路拥塞。防护带宽不足时的业务限流与黑洞预案,重点是先保住关键业务,再明确什么情况下舍弃受攻击或无法承载的流量。限流可以减少部分请求,黑洞则会丢弃指定目标的网络流量,影响范围和代价不同。
步骤一:先判断瓶颈在哪里
查看云平台或网络服务商控制台中的入站、出站带宽曲线,并对照丢包、连接失败和业务响应情况。若链路已接近套餐或端口容量,应用层限流未必能挽回已被占满的入口带宽;若带宽尚有余量、但应用处理能力先到顶,按接口或用户限流往往更合适。记录正常时段与高峰时段,别只凭一次告警下结论。
步骤二:划定必须保留的业务
列出服务清单,标明登录、支付、管理入口、静态内容等功能的优先级,并确认它们是否共用同一公网地址或链路。为每项写清可接受的降级方式,例如暂停非必要报表、延后批量任务,或只对高成本操作增加频率限制。不要把关键管理入口和普通访问混为一类;若共用资源,限流规则可能同时影响两者。
步骤三:先做可回滚的限流
限流是按请求速率、并发数或资源消耗控制流量,通常适合入口尚未完全拥塞、且能识别请求类别的情况。阈值需结合正常峰值、单个请求成本和业务容量设置,不存在适用于所有系统的固定数值。新手可先在低风险接口启用较宽松规则,观察拒绝请求比例与成功率,再逐步收紧。
- 选择限流位置:优先使用服务商提供的边缘防护或负载均衡能力;应用内限流只能处理已到达应用的请求。
- 限定对象:按接口、账号、来源或请求类型设置规则,避免仅凭单一特征封禁整片正常用户。
- 明确动作:优先返回可恢复的拒绝或降级结果;记录规则命中量,不记录不必要的敏感数据。
- 准备回滚:保存原配置,指定负责人和撤销条件;变更后核对关键功能是否仍可用。
步骤四:把黑洞写成明确的升级选项
黑洞路由(常称 null route)会让指定目标的流量被上游丢弃,可用于流量已压垮链路、常规限流无法止损的极端情况。代价是该目标的正常访问也可能中断。防护带宽不足时的业务限流与黑洞预案,应提前确认服务商是否支持人工或自动触发、作用范围、申请渠道、预计生效与解除流程,以及是否有流量清洗等替代方案。不同服务商的能力和条件可能不同,应以合同和技术支持答复为准。
步骤五:演练告警、决策和恢复
- 写明触发依据:结合持续时间、链路占用、丢包和业务可用性设定告警,不以瞬时尖峰直接触发黑洞。
- 指定决策人:区分谁能收紧限流、谁有权申请黑洞,并准备服务商工单或电话渠道。
- 演练回退:在不影响生产的条件下检查配置回滚、告警通知和联系人是否有效;不要为了演练在公网制造真实拥塞。
- 事件后复盘:确认误伤范围、关键服务恢复情况和规则效果,再调整阈值及升级顺序。
判断顺序可以概括为:先做精确限流和业务降级,再联系上游评估清洗或扩容;只有链路仍无法承载且中断目标可接受时,才考虑黑洞。防护带宽不足时的业务限流与黑洞预案不是一条自动封禁规则,而是有授权、范围、回滚和恢复安排的决策流程。

常见问题
限流和黑洞有什么区别?
限流尝试保留部分合规流量,黑洞则可能让目标地址的正常流量也无法到达。链路未完全拥塞且规则可区分请求时,先评估限流。
黑洞后用户还能访问服务吗?
若被丢弃的目标承载该服务,通常无法正常访问;具体影响取决于黑洞范围和网络路径。
新手应先联系谁?
先联系云平台或网络服务商,核实带宽容量、可用防护方式、黑洞触发条件及解除流程,再按内部授权执行。

