1.
概述与准备工作
目标:建立对
韩国CN2链路的可观测性与自动告警;小分段:确认链路类型(MPLS/BGP)、获取对端IP与ASN;准备工具:Prometheus、Grafana、Alertmanager、iperf3、mtr、traceroute、snmpwalk。
2.
基础链路探测(主动)
步骤:1) 使用TCP traceroute探测到韩国出口:traceroute -T -p 80 <目标IP>;2) 用mtr持续观测带宽/丢包:mtr -T -P 80 -c 100 <目标IP>;3) 记录基线:在不同时段(工作日高峰/非高峰)各跑10次并保存结果。
3.
吞吐与抖动测试
步骤:1) 在两端部署iperf3:服务器端 iperf3 -s;客户端 iperf3 -c
-t 60 -P 10;2) 变更参数测试MSS/窗口:--set-mss、-w ;3) 记录带宽、抖动与重传率,作为优化目标。
4.
SNMP与设备指标采集
步骤:1) 在路由器上启用SNMPv3并配置只读用户(保持安全);2) Prometheus使用snmp_exporter,配置targets为对端CE、PE;3) 核查接口ifInOctets/ifOutOctets、ifInErrors、ifOutErrors、ifSpeed。
5.
BGP与路由性监控
步骤:1) 使用BGP监控(Bird/Quagga/ExaBGP或BGP Exporter)抓取邻居状态、Prefix数;2) 建Alert规则:邻居DOWN立即告警;3) 启用BFD检测快速失联,配置本地和对端一致的BFD定时。
6.
Prometheus与Grafana可视化搭建
步骤:1) 部署Prometheus并加入node_exporter/snmp_exporter/bgp_exporter targets;2) 写PromQL基线:rate(ifInOctets[5m]);3) 在Grafana建面板:延迟(mtr RTT)、丢包率、带宽利用率、BGP状态。
7.
告警设计与阈值设定
步骤:1) 定义SLA门限:丢包>1%(5m平均)或延迟>120ms触发Warn,>200ms触发Critical;2) Prometheus Alertmanager配置路由与抑制;3) 为突发波动加入持续窗口(for: 5m)避免抖动告警。
8.
示例告警规则(参考)
小分段:alert: CN2_High_Latency expr: avg_over_time(mtr_rtt_ms{dest="kr"}[5m]) > 120 for: 5m labels: severity: warning;说明:将metric替换为实际mtr导出名称,调整for以去噪。
9.
性能调优实操步骤
步骤:1) MTU与MSS优化:在边缘设备调整MTU使得不发生分片,并在负载均衡器上设置TCP MSS clamping;2) TCP拥塞控制:Linux上测试bbr与cubic:sysctl net.ipv4.tcp_congestion_control=bbr;3) QoS策略:按应用/目的地做队列与优先级,示例tc命令进行限速和prio划分。
10.
排障流程与案例
步骤:1) 出现丢包:先mtr定位是哪一跳开始丢包,若是PE侧联系上游;2) 延迟上升:对比BGP路径是否变更(bgp_exporter)并核查链路利用率;3) 突发抖动:回溯iperf历史,检查是否有流量洪峰或DDoS,必要时临时下发防护ACL。
11.
自动化与告警演练
步骤:1) 将常见脚本(自动重试ping、重启接口脚本)纳入Runbook并用Ansible管理;2) 定期演练:模拟链路波动并检验告警流转、值班响应时间;3) 文档化与SOP:记录每次事件后的RCA并更新阈值。
12.
数据保留与容量规划
步骤:1) 根据指标采集频率(15s/1m)估算Prometheus存储,设置远端存储(Thanos/Influx)归档;2) 保留策略:关键指标长保(6-12月),原始采样压缩或downsample;3) 定期清理老旧告警与告警规则。
13.
问:如何快速判断是CN2链路问题还是本地网络问题?
答:先用mtr/traceroute对比本地出口与中国侧到韩国目标的路径(TCP端口80/443),若丢包或延迟在相同内网跳数内出现为本地问题;若在运营商PE/中间跳点出现且持续,定位为CN2或上游问题,并同时检查BGP变化和接口错误。
14.
问:告警阈值如何设定才能既敏感又不过于噪声?
答:建议基于历史基线设定百分位阈值(如95p延迟),并用短时间窗口(5m)+持续时间(for:5m)组合;对低优先级业务放宽阈值,对SLA关键链路设定更严格阈值并启用抑制规则。
15.
问:在网络性能不佳时有哪些立刻可做的临时缓解措施?
答:临时措施包括:1) 在边缘对关键流量做流量整形/优先级;2) 动态切换到备份出口或备份ISP;3) 与上游运营商打开故障单并提供mtr/traceroute/iperf结果以便快速定位和恢复。
来源:面向运维工程师的韩国cn2网络监控、告警与性能调优指南