第一步是获取服务商提供的SLA原件与技术规格(带宽、抖动、丢包、可用率、维修时间MTTR、响应时间、维护窗口、罚金/信用)。小分段:a) 要求明确计量口径(例如丢包是15分钟平均还是1小时);b) 收集支持与升级流程、联系人与时区;c) 索要网路工程或BGP路由、是否声明CN2路径或MPLS专线证明。
列出与业务相关的度量项并设定目标值。小分段:a) 延迟(RTT/单向),目标依据业务:VoIP<30ms/单向,应用<100ms/往返;b) 抖动:<10ms(语音/视频更严格);c) 丢包:企业链路建议<0.1%;d) 可用率:至少99.95%(每年停机<4.38小时)。
决定监测节点(总部、分支、云主机、对端中国节点)以及周期。小分段:a) 在每个站点部署检测代理(vps或服务器);b) 对外目标包括对端应用服务器与运营商出口;c) 准备公网与内网双通道以区分本地问题。
推荐工具:ping、mtr、iperf3、TWAMP/OWAMP、SNMP采集、NetFlow、BGP looking glass。小分段:常用命令示例:ping -c 100 -i 0.2 目标IP;mtr -r -c 100 目标IP;iperf3 -c server_ip -t 60 -P 10;TWAMP用于单向延迟需双方支持;SNMP监控ifInErrors/ifOutErrors。
要求运营商提供路由/AS信息并用traceroute验证。小分段:a) 执行traceroute -n 与mtr查看中间跳数与主机名,寻找含“cn2”、“ctc”或China Telecom相关标识;b) 使用BGP looking glass或whois查看对端AS路径;c) 若不确定,请运营商给出MPLS LSP或标签信息作为证据。
制定连续测试周期(建议至少30天采样)。小分段:a) 延迟/丢包:每5分钟一次ping或mtr,记录原始数据;b) 吞吐:每日高峰/非高峰各做iperf3并记录平均/峰值;c) 单向延迟:安排TWAMP测试并同步NTP,收集OWD数据。
如何把原始数据转成SLA评价指标。小分段:a) 丢包率=丢包次数/总包数;b) 可用率% = (总运行时间-总故障时间)/总运行时间×100;c) MTTR统计每次故障从报修到恢复的平均时间;d) 用图表展示日/小时分布,找出周期性问题。
当测试结果未达SLA,按合同流程处理。小分段:a) 保存原始日志(ping、mtr、iperf、TWAMP)并加时间戳;b) 向运营商提交故障单并要求故障根因分析(RCA);c) 若符合条款,按SLA索取服务信用或赔偿并在合同中约定证据格式与时限。
把KPI按对业务影响加权评分,形成供应商优劣排名。小分段:a) 为语音、ERP、备援等分别设权重;b) 用30天数据计算各项得分并汇总;c) 考虑支持响应、扩容能力与费用后做决定。
通过长期监控和周期复审优化SLA条款。小分段:a) 建议引入第三方持续监测服务或自建Dashboard;b) 在续约时把历史数据作为谈判筹码,要求更明确的证据与更高可用率;c) 增设惩罚/奖励机制,明确维护窗口与变更通知。
问:如何在不干扰现网业务的情况下部署测试工具?
答:选择小带宽占用的测试参数(iperf3 -b 限速)、在非高峰时段执行吞吐测试、将探针放在独立管理VLAN或云主机,并使用低频率的延迟/丢包监测(每5分钟一次)以免影响生产流量。
问:怎样判断运营商给出的“CN2”是真实还是营销用语?
答:要求对方提供路由/AS信息、MPLS LSP或端到端测试结果;同时用traceroute/mtr查看中间跳名称并使用BGP looking glass验证AS路径,若存在“cn2”标识或China Telecom相关AS并与运营商提供信息一致,即可确认。
问:如果长期不达SLA,企业应如何处理?
答:先保存证据并按合同走索赔与RCA流程;若问题持续影响业务,可考虑换供应商或要求更高赔付/优先支持,必要时在合同中加入服务级别保证与更短的退出/降级条款。