不少企业在选择运维托管服务商时,盯着SLA条款里那个99.9%还是99.99%的数字反复谈判,却很少有人去追问这个可用率到底怎么算出来的。同样是99.9%,计算口径不同,实际服务质量可能天差地别。
标尺一:可用率的计算分母是什么
最常见的算法是:可用率=(总时间-不可用时间)/总时间×100%。但这里面的猫腻在于"不可用时间"怎么认定。有些服务商只把服务器完全宕机的时间算作不可用,应用层卡顿、响应超时这些状态都不算。结果就是用户体验已经很差了,SLA指标还漂亮得很。
更合理的计算方式是以业务可用性为准:当核心接口的响应时间超过约定阈值(比如2秒)或错误率超过约定比例(比如1%)时,就算不可用。这需要双方约定监控方式、采样频率和判定规则,写在合同附件里。
标尺二:计划内维护算不算停机
大部分SLA条款会把计划内维护排除在不可用时间之外,这本身合理。但有的服务商利用这个口子,每月安排十几个小时的"计划维护窗口",实际影响了业务却不算违约。建议在合同里约定:计划维护必须提前72小时通知,每月计划维护总时长不超过X小时,超出部分计入不可用时间。如果业务有明确的服务时段(比如早八点到晚十二点),可以约定非服务时段的维护不影响SLA。
标尺三:达不到SLA怎么赔
赔偿条款是SLA的牙齿,没有赔偿的SLA就是一张废纸。常见的赔偿方式是按月费的百分比返还:达不到月度SLA扣减10%月费,连续两个月达不到扣减20%,连续三个月达不到客户可解约。关键是要有明确的索赔流程:谁发起索赔、多长时间内响应、赔偿金额怎么计算、以什么形式返还(抵扣下月费用还是现金退款)。
除了经济赔偿,还应该约定故障告知义务:故障发生后多少分钟内通知客户、每隔多久同步进展、故障结束后多长时间内提供书面报告。这些细节决定了故障发生时客户的体验和知情权。
SLA不是签完就束之高阁的文件。建议每季度做一次SLA执行情况回顾,核对实际可用率、故障响应时间、赔偿执行情况,和服务商一起复盘改进。合同写得好不如执行盯得紧,运维质量是谈出来也是管出来的。把这三把标尺拿去衡量你现有的或者正在谈的运维托管合同,该补的条款趁早补上。