谈灾难恢复时,RPO 和 RTO 这两个指标往往被混为一谈,但它们回答的是两个完全不同的问题,也分别牵动着方案中两条不同的成本线。把这两个概念拆清楚,是判断一套备份灾备方案是否合理的前提。
RPO 是恢复点目标,衡量的是数据的损失边界,也就是出事时你最多能接受丢失多久的数据。它直接决定备份频率。如果 RPO 定在 24 小时,一天备份一次即可,投入有限;若要求压缩到几分钟级别,就必须依赖高频备份甚至实时同步,成本随之显著上升。换句话说,RPO 管的是"丢多少",频率越高、容忍丢失越少,花的钱就越多。
RTO 是恢复时间目标,衡量的是业务的中断边界,即系统发生故障后必须在多长时间内恢复服务。它决定的是恢复架构的复杂度。内部办公类系统停机几小时影响不大,RTO 可以放宽,定时备份加冷备就足够;而交易类系统往往要求在极短时间内恢复,这就只能依靠双活、多活等高可用架构支撑。RTO 管的是"停多久",要求越苛刻,架构投入越重。
两个目标如何共同塑造预算
值得强调的是,RPO 和 RTO 相互独立,需要分别核定,不能用一个指标替代另一个。一个系统完全可能对数据损失极度敏感,却对短时中断有一定容忍,反之亦然。只有同时明确这两条线,才能避免为次要系统过度配置,或为核心系统留下隐患。
在实际评估中,这两个目标还要结合数据规模和业务中断的实际损失来落地。同样的 RPO 要求下,数据量越大,备份与存储开销越高;而 RTO 是否值得压缩,取决于系统停摆一小时究竟会造成多大代价。先把这笔账算清楚,再去设定目标,预算才有依据。
需要清醒认识的是,无论指标定得多高,任何方案都无法承诺零丢失或零中断。RPO 和 RTO 的真正价值,是把数据损失和中断时间约束在业务可承受的范围内。定义清楚这两个边界,灾备方案的方向、投入和取舍也就随之明朗。