备份、快照与归档

共 20 题
📑 题目列表 20 题
#
★★★

1. 3-2-1 备份原则的落地中本地副本、异地副本与离线介质如何组合以及如何与 RPO/RTO 目标对齐

请说明 3-2-1 备份原则如何落地,如何与 RPO/RTO 目标对齐?

  • 3-2-1:3 份数据、2 种介质、1 份异地
  • 本地副本、异地副本与离线介质的组合
  • 与 RPO/RTO 目标的映射

3-2-1 原则要求至少 3 份数据副本、存储于 2 种不同介质、其中 1 份在异地。落地:本地保留一份在线副本(如本地磁盘/快照),用于快速恢复降低 RTO;异地维护一份副本(如异地机房或对象存储跨区复制),抵御单点故障;再保留一份离线介质(磁带/离线硬盘/不可变归档),抵御勒索软件与同机房灾难。RPO 由备份频率决定(如每小时增量),RTO 由恢复路径的可用性决定(本地副本就近恢复最快)。异地副本用于灾难事件,离线介质用于最坏情况。组合需与业务对不同数据分级确定的 RPO/RTO 对齐:核心数据异地+离线,高频备份;低价值数据可降低频率。

3-2-1 是"冗余+介质多样性+地理隔离"的落地,核心是把 RPO/RTO 目标转化为差异化备份策略。

#
★★★

2. air-gapped backup 如何实现离线备份?

请说明 air-gapped(离线)备份如何实现,及其在防勒索场景中的作用?

  • air-gapped 指备份与生产网络物理隔离
  • 离线介质、网络隔离、按需联机
  • 防勒索软件蔓延的关键

air-gapped backup 指备份副本在物理或逻辑上与生产网络隔离,攻击者无法通过网络触达。实现方式:1) 使用物理隔离的离线介质(磁带、离线硬盘、写完即拔出的可移动介质);2) 备份存储使用独立网络段/防火墙白名单,仅备份任务期间短暂开放;3) 使用不可变存储(WORM)与对象存储版本控制,防止恶意覆盖;4) 定期"离线-联机-一次备份-再离线"的批次循环。它在勒索软件场景价值关键:即使生产与在线备份被加密,离线副本仍完好,可重建。代价是恢复窗口长、需人工参与,故多用于核心数据兜底。

air-gapped 的本质是破坏"攻防网络可达性",是对抗勒索软件加密在线副本的最有效手段,但需与快速恢复的本地副本互补。

#
★★★

3. rsync --exclude 如何实现排除?

请说明 rsync 的 --exclude 如何实现文件排除,及常见用法?

  • --exclude 与 --exclude-from 的使用
  • 排除模式与目录递归排除
  • 与 --delete 配合时的注意

rsync --exclude 'pattern' 在传输时排除匹配的文件/目录,--exclude-from=file 从文件读取多个排除模式。模式支持通配符(如 *.log/cache/),目录排除用尾部 /--include 可配合 --exclude 实现"先排除全部再包含特定",如 --exclude='*' --include='*.conf'。注意 --delete 会删除对端多余的排除项,若排除的目录在源端不存在,--delete 不会删除对端已有的该目录(需 --delete-excluded)。合理使用排除可减少传输量与时间。

rsync 排除是备份/同步的关键,理解模式匹配语义与 --delete 的交互,避免误删或漏传。

rsync -av --exclude '*.log' --exclude '/cache/' /src/ /dst/
rsync -av --exclude-from=exclude.list --delete /src/ /dst/
#
★★★

4. 备份监控与告警中任务失败、时长超窗与恢复验证失败的告警设计以及 RPO 达标的跟踪方式

请设计备份监控与告警体系,覆盖任务失败、时长超窗与恢复验证失败,并跟踪 RPO 达标?

  • 任务失败告警(退出码、日志)
  • 时长超窗告警(调度窗口)
  • 恢复验证失败告警与 RPO 跟踪

备份监控需覆盖:1) 任务失败:监控备份进程退出码与日志,失败即告警,并区分重试与永久失败;2) 时长超窗:为每个备份任务设定预计时长阈值,超过即告警(可能因数据量增长或性能下降);3) 恢复验证失败:定期做校验/恢复演练,验证失败必须高优先级告警(备份"看得见、恢复不了"最危险);4) RPO 达标跟踪:记录最后一次成功备份时间,计算"当前时间 - 最后成功时间"作为实际 RPO,超过目标 RPO 即告警,并纳入周报/月报趋势。告警应分级(P1/P2/P3)并关联恢复演练工单。

备份监控的核心是"恢复能力"而非"备份动作",不仅要盯任务成功,还要盯实际 RPO 与可恢复性,避免"看似备份了其实恢复不了"。

#
★★★

5. 勒索软件场景的备份防护中不可变存储、离线副本与隔离恢复环境如何组合降低加密风险

勒索软件场景下,备份如何通过不可变存储、离线副本与隔离恢复环境组合降低加密风险?

  • 不可变存储(WORM/对象存储版本控制)防篡改
  • 离线副本物理隔离
  • 隔离恢复环境(IR/DR)验证干净恢复

针对勒索软件,备份防护需多层组合:1) 不可变存储:使用 WORM 对象存储、对象存储版本控制或备份软件的原生不可变能力,使备份副本在保留期内不可修改/删除,防止攻击者加密或清理备份;2) 离线副本:air-gapped 磁带/离线介质,物理隔离最彻底;3) 隔离恢复环境(隔离的 DR/恢复环境):恢复演练在隔离网络进行,先验证备份未感染、系统干净再接入生产,避免"恢复回被感染的备份"。同时缩短 RPO、提升备份频率以降低损失窗口,并定期测试恢复验证备份完整性。

单靠在线备份无法防勒索,需"不可变(防篡改)+ 离线(防可达)+ 隔离恢复(防误恢复污染)"三层组合,并定期验证。

#
★★

6. AWS Glacier 如何用于冷数据归档与取回?

请说明 AWS Glacier 如何用于冷数据归档与取回?

  • Glacier 的极低存储成本与高取回延迟
  • 归档/取回(retrieval)模式与 tier
  • 生命周期策略自动归档

AWS Glacier 是低成本冷归档存储,用于访问频率极低的数据。数据通过 S3 生命周期规则(Lifecycle Policy)根据过期时间自动过渡到 Glacier 或 Glacier Deep Archive,也可直接上传到 Glacier。取回有延迟:Standard(3-5 小时)、Expedited(1-5 分钟,需付费)、Bulk(5-12 小时)三种 tier,取回需先发出 job 再下载。Deep Archive 更便宜但取回需 12 小时以上。适合合规归档、备份长期保留、历史数据。取回成本高且慢,需在归档前权衡 RTO/成本。

Glacier 的核心是"极低成本交换取回延迟",用生命周期规则自动分层,为合规保留与长期备份提供低成本方案。

#
★★

7. 去重备份(restic/borg 的块级去重)与压缩对存储成本的影响,以及恢复性能与并发恢复的代价

请说明去重备份(restic/borg 块级去重)与压缩对存储成本的影响,以及恢复性能与并发恢复的代价?

  • 块级去重原理与数据降重
  • 去重与压缩在存储成本上的收益
  • 恢复性能与并发恢复的代价

restic/borg 采用块级去重:将数据切分为固定/可变大小块,对相同块只存一份,并引用+压缩,对增量数据(如数据库每日镜像、备份多版本)储能大幅降低存储成本。但去重带来代价:恢复时需要按块重组并解压,恢复性能低于原始顺序读取;数据块分散存储,并发恢复多个备份时可能争抢同一块存储,导致并发恢复性能下降。因此去重适合存储成本敏感、低频恢复的场景;对需要快速、高并发恢复的关键服务,需评估去重率与恢复性能的平衡。

去重是用"恢复时的计算与重组开销"换取"存储成本降低",要在去重率、恢复性能与并发恢复需求间权衡。

#
★★

8. 商业备份产品(Acronis/Rubrik/Veeam)与开源方案(restic/borg)的选型中异构环境支持、应用一致性、恢复能力与 TCO 对比

请对比商业备份产品(Acronis/Rubrik/Veeam)与开源方案(restic/borg)的选型?

  • 异构环境支持、应用一致性
  • 恢复能力与 TCO
  • 选型决策因素

商业产品(Veeam/Rubrik/Acronis)提供:异构环境(VMware/KVM/云/数据库)深度支持、应用一致性快照(如与数据库协作的 VSS 感知)、集中管理、SLA 报告、恢复演练编排等,功能完善但许可与运维成本高(TCO 高)。开源方案(restic/borg)轻量、免费、块级去重、加密,适合文件与容器数据备份,但应用一致性、广度支持、集中管理与合规报告需自行搭建,运维成本转移到人力。选型:异构复杂、需要应用一致与标准化恢复演练的企业选商业;预算有限、以文件/基础数据为主、有运维能力的团队可选开源。需评估 TCO(许可+人力+运维)而非仅软件价格。

选型核心是"应用一致性与恢复能力需求" vs "TCO",商业卖的是深度集成与编排,开源卖的是灵活与低成本。

#
★★

9. 备份策略设计中全量/增量/差异组合的恢复链长度、保留周期与存储成本如何权衡

请说明全量、增量、差异备份的组合如何影响恢复链长度、保留周期与存储成本?

  • 全量/增量/差异的语义与恢复链
  • 恢复链长度与恢复时间的权衡
  • 保留周期与存储成本

全量备份包含全部数据,恢复最直接但耗时长、存储大;增量备份只含上次备份后的变化,存储小、备份快,但恢复需从全量起逐级回放整条增量链,恢复链越长恢复越慢、风险越高;差异备份含上次全量后的变化,恢复只需全量+最近一次差异,链短但存储介于全量与增量之间。组合策略:定期全量(如每周)+ 差异化频率(如每日差异或每小时增量),用"全量+增量"兼顾存储与备份窗口,用定期全量缩短恢复链。保留周期决定存储成本与可恢复时间点,需在成本与 RPO 间权衡(如保留 30 天增量+12 个月月度全量)。

核心是恢复链长度:增量压缩存储但拉长恢复链,差异/全量缩短恢复链但增加存储。设计需平衡备份窗口、恢复速度与成本。

#
★★

10. 快照一致性层级中崩溃一致、文件系统一致与应用一致快照的区别以及数据库场景为何必须应用一致

请说明崩溃一致、文件系统一致、应用一致快照的区别,以及数据库场景为何必须应用一致?

  • 三个一致性层级
  • 应用一致快照如何协调应用
  • 数据库场景必须应用一致的原因

崩溃一致快照:抓取时无任何协调,可能包含未落盘的半完成写入,数据库恢复时可能不一致甚至损坏。文件系统一致快照:通过 quiesce 文件系统(如 fsfreeze)保证元数据一致,但未处理应用内部缓冲。应用一致快照:在文件系统 quiesce 基础上,协调应用(如数据库 checkpoint/归档日志切换)使应用状态一致,恢复后数据库能正常启动且数据一致。数据库场景必须应用一致,因为数据库有事务缓冲与日志,只有同时 flush 事务并保证日志-数据一致,快照才能作为可用的恢复点,否则恢复后可能数据损坏或需复杂修复。

一致性层级决定快照能否作为可靠恢复点,数据库依赖应用一致快照才能安全恢复,这也是备份软件配合数据库 agent 的原因。

#
★★

11. 备份对生产性能的影响中备份窗口选择、IO 限速与基于快照的读取如何避免拖垮在线业务

请说明备份对生产性能的影响及如何避免拖垮在线业务?

  • 备份窗口选择
  • IO 限速(throttle/带宽限制)
  • 基于快照的读取

备份会占用生产 IO 与带宽,可能拖垮在线业务。缓解措施:1) 备份窗口选择:在业务低峰执行,避免与在线高峰重叠;2) IO 限速:用备份工具的限速选项(如 rsync --bwlimit、restic 的 --limit-upload)或系统级 IO 限速(ionice、cgroup)限制备份对生产 IO 的占用;3) 基于快照的读取:先创建一致性快照,再从快照读取数据进行备份,避免直接读生产文件系统,减少对在线 IO 的干扰;4) 分散备份任务、错峰调度。这样既保证备份完成,又不影响业务性能。

备份性能管理的核心是"错峰+限速+快照读取",在不牺牲备份完整性的前提下尽量降低对生产的影响。

rsync -av --bwlimit=5000 /src/ /dst/   # 限速 5MB/s
ionice -c2 -n7 rsync -av /src/ /dst/   # 低优先级 IO
#
★★

12. 备份传输优化中压缩与去重、带宽限速、断点续传与异地传输窗口的调度设计

请说明备份传输的优化手段:压缩去重、带宽限速、断点续传与异地传输窗口调度?

  • 压缩与去重减少传输量
  • 带宽限速与断点续传
  • 异地传输窗口调度

备份传输优化:1) 压缩与去重:传输前压缩并做块级去重,减少网络带宽与存储占用;2) 带宽限速:设置带宽上限避免抢占生产网络,同时保证备份在窗口内完成;3) 断点续传:工具支持断点续传(如 rsync、restic 的 resume),网络中断后从断点继续,避免整量重传;4) 异地传输窗口调度:将大体积异地传输安排在业务低谷或网络空闲时段,错峰调度,并考虑压缩后再传输。综合这些可降低传输成本、缩短窗口、提高可靠性。

传输优化是"网络成本 vs 窗口"的平衡,压缩去重减量、限速保生产、断点续传保可靠、窗口调度保时效。

#

13. star 与 GNU tar 的格式兼容性中多卷归档、xattr/ACL 与稀疏文件处理差异以及跨工具恢复时如何验证

请说明 star 与 GNU tar 的格式兼容性、多卷归档、xattr/ACL 与稀疏文件处理差异?

  • star 与 tar 的格式扩展差异
  • 多卷归档与稀疏文件处理
  • 跨工具恢复时的验证

star(Schily tar)与 GNU tar 都遵循 POSIX tar 基本格式,但各自有扩展。star 支持 POSIX 扩展(xattr/ACL、稀疏文件、长文件名、多卷归档)更完整;GNU tar 也有相似扩展但实现细节不同。跨工具恢复时:xattr/ACL 可能因扩展头格式不同而丢失,稀疏文件可能被展开为普通文件,多卷归档需按卷恢复。恢复后应验证:文件数、权限/ACL、符号链接、稀疏文件空洞、元数据(xattr)完整性。为兼容,可在创建时指定格式(如 --format=posix)提高互操作性。

兼容性差异集中在扩展头(xattr/ACL/稀疏/长名),跨工具恢复需验证元数据与稀疏文件,必要时显式指定 POSIX 格式。

#

14. 备份加密与异地保存的组合实践中端到端加密、密钥托管与异地副本的容灾距离如何设计

请说明备份加密与异地保存的组合实践:端到端加密、密钥托管与异地容灾距离?

  • 端到端加密(客户端加密)
  • 密钥托管与 KMS
  • 异地副本与容灾距离设计

备份加密实践:1) 端到端加密:在客户端/源端加密后再传输,确保传输与存储全程密文,即使异地或云服务商侧也无法明文读取;2) 密钥托管:密钥独立于备份数据管理(KMS、HSM、密钥分离托管),避免与备份共存导致加密失效;3) 异地与容灾距离:异地副本放在地理上足够远(如 >100km 或跨区域)、避免同区域灾难(地震/机房级故障)覆盖,同时控制取回延迟与成本。组合上:核心数据异地+加密+独立密钥,兼顾安全与容灾。

加密与异地是"防泄露"与"防灾难"的组合,密钥管理是加密安全的关键,距离设计是容灾有效性的关键。

#

15. 如何验证备份的可恢复性(校验与恢复演练)?

请说明如何验证备份的可恢复性(校验与恢复演练)?

  • 备份校验(完整性、校验和)
  • 恢复演练(到隔离环境实际恢复)
  • 定期验证与证据留存

验证备份可恢复性包括:1) 备份校验:备份完成后校验数据完整性(校验和、块校验、restic checkborg check),确认备份文件未损坏;2) 恢复演练:定期在隔离环境实际执行恢复,验证能否从备份恢复出可用的数据/系统,并校验恢复后数据与源一致(如文件数、校验和、数据库本身能启动);3) 验证真实业务:恢复后运行应用/数据库,确认可用性;4) 留存证据:记录恢复演练结果、耗时、RTO 达成情况。只有"恢复出来能用"才算备份有效,校验与演练是备份体系的核心部分。

"备份看得到、恢复不了"最危险,因此校验+演练是验证可恢复性的关键,且需定期执行并留存结果。

#

16. 对象存储备份的设计中版本控制、生命周期规则与跨区域复制在防误删与容灾中的作用

请说明对象存储备份的设计:版本控制、生命周期规则与跨区域复制在防误删与容灾中的作用?

  • 版本控制防误删/覆盖
  • 生命周期规则自动分层与清理
  • 跨区域复制容灾

对象存储备份设计用对象存储特性增强:1) 版本控制(Versioning):对对象开启版本控制,删除/覆盖只新增版本,可恢复误删或误覆盖,防误删与防勒索(配合不可变);2) 生命周期规则(Lifecycle):按时间自动将对象过渡到冷存储(如 Glacier)或过期清理,实现成本分层与自动归档;3) 跨区域复制(CRR):将对象异步复制到另一区域,实现容灾与异地副本,抵御区域级故障。组合使用:版本控制防误删、生命周期降成本、跨区复制保容灾,构建可靠的对象存储备份体系。

对象存储的版本控制、生命周期与跨区复制分别解决"防误删、降成本、保容灾",是对象存储备份的三大支柱。

#

17. 归档与冷存储的选型中对象存储归档类、磁带与云冷存储的取回延迟与成本如何平衡

请说明归档与冷存储的选型:对象存储归档类、磁带与云冷存储的取回延迟与成本平衡?

  • 三类冷存储的取回延迟与成本
  • 访问频率与保留期限
  • 选型权衡

归档冷存储选型需在取回延迟与成本间平衡:1) 对象存储归档类(如 S3 Glacier/Deep Archive、OSS 归档):存储极便宜,取回延迟分钟到小时级,适合合规归档、长期保留,API 友好、便于自动化;2) 磁带:单位成本最低、容量大、适合超大规模长期归档,但取回需人工装带、延迟最高,且需要磁带库硬件运维;3) 云冷存储/本地低频介质:成本介于中间,取回相对快。选型依据:访问频率(越低越好用冷)、保留期限(越长越适合磁带/归档)、取回延迟 SLA(业务要求)、自动化程度与运维成本。核心是"低频+长期保留"才值得冷存储的取回牺牲。

冷存储选型核心是"取回延迟 vs 成本",低频且长期保留的数据才适合归档/磁带,需结合业务 RTO 与预算。

#

18. 快照与备份的本质区别中快照依赖源存储可用性、备份独立于源以及两者的恢复能力与保留策略如何互补

请说明快照与备份的本质区别及互补关系?

  • 快照依赖源存储可用性
  • 备份独立于源
  • 恢复能力与保留策略的互补

快照依赖源存储:快照记录源存储某一时刻的状态,通常存放在同一存储或依赖源存储的元数据,源存储损坏/丢失时快照也失效,无法独立于源恢复。备份独立于源:备份把数据复制到独立介质/位置,源损坏仍可恢复,是真正的灾难恢复手段。快照优势是可快速回滚、近零成本、方便频繁恢复点;备份优势是独立、可长期保留、可异地。两者互补:用快照做高频、快速恢复点(短期),用备份做长期保留与异地容灾(防源故障),组合兼顾 RPO 与可恢复性。

快照是"依赖源、快、临时的恢复点",备份是"独立于源、可长期、真正的容灾",二者互补而非替代。

#

19. 恢复演练的频率与覆盖范围如何制定并评估达标?

请说明恢复演练的频率与覆盖范围如何制定并评估达标?

  • 频率与数据重要性/风险的关系
  • 覆盖范围(全量/局部/关键系统)
  • 达标评估

恢复演练频率与覆盖范围应基于数据重要性、可用性与风险:核心生产数据(数据库、核心系统)应高频演练(如每月恢复演练),次要数据可降低频率(季度/半年);覆盖范围应先覆盖最关键、恢复最复杂的系统,再逐步扩展,用"全量实战演练+桌面演练+局部演练"组合平衡成本与效果。达标评估:明确每类演练的 RTO/RPO 是否达成、恢复成功率、数据完整性是否通过,将结果纳入指标并与目标对比;未达标则整改并复测。频率与范围需随业务变化与演练结果动态调整。

演练频率与范围要紧扣"核心数据"与"恢复复杂度",用分级策略控制成本,用达标指标反馈调整。

#

20. 数据生命周期的冷热分层中访问频率驱动的分层策略与合规保留(retention lock)如何结合

请说明数据生命周期的冷热分层:访问频率驱动的分层策略与合规保留(retention lock)如何结合?

  • 访问频率驱动的分层
  • 生命周期规则自动迁移
  • 合规保留(retention lock)与合规

数据冷热分层按访问频率驱动:热数据放高性能存储(SSD/热存储),温数据放标准存储,冷数据放低成本存储(归档/磁带),通过生命周期规则(如按时间、按大小、按标签)自动迁移,降低存储成本。合规保留(retention lock/对象存储不可变)用于保证数据在法定保留期内不可修改/删除,满足合规审计要求。两者结合:热-温-冷分层控制成本,retention lock 保证合规数据按期保留,即使分层到冷存储也不丢失。访问频率决定存放层级,合规需求决定保留期限,分层与保留共同构成数据生命周期管理。

冷热分层管"存放位置与成本",retention lock 管"保留期限与合规",二者结合实现成本与合规兼得的数据生命周期。