跳到主要内容

排障

排障时建议从用户可见状态开始,逐步下钻到 CRD、Event、Velero 和日志。

实例无法进入 Protected

检查顺序:

  1. DisasterInstance.status.reason/message
  2. DataSync.statusResourceSync.status
  3. 最近的 AppBackupAppRestore
  4. Velero BackupRestore
  5. BSL 状态。
  6. operator 日志。

DataSync 失败

常见原因:

  • 源端 PVC 无法备份。
  • PodVolumeBackup 或 PodVolumeRestore 失败。
  • Trafficless Pod 无法调度。
  • 目标 StorageClass 不存在。
  • 对象存储不可达。

ResourceSync 失败

常见原因:

  • 资源选择策略排除了必要资源。
  • cluster phase 缺少权限。
  • namespace phase 资源已存在且策略不允许 update。
  • modifier 规则非法。
  • 目标集群 CRD 或 API 资源缺失。

Failover 卡住

查看 DisasterOperation.status.currentStepsteps。重点关注:

  • PreCheck 是否发现集群不可达。
  • FinalSync 是否超时。
  • ScaleDownSource 是否因源集群不可达失败。
  • ScaleUpTarget 是否无法拉起副本。
  • CheckReplicas 是否有 pending pod、PVC 或镜像拉取问题。

Drill 清理失败

检查是否使用 namespace mapping。映射命名空间和复用 standby 资源的清理策略不同,不应误删真实备端资源。