排障
排障时建议从用户可见状态开始,逐步下钻到 CRD、Event、Velero 和日志。
实例无法进入 Protected
检查顺序:
DisasterInstance.status.reason/message。DataSync.status和ResourceSync.status。- 最近的
AppBackup和AppRestore。 - Velero
Backup和Restore。 - BSL 状态。
- operator 日志。
DataSync 失败
常见原因:
- 源端 PVC 无法备份。
- PodVolumeBackup 或 PodVolumeRestore 失败。
- Trafficless Pod 无法调度。
- 目标 StorageClass 不存在。
- 对象存储不可达。
ResourceSync 失败
常见原因:
- 资源选择策略排除了必要资源。
- cluster phase 缺少权限。
- namespace phase 资源已存在且策略不允许 update。
- modifier 规则非法。
- 目标集群 CRD 或 API 资源缺失。
Failover 卡住
查看 DisasterOperation.status.currentStep 和 steps。重点关注:
PreCheck是否发现集群不可达。FinalSync是否超时。ScaleDownSource是否因源集群不可达失败。ScaleUpTarget是否无法拉起副本。CheckReplicas是否有 pending pod、PVC 或镜像拉取问题。
Drill 清理失败
检查是否使用 namespace mapping。映射命名空间和复用 standby 资源的清理策略不同,不应误删真实备端资源。