应用一致性
按应用边界组织资源、数据与恢复顺序。
为 Kubernetes 工作负载提供备份、恢复、迁移与业务连续性能力。
Testudo(玄龟阵)由 SOFTC 开发和维护,提供开源社区版与商业支持。
01
为什么需要
云原生应用由资源、数据和依赖共同构成,仅保存单点数据无法证明业务可恢复。Testudo 把保护、复制、验证和恢复纳入一致流程。
核心价值
按应用边界组织资源、数据与恢复顺序。
用周期性演练和恢复记录验证保护策略。
以 Testudo 开源技术基础配合 SOFTC 专业服务。
产品能力
以 DisasterInstance 描述源集群、目标集群、命名空间、同步策略与恢复策略。
形成应用级保护的统一事实源。通过 AppBackup、Velero Backup 与 AppRestore 在目标集群恢复持久化数据。
保持目标端数据持续可恢复。同步应用资源骨架,并通过 standby modifier 将目标端维持在冷备形态。
让资源与数据保持一致的保护节奏。按预检、暂停调度、最终同步、源端缩容、目标端扩容和角色切换执行。
让故障切换成为可执行流程。确认新主集群和新备集群角色,恢复调度并建立反向保护链路。
切换后快速恢复持续保护能力。用 levels 编排多实例顺序,同层并行、跨层串行,并支持超时、重试与失败策略。
保障复杂业务按依赖顺序恢复。支持实例级和组级演练,可复用 standby 或恢复到独立演练命名空间。
持续验证保护链路的真实有效性。通过 status、conditions、history、Kubernetes Event、Watch 与统计 API 暴露运行状态。
让保护、切换和演练全程可追踪。系统架构
通过 Web 控制台、CLI、自动化平台或 API 管理容灾对象。
disaster-server 提供认证、REST、Watch、事件和统计接口。
Kubernetes API 保存期望状态、运行状态、条件、历史和事件。
disaster-operator 调谐同步、切换、反向保护和演练状态机。
连接源和目标集群,并通过 Velero 与兼容对象存储完成备份恢复。
容灾闭环
定义应用、资源、数据和同步策略。
持续同步 Kubernetes 资源与持久化数据。
以可观测步骤完成预检、最终同步和主备切换。
切换后建立新的主备关系与保护链路。
在不影响生产的情况下验证恢复结果。
典型场景
将 Kubernetes 资源与持久化数据迁移到目标集群,并保留全过程状态与历史。
在源、目标集群之间持续同步应用,在故障发生时执行受控切换。
复用 standby 或独立演练命名空间验证资源、数据和应用恢复结果。
按照业务依赖关系对多个实例分层编排,实现同层并行、跨层串行恢复。
开源项目
查看文档、源代码和贡献入口。社区版采用 Apache 2.0 许可证,并包含项目补充条款;使用、修改或分发前请阅读仓库中的完整许可证。
Apache 2.0 及项目补充条款落地路径
盘点工作负载、数据依赖和恢复目标。
建立分级策略与自动备份。
通过恢复演练验证数据与应用一致性。
持续审计、优化并更新业务连续性基线。