TESTUDO / 玄龟阵

开源社区版 · 商业支持

已商业化 · 开源

云原生备份和容灾平台

为 Kubernetes 工作负载提供备份、恢复、迁移与业务连续性能力。

Testudo(玄龟阵)由 SOFTC 开发和维护,提供开源社区版与商业支持。

01
为什么需要

从有备份走向可验证的恢复

云原生应用由资源、数据和依赖共同构成,仅保存单点数据无法证明业务可恢复。Testudo 把保护、复制、验证和恢复纳入一致流程。

核心价值

让容灾从备份任务成为可验证的业务连续性能力

01

应用一致性

按应用边界组织资源、数据与恢复顺序。

02

可验证恢复

用周期性演练和恢复记录验证保护策略。

03

开放可控

以 Testudo 开源技术基础配合 SOFTC 专业服务。

产品能力

围绕 Kubernetes 应用容灾闭环构建的八项能力

01

应用级保护

以 DisasterInstance 描述源集群、目标集群、命名空间、同步策略与恢复策略。

形成应用级保护的统一事实源。
02

持久化数据同步

通过 AppBackup、Velero Backup 与 AppRestore 在目标集群恢复持久化数据。

保持目标端数据持续可恢复。
03

Kubernetes 资源同步

同步应用资源骨架,并通过 standby modifier 将目标端维持在冷备形态。

让资源与数据保持一致的保护节奏。
04

可观测故障切换

按预检、暂停调度、最终同步、源端缩容、目标端扩容和角色切换执行。

让故障切换成为可执行流程。
05

反向保护

确认新主集群和新备集群角色,恢复调度并建立反向保护链路。

切换后快速恢复持续保护能力。
06

多应用容灾组

用 levels 编排多实例顺序,同层并行、跨层串行,并支持超时、重试与失败策略。

保障复杂业务按依赖顺序恢复。
07

无扰容灾演练

支持实例级和组级演练,可复用 standby 或恢复到独立演练命名空间。

持续验证保护链路的真实有效性。
08

状态与事件可观测

通过 status、conditions、history、Kubernetes Event、Watch 与统计 API 暴露运行状态。

让保护、切换和演练全程可追踪。

系统架构

以 CRD 为事实源、由 Operator 执行的五层控制体系

  1. 01

    用户入口层

    通过 Web 控制台、CLI、自动化平台或 API 管理容灾对象。

    • Web 控制台
    • CLI
    • 自动化平台
  2. 02

    API 聚合层

    disaster-server 提供认证、REST、Watch、事件和统计接口。

    • 认证与权限
    • REST / Watch
    • 事件与统计
  3. 03

    CRD 事实源

    Kubernetes API 保存期望状态、运行状态、条件、历史和事件。

    • DisasterInstance
    • DisasterOperation
    • DisasterGroup
  4. 04

    Operator 执行层

    disaster-operator 调谐同步、切换、反向保护和演练状态机。

    • DataSync
    • ResourceSync
    • DisasterDrill
  5. 05

    运行时依赖层

    连接源和目标集群,并通过 Velero 与兼容对象存储完成备份恢复。

    • Kubernetes 集群
    • Velero
    • S3 / MinIO

容灾闭环

从持续保护到可重复演练的标准路径

  1. 01Protect

    保护

    定义应用、资源、数据和同步策略。

  2. 02Sync

    同步

    持续同步 Kubernetes 资源与持久化数据。

  3. 03Failover

    切换

    以可观测步骤完成预检、最终同步和主备切换。

  4. 04Reprotect

    反向保护

    切换后建立新的主备关系与保护链路。

  5. 05Drill

    演练

    在不影响生产的情况下验证恢复结果。

典型场景

覆盖迁移、保护、切换与验证的关键场景

01

跨集群应用迁移

将 Kubernetes 资源与持久化数据迁移到目标集群,并保留全过程状态与历史。

02

同城或异地容灾

在源、目标集群之间持续同步应用,在故障发生时执行受控切换。

03

常态化容灾演练

复用 standby 或独立演练命名空间验证资源、数据和应用恢复结果。

04

多应用分层恢复

按照业务依赖关系对多个实例分层编排,实现同层并行、跨层串行恢复。

开源项目

Testudo(玄龟阵)

查看文档、源代码和贡献入口。社区版采用 Apache 2.0 许可证,并包含项目补充条款;使用、修改或分发前请阅读仓库中的完整许可证。

Apache 2.0 及项目补充条款

落地路径

从工作负载评估到持续运营的四个阶段

  1. 01评估

    盘点工作负载、数据依赖和恢复目标。

  2. 02保护

    建立分级策略与自动备份。

  3. 03验证

    通过恢复演练验证数据与应用一致性。

  4. 04运营

    持续审计、优化并更新业务连续性基线。