跳至主要内容 跳至导航 跳至页脚
MULTI-CLOUD

克隆或迁移正在运行的 Kubernetes 集群

你的集群作为一个整体一起搬走:节点、配置和数据。搬到另一台机器,或者另一个数据中心。切换只需几秒实测完成,不用等一整个周末。

Velero 只能恢复备份。Cluster API 只能克隆集群的骨架。Rediacc 能直接迁移运行中的集群,数据一起带走。

rdc cluster fork prod --tag staging
正在克隆节点镜像(写时复制)............... 完成 ..
正在克隆 Ceph RBD 卷.......................... 完成 ..
正在为新 IP 重写节点身份...................... 完成 ..
✓ ✓ 克隆在 46s 内完成:prod-staging 已启动,父级集群未受影响。
rdc cluster migrate prod --to fsn1-dc2
集群运行时预先复制数据.......................... 完成 ..
切换:停止服务、传输最终增量、重启................ 16s ..

输出仅作示例,实际运行可能有更多日志。 CLI reference: rdc cluster migrate

46s
Whole 2-node cluster fork
16s
Migrate cutover, measured
1-5s
Namespace fork
问题所在

集群会被困在最初搭建的地方

Kubernetes 让你的应用可以随处运行,但集群本身做不到。数据始终留在一个数据中心。想要搬走,就是一个重建项目:新节点、新存储、从备份恢复、重新测试所有东西。所以大多数团队从来不搬家,而供应商很清楚这一点。

27% 的云支出每年都被浪费掉 Flexera 2024 State of the Cloud Report [1]
17% 组织平均云预算超支比例 Flexera 2025 State of the Cloud Report [2]
$0.09/GB 设计上让离开变得昂贵的出站流量费 AWS/Azure/GCP Pricing 2024 [3]
传统方式
Month 1 搭建新集群
Month 2 重建配置文件和密钥
Month 3 从备份恢复存储卷
Month 4 逐个重新测试应用
Month 5+ 切换上线,祈祷顺利
使用 Rediacc
Pre-copy
16s cutover
Live
工作原理

整个集群就是一组文件

1

集群镜像加存储卷

每个节点都从一个镜像文件启动。每个存储卷都是一个 Ceph RBD 镜像。合在一起,就是整个集群:应用、配置和数据。

2

原地克隆

一条命令,写时复制克隆所有镜像。在我们实验室里,一个 2 节点集群 46 秒内完成克隆,父级集群全程保持运行。

3

短暂切换完成迁移

Rediacc 会在集群运行时预先复制数据,然后停止服务、发送最终增量,再在新机器上重新启动。实测切换时间:16 秒。

prod (Datacenter A) Running
Nodes 2 (k3s + Ceph)
Namespaces 8 apps
Volumes Ceph RBD
State Keeps running
Fork
46s
prod-staging (Datacenter B) Running
Nodes 2 (k3s + Ceph)
Namespaces 8 apps
Volumes Ceph RBD clones
State Own identity, new IPs
底层技术

为什么集群能像文件一样说搬就搬

每个节点都从 btrfs 上的一个镜像文件启动。每个存储卷都是一个 Ceph RBD 镜像。复制集群,就是对这些镜像做写时复制克隆。没有导出,没有格式转换,没有恢复步骤。这就是为什么克隆只需几秒,而不是几个月。

备份工具只能一点点地恢复到一个空集群里
节点镜像和存储卷作为一个整体一起迁移
数据还得靠另一套复制产品来处理
Ceph RBD 克隆随行,写时复制
克隆一个集群,意味着重新开通资源、重新部署
在我们实验室里,一个 2 节点集群的克隆只用了 46 秒,父级集群全程保持运行
切换计划往往要占用一整个周末
实测切换时间:16 秒。工作负载会在目标端重新启动
重要意义

保留你的 Kubernetes,获得迁移能力。

保留你的 Kubernetes

Rediacc 可以帮你运行 k3s,也可以直接接入你已有的集群。存储卷基于 ceph-csi RBD。你的配置文件还是你的。

真正的数据中心迁移能力

可以部署在你自己的 KVM 主机上,也可以用 Linode 这类支持私有 VLAN 的云。节点池会把磁盘密集型的 Ceph 节点和 CPU 密集型的 Kubernetes 节点分开管理。

一套思路,管理一切

一个 Kubernetes 应用就是一个命名空间。像克隆普通仓库一样克隆它:1 到 5 秒,数据也一起带走。用的还是你操作 Docker 仓库时那套命令。

差距对比

没有别的工具能带着数据迁移运行中的集群

备份工具只能先停机再恢复。Cluster API 只克隆骨架,不带数据。RBD 镜像只复制存储卷,不复制整个集群。Rediacc 把这一切全部搬走。

功能 VeleroKasten K10Cluster APIRBD Mirroring Rediacc
备份应用和存储卷 [4] [5] Volumes only[9]
连数据一起迁移整个集群 Stop and restore[6] Stop and restore[7] Shape only[8]
克隆运行中的集群,数据一起带走
几秒内克隆单个应用(命名空间)
无需完整重写即可复制数据 Async copy[10]
计划迁移时,切换时间短且可实测

给你的集群留一条退出路径

先克隆它,测试一下迁移,再正式迁移。开始你的 14 天免费试用。

$ rdc cluster fork prod --tag staging

时间有限?

跳过深度解读,直接获取五分钟速览版,供团队站会阅读。

下载简版简报(PDF)
Runs the apps you already ship
数据库、CI/CD、CMS、监控系统、登录系统、存储服务——只要跑在 Kubernetes 上,Rediacc 就能克隆它、迁移它,数据一起带走。
Sources & References
  1. Flexera, "2024 State of the Cloud Report," 2024. "27% of cloud spend continues to be wasted." www.flexera.com
  2. Flexera, "2025 State of the Cloud Report," 2025. "With cloud budgets already exceeding limits by 17%, organizations are increasingly turning to managed service providers." www.flexera.com
  3. AWS, "Amazon S3 Pricing — Data Transfer," 2024. "Data Transfer OUT from Amazon S3 to Internet: $0.09 per GB for the first 10 TB/month." aws.amazon.com
  4. Velero backs up Kubernetes cluster resources and persistent volumes and restores them into a cluster. velero.io
  5. Kasten K10 provides backup and restore of Kubernetes applications, including application data. docs.kasten.io
  6. Velero cluster migration restores a backup into a new cluster; workloads are recreated from the backup point, not moved live. velero.io
  7. Kasten K10 migrates applications between clusters by exporting a restore point and importing it into the target cluster. docs.kasten.io
  8. Cluster API's clusterctl move relocates Cluster API objects (the cluster's definition) to another management cluster; it does not move workload data. cluster-api.sigs.k8s.io
  9. Ceph RBD mirroring replicates block device images between Ceph clusters; it covers volumes, not Kubernetes cluster state. docs.ceph.com
  10. Ceph RBD mirroring is asynchronous, based on journaling or periodic snapshots, and is designed for disaster recovery. docs.ceph.com
克隆和迁移的耗时是在 Rediacc 的 KVM 测试实验室里,对一个 2 节点集群做端到端实测得出的。默认一致性为崩溃一致性,语义等同于一次断电重启。迁移切换期间,工作负载会在目标端重新启动。