MongoDB PBM 备份恢复完整验证手册

📅 2026/7/30 9:07:33
MongoDB PBM 备份恢复完整验证手册
MongoDB PBM 备份恢复完整验证手册看那么多文章自己操作一遍比啥都熟悉的快这份文档使用的是podman,也可以使用docker不影响验证目标3 节点副本集 → 全量备份 PITR 切片 → 无共享存储时恢复必然失败 → copy 备份到另一台机器 → 挂共享存储后异机 PITR 恢复成功环境Mac PodmanMongoDB 7 PBM 2.15.0 ARM642026-07-29 实测变量区下面所有步骤的命令都基于这些变量。改 IP、改路径、改镜像版本只需改这里全文生效。# 集群网络 NETWORKmongo-netSUBNET10.89.1.0/24# 3 个 MongoDB 节点固定 IPNODE1_IP10.89.1.11NODE2_IP10.89.1.12NODE3_IP10.89.1.13MONGO_IMAGEmongo:7REPLSETrs0# PBM 二进制存放目录从 Docker 镜像提取PBM_BIN_DIR$HOME/pbm-bin# PBM Docker 镜像ARM64Mac 兼容PBM_IMAGEpercona/percona-backup-mongodb:2.15.0-arm64# 备份目录 RESTORE_DIR$HOME/mongo-restore-test# 从容器 copy 出来的备份SHARED_DIR$HOME/mongo-shared-backup# 模拟生产 NFS 的共享目录第 1 阶段搭建 3 节点副本集1.1 创建网络podmannetwork create--subnet${SUBNET}${NETWORK}2/dev/null1.2 启动 3 个 MongoDB 实例podmanrun-d--namemongo1--network${NETWORK}--ip${NODE1_IP}\${MONGO_IMAGE}mongod--replSet${REPLSET}--bind_ip_allpodmanrun-d--namemongo2--network${NETWORK}--ip${NODE2_IP}\${MONGO_IMAGE}mongod--replSet${REPLSET}--bind_ip_allpodmanrun-d--namemongo3--network${NETWORK}--ip${NODE3_IP}\${MONGO_IMAGE}mongod--replSet${REPLSET}--bind_ip_all1.3 初始化副本集sleep5podmanexecmongo1 mongosh--eval rs.initiate({ _id: rs0, members: [ {_id:0, host:10.89.1.11:27017}, {_id:1, host:10.89.1.12:27017}, {_id:2, host:10.89.1.13:27017} ] })sleep10podmanexecmongo1 mongosh--evalrs.status().members.forEach(m print(m.name → m.stateStr))# 预期: 1 个 PRIMARY 2 个 SECONDARY第 2 阶段安装 PBM3 个节点2.1 从 Docker 镜像提取 ARM64 二进制mkdir-p${PBM_BIN_DIR}podmanrun-d--namepbm-temp${PBM_IMAGE}podmancppbm-temp:/usr/bin/pbm${PBM_BIN_DIR}/pbmpodmancppbm-temp:/usr/bin/pbm-agent${PBM_BIN_DIR}/pbm-agentpodmanrm-fpbm-templs-lh${PBM_BIN_DIR}/# 预期: pbm pbm-agent 两个二进制各 ~60MBMac 是 ARM 芯片不能用 x86_64 RPM/tarball——之前踩过坑rpm -ivh报/lib64/ld-linux-x86-64.so.2不存在。2.2 拷到 3 个节点 配 storage 启 Agentforiin123;dopodmancp${PBM_BIN_DIR}/pbm mongo${i}:/usr/bin/podmancp${PBM_BIN_DIR}/pbm-agent mongo${i}:/usr/bin/podmanexecmongo${i}chmodx /usr/bin/pbm /usr/bin/pbm-agentpodmanexecmongo${i}bash-ccat /etc/pbm-storage.conf EOF storage: type: filesystem filesystem: path: /tmp/backup EOFpodmanexec-dmongo${i}pbm-agent --mongodb-urimongodb://10.89.1.1${i}:27017/?replSetName${REPLSET}done2.3 初始化 PBM 配置只在一台跑podmanexecmongo1 pbm config--file/etc/pbm-storage.conf\--mongodb-urimongodb://${NODE1_IP}:27017/?replSetName${REPLSET}2.4 确认三节点就绪podmanexecmongo1 pbm status --mongodb-urimongodb://${NODE1_IP}:27017/?replSetName${REPLSET}# 预期: 三行 pbm-agent OK第 3 阶段全量备份podmanexecmongo1 pbm backup --mongodb-urimongodb://${NODE1_IP}:27017/?replSetName${REPLSET}# 记下备份名后面恢复用podmanexecmongo1 pbm list --mongodb-urimongodb://${NODE1_IP}:27017/?replSetName${REPLSET}# 例如: 2026-07-29T03:03:36Z此时全量备份里只有 MongoDB 系统库没有 test 业务数据。后面 PITR 恢复时全量恢复完 test 库是空的要靠 PITR 切片追回增量数据——这样才能真正验证 PITR 是否有效。第 4 阶段开启 PITR 插入测试数据4.1 开启 PITR切片间隔 1 分钟podmanexecmongo1 pbm config--setpitr.enabledtrue\--mongodb-urimongodb://${NODE1_IP}:27017/?replSetName${REPLSET}podmanexecmongo1 pbm config--setpitr.oplogSpanMin1\--mongodb-urimongodb://${NODE1_IP}:27017/?replSetName${REPLSET}# 确认 PITR 已开启podmanexecmongo1 pbm status --mongodb-urimongodb://${NODE1_IP}:27017/?replSetName${REPLSET}# 预期: PITR Status [ON]4.2 等切片开始生成后插入数据# 等 PITR 切片开始生成sleep120podmanexecmongo1 pbm status --mongodb-urimongodb://${NODE1_IP}:27017/?replSetName${REPLSET}# 确认 PITR chunks 行已经出现了切片# 在主库上插数据——这些数据全量备份里没有只存在 PITR 切片里podmanexecmongo2 mongosh--eval use test; for (let i0; i10000; i) { db.pitrTest.insertOne({name:useri, ts:new Date()}) }; db.users.insertMany([{name:张三,age:30},{name:李四,age:25},{name:王五,age:28}]); print(pitrTest: db.pitrTest.countDocuments() 条); print(users: db.users.countDocuments() 条); 4.3 获取恢复时间点# 等 PITR 切片覆盖刚才的插入操作约 3-5 分钟sleep240podmanexecmongo1 pbm status --mongodb-urimongodb://${NODE1_IP}:27017/?replSetName${REPLSET}PITR chunks那行示例2026-07-29T03:03:41 - 2026-07-29T03:21:06记下 2026-07-29T03:21:06 这个结束时间后面 PITR 恢复就用它。不需要手动 date。第 5 阶段第一次恢复PITR 会失败——这是关键教训5.1 执行 PITR 恢复podmanexecmongo1 pbm restore--time2026-07-29T03:21:06-w\--mongodb-urimongodb://${NODE1_IP}:27017/?replSetName${REPLSET}5.2 实际输出——恢复失败Starting restore ... to point-in-time 2026-07-29T03:21:06 ... Error: failed to ensure chunk {1785294220 2}.{1785294545 1} on the storage, file: pbmPitr/rs0/20260729/20260729030340-2.20260729030905-1.oplog.s2, error: no such file - Restore on replicaset rs0 in state: error5.3 失败原因三个容器各自独立的/tmp/backupPBM 不会跨节点传输切片文件。PITR 切片是 mongo3负责 PITR 的节点写到它自己的 /tmp/backup 里的。 恢复时 PBM 在 mongo1 上执行mongo1 去读自己本地的 /tmp/backup—— 根本找不到 mongo3 写的切片 → 报 no such file PBM 的设计假设是所有节点挂同一个共享存储生产 NFS。 没有共享存储就没有 PITR 恢复。这就是为什么后面需要重新搭建带共享目录的集群来验证异机恢复。第 6 阶段copy 备份到 Mac 本地# 确认备份文件在 mongo3 上PITR 切片那台podmanexecmongo3ls-lh/tmp/backup/# 预期: 全量备份目录 .pbm.json pbmPitr/# copy 出来mkdir-p${RESTORE_DIR}podmancpmongo3:/tmp/backup/.${RESTORE_DIR}/# 确认ls-lh${RESTORE_DIR}/ls-lh${RESTORE_DIR}/pbmPitr/rs0/20260729/2/dev/null# 预期: 全量备份 PITR 切片文件第 7 阶段异机恢复挂共享存储问题解决7.1 清理旧集群podmanstop mongo1 mongo2 mongo3podmanrmmongo1 mongo2 mongo37.2 创建共享备份目录并 copy 备份进去模拟生产 NFSmkdir-p${SHARED_DIR}cp-r${RESTORE_DIR}/*${SHARED_DIR}/ls-lh${SHARED_DIR}/这就是生产环境的等价操作——备份放在所有节点都能访问的 NFS 目录上恢复时任意节点都能读到同一个文件。7.3 启动新集群共享目录挂载到每个容器podmanrun-d--namemongo1--network${NETWORK}--ip${NODE1_IP}\-v${SHARED_DIR}:/tmp/backup${MONGO_IMAGE}mongod--replSet${REPLSET}--bind_ip_allpodmanrun-d--namemongo2--network${NETWORK}--ip${NODE2_IP}\-v${SHARED_DIR}:/tmp/backup${MONGO_IMAGE}mongod--replSet${REPLSET}--bind_ip_allpodmanrun-d--namemongo3--network${NETWORK}--ip${NODE3_IP}\-v${SHARED_DIR}:/tmp/backup${MONGO_IMAGE}mongod--replSet${REPLSET}--bind_ip_all7.4 初始化副本集sleep5podmanexecmongo1 mongosh--eval rs.initiate({ _id: rs0, members: [ {_id:0, host:10.89.1.11:27017}, {_id:1, host:10.89.1.12:27017}, {_id:2, host:10.89.1.13:27017} ] })sleep10podmanexecmongo1 mongosh--evalrs.status().members.forEach(m print(m.name → m.stateStr))7.5 安装 PBM每个节点 识别备份 执行恢复# 拷 PBM 启 Agentforiin123;dopodmancp${PBM_BIN_DIR}/pbm mongo${i}:/usr/bin/podmancp${PBM_BIN_DIR}/pbm-agent mongo${i}:/usr/bin/podmanexecmongo${i}chmodx /usr/bin/pbm /usr/bin/pbm-agentpodmanexecmongo${i}bash-ccat /etc/pbm-storage.conf EOF storage: type: filesystem filesystem: path: /tmp/backup EOFpodmanexec-dmongo${i}pbm-agent --mongodb-urimongodb://10.89.1.1${i}:27017/?replSetName${REPLSET}done# 初始化 PBM 配置podmanexecmongo1 pbm config--file/etc/pbm-storage.conf\--mongodb-urimongodb://${NODE1_IP}:27017/?replSetName${REPLSET}# 强制重扫描备份仓库新集群必须做podmanexecmongo1 pbm config --force-resync\--mongodb-urimongodb://${NODE1_IP}:27017/?replSetName${REPLSET}# 确认能看到备份podmanexecmongo1 pbm list --mongodb-urimongodb://${NODE1_IP}:27017/?replSetName${REPLSET}# PITR 恢复y 确认podmanexecmongo1 pbm restore--time2026-07-29T03:21:06-w\--mongodb-urimongodb://${NODE1_IP}:27017/?replSetName${REPLSET}这次不报no such file——三个容器挂的都是同一个 Mac 目录${SHARED_DIR}mongo3 写的切片 mongo1 能读到 ✅第 8 阶段验证数据podmanexecmongo3 mongosh--eval use test; print(pitrTest 条数: db.pitrTest.countDocuments()); print(users 条数: db.users.countDocuments()); # 预期: pitrTest10000, users3# 从库延迟归零podmanexecmongo3 mongosh--evalrs.printSecondaryReplicationInfo()# 预期: 0 secs behind the primary全量备份里没有 test 库——恢复全量后 test 是空的。PITR 切片回放后 test 库和 1 万条数据全回来——PITR 增量恢复有效 ✅踩坑记录坑现象原因解决PITR 切片找不到致命restore 报no such file: pbmPitr/rs0/20260729/xxx.oplog.s2没有共享存储——三个容器各自独立的/tmp/backup。PBM 不会跨节点传输切片。所有节点挂同一共享目录-v ~/mongo-shared-backup:/tmp/backup生产用 NFS架构不匹配rpm -ivh报/lib64/ld-linux-x86-64.so.2不存在Mac ARM 芯片不能用 x86_64 RPM/tarball用 Docker Hub 的 ARM64 镜像新集群看不到备份pbm list报no documents in result备份文件在共享目录里但 PBM 元数据没同步到 MongoDB admin 库pbm config --filepbm config --force-resyncPBM 2.15.0 不支持 MongoDB 4.2no such command: helloMongoDB 4.2 用isMaster5.0 用hello生产 4.2 降级到 PBM 2.0.5练完清理podmanstop mongo1 mongo2 mongo3 mongo4 pbm-temp2/dev/nullpodmanrmmongo1 mongo2 mongo3 mongo4 pbm-temp2/dev/nullpodmannetworkrm${NETWORK}2/dev/nullrm-rf${RESTORE_DIR}${SHARED_DIR}${PBM_BIN_DIR}验证日期2026-07-29环境Mac Podman MongoDB 7 PBM 2.15.0 ARM64