MHA集群搭建与故障切换

📅 2026/8/6 4:41:15
MHA集群搭建与故障切换
文章目录前言一、MHA核心概念1.1 什么是MHA1.2 MHAd 的组成1.3 MHA的核心特性1.4 MHA工作原理总结二、搭建 MySQL MHA2.1 搭建思路2.2 环境准备2.3 MySQL安装与配置2.3.1 Master节点配置2.3.2 Slave1节点配置2.3.3 Slave2节点配置2.3.4 创建软连接2.4 主从复制配置2.4.1 所有数据库节点进行 mysql 授权2.4.2 在 Master 节点查看二进制文件和同步点2.4.3 在 Slave1、Slave2 节点执行同步操作2.4.4 测试数据库同步2.5 MHA安装2.5.1 所有服务器上都安装 MHA 依赖的环境2.5.2 先安装 node 组件然后安装MHA软件包2.6 集群无密码认证配置2.7 在 manager 节点上配置 MHA2.8 启动与验证MHA2.8.1 启动 MHA 服务2.8.2 查看 MHA 状态2.8.3 查看master 的 VIP 地址 10.8.0.200 是否存在三、故障模拟与恢复3.1 主库宕机模拟3.2 故障恢复步骤3.2.1 修复mysql3.2.2 在 manager 节点上修改配置文件app1.cnf3.2.3 在 manager 节点上启动 MHA总结前言在数据库运维领域高可用性是企业架构设计的核心诉求。MySQL作为主流关系型数据库其单点故障问题会直接影响业务连续性。MHAMaster High Availability是成熟的MySQL高可用解决方案能在30秒内完成故障切换并最大程度保障数据一致性。一、MHA核心概念1.1 什么是MHAMHA是一套优秀的MySQL高可用环境下故障切换和主从复制的软件。核心价值可以解决MySQL单点故障问题可以实现自动完成故障切换耗时0-30秒最大程度保证数据一致性以达到真正意义上的高可用。1.2 MHAd 的组成MHA Node数据节点MHA Node运行在每台服务器上。在发生故障时Node节点尽可能保存二进制文件 并且实现故障切换VIP地址漂移MHA Manager管理/检测 节点MHA Manager可以单独部署在一台独立的机器上管理多个master-slave集群也可以部署在一台slave节点上。MHA Manager会定时探测集群中的master节点。当master出现故障时它可以自动将最新数据的slave提升为新的master然后将所有其他的slave重新指向新的master。整个故障转移过程对应用程序完全透明。1.3 MHA的核心特性自动故障切换过程中MHA试图从宕机的主服务器上保存二进制日志最大程度的保证数据不丢失。使用半同步复制可以大大降低数据丢失的风险如果只有一个slave已经收到了最新的二进制日志MHA可以将最新的二进制日志应用于其他所有的slave服务器上因此可以保证所有节点的数据一致性目前MHA支持一主多从架构最少三台服务即一主两从1.4 MHA工作原理总结从宕机崩溃的master保存二进制日志事件binlog events识别含有最新的slave日志应用差异的中继日志relay log 到其他的slave应用从master保存的二进制日志事件在最新的slave上提升一个salve为新的master使其他的slave连接新的master进行复制。二、搭建 MySQL MHA2.1 搭建思路MHA架构1数据库安装2一主两从主从复制3MHA搭建故障模拟1主库失效2备选主库成为主库3原故障主库恢复重新加入到MHA成为从库2.2 环境准备# 所有节点执行systemctl stop firewalld setenforce0# manager、master、slave1、slave2 节点上分别设置主机名hostnamectl set-hostname master# Master节点hostnamectl set-hostname slave1# Slave1节点hostnamectl set-hostname slave2# Slave2节点hostnamectl set-hostname manager# manager节点# manager、master、slave1、slave2 节点上分别设置主机名映射vim/etc/hosts10.8.0.10 master10.8.0.30 slave110.8.0.50 slave210.8.0.60 manager2.3 MySQL安装与配置2.3.1 Master节点配置# /etc/my.cnf[mysqld]server-id1log_binmaster-bin log-slave-updatestrue2.3.2 Slave1节点配置# /etc/my.cnfserver-id2log_binmaster-bin relay-logrelay-log-bin relay-log-indexslave-relay-bin.index2.3.3 Slave2节点配置# /etc/my.cnfserver-id3relay-logrelay-log-bin relay-log-indexslave-relay-bin.index2.3.4 创建软连接# 在 Master、Slave1、Slave2 节点上都创建两个软链接ln-s/usr/local/mysql/bin/mysql /usr/sbin/ln-s/usr/local/mysql/bin/mysqlbinlog /usr/sbin/2.4 主从复制配置2.4.1 所有数据库节点进行 mysql 授权# 所有数据库节点进行 mysql 授权mysql-uroot-p# 从数据库同步使用GRANT REPLICATION SLAVE ON *.* TOmyslave10.8.0.%IDENTIFIED BY123456;# manager 使用GRANT ALL PRIVILEGES ON *.* TOmha10.8.0.%IDENTIFIED BYmanager;# 防止主机名解析问题GRANT ALL PRIVILEGES ON *.* TOmhamasterIDENTIFIED BYmanager;GRANT ALL PRIVILEGES ON *.* TOmhaslave1IDENTIFIED BYmanager;GRANT ALL PRIVILEGES ON *.* TOmhaslave2IDENTIFIED BYmanager;FLUSH PRIVILEGES;# 检查一下selectuser,host from mysql.user;2.4.2 在 Master 节点查看二进制文件和同步点# Master查看二进制日志状态SHOW MASTER STATUS;# 记录File: master-bin.000003, Position: 24112.4.3 在 Slave1、Slave2 节点执行同步操作# 在 Slave1、Slave2 节点执行同步操作CHANGE MASTER TOMASTER_HOST10.8.0.10,MASTER_USERmyslave,MASTER_PASSWORD123456,MASTER_LOG_FILEmaster-bin.000003,MASTER_LOG_POS2411;START SLAVE;# 检查从库状态SHOW SLAVE STATUS\G# 确保Slave_IO_Running/Slave_SQL_RunningYes# 从库设为只读SET GLOBALread_only1;2.4.4 测试数据库同步# 在 Master 主库插入条数据测试是否同步create database work;use work;create table ff(id int);insert into ff(id)values(2);2.5 MHA安装2.5.1 所有服务器上都安装 MHA 依赖的环境# 所有节点安装依赖yuminstallepel-release--nogpgcheck-y# 建议多校验几次可能会漏装依赖yuminstall-yperl-DBD-MySQL\perl-Config-Tiny\perl-Log-Dispatch\perl-Parallel-ForkManager\perl-ExtUtils-CBuilder\perl-ExtUtils-MakeMaker\perl-CPAN2.5.2 先安装 node 组件然后安装MHA软件包# 所有节点安装Node组件cd/opttarzxvf mha4mysql-node-0.57.tar.gzcdmha4mysql-node-0.57 perl Makefile.PLmakemakeinstall# Manager节点安装Manager组件cd/opttarzxvf mha4mysql-manager-0.57.tar.gzcdmha4mysql-manager-0.57 perl Makefile.PLmakemakeinstal----------------------------------------------------------------------------------------------------------#manager 组件安装后在/usr/local/bin 下面会生成几个工具主要包括以下几个masterha_check_ssh 检查 MHA 的 SSH 配置状况 masterha_check_repl 检查 MySQL 复制状况 masterha_manger 启动 manager的脚本 masterha_check_status 检测当前 MHA 运行状态 masterha_master_monitor 检测 master 是否宕机 masterha_master_switch 控制故障转移自动或者 手动 masterha_conf_host 添加或删除配置的 server 信息 masterha_stop 关闭manager#node 组件安装后会在/usr/local/bin 下面生成如下几个脚本这些工具通常由 MHAManager 的脚本触发无需人为操作save_binary_logs 保存和复制 master 的二进制日志 apply_diff_relay_logs 识别差异的中继日志事件并将其差异的事件应用于其他的 slave filter_mysqlbinlog 去除不必要的 ROLLBACK 事件MHA 已不再使用这个工具 purge_relay_logs 清除中继日志不会阻塞 SQL 线程 ----------------------------------------------------------------------------------------------------------2.6 集群无密码认证配置# 在 manager 节点上配置到所有数据库节点的无密码认证ssh-keygen-trsa# 一路回车ssh-copy-id10.8.0.10 ssh-copy-id10.8.0.30 ssh-copy-id10.8.0.50# 在 master 上配置到数据库节点 slave1 和 slave2 的无密码认证ssh-keygen-trsa ssh-copy-id10.8.0.30 ssh-copy-id10.8.0.50# 在 slave1 上配置到数据库节点 master 和 slave2 的无密码认证ssh-keygen-trsa ssh-copy-id10.8.0.10 ssh-copy-id10.8.0.50# 在 slave2 上配置到数据库节点 master 和 slave1 的无密码认证ssh-keygen-trsa ssh-copy-id10.8.0.10 ssh-copy-id10.8.0.302.7 在 manager 节点上配置 MHA在 manager 节点上复制相关脚本到/usr/local/bin 目录cp-rp/opt/mha4mysql-manager-0.57/samples/scripts /usr/local/bin# 拷贝后会出现四个执行文件具体如下master_ip_failover#自动切换时 vip 管理的脚本master_ip_online_change#在线切换时 vip 的管理power_manager#故障发生后关闭主机的脚本send_report#因故障切换后发送报警的脚本复制上述的自动切换时 VIP 管理的脚本到 /usr/local/bin 目录这里使用master_ip_failover脚本来管理 VIP 和故障切换cp/usr/local/bin/scripts/master_ip_failover /usr/local/bin删除原有内容直接复制并修改vip相关的参数vim/usr/local/bin/master_ip_failover#!/usr/bin/env perluse strict;use warnings FATALall;use Getopt::Long;my($command,$ssh_user,$orig_master_host,$orig_master_ip,$orig_master_port,$new_master_host,$new_master_ip,$new_master_port);#############################添加内容部分#########################################my$vip10.8.0.200;#指定vip的地址my$brdc10.8.0.255;#指定vip的广播地址my$ifdevens33;#指定vip绑定的网卡my$key1;#指定vip绑定的虚拟网卡序列号my$ssh_start_vip/sbin/ifconfig ens33:$key$vip;#代表此变量值为ifconfig ens33:1 192.168.10.200my$ssh_stop_vip/sbin/ifconfig ens33:$keydown;#代表此变量值为ifconfig ens33:1 192.168.10.200 downmy$exit_code0;#指定退出状态码为0#my $ssh_start_vip /usr/sbin/ip addr add $vip/24 brd $brdc dev $ifdev label $ifdev:$key;/usr/sbin/arping -q -A -c 1 -I $ifdev $vip;iptables -F;;#my $ssh_stop_vip /usr/sbin/ip addr del $vip/24 dev $ifdev label $ifdev:$key;##################################################################################GetOptions(commands\$command,ssh_users\$ssh_user,orig_master_hosts\$orig_master_host,orig_master_ips\$orig_master_ip,orig_master_porti\$orig_master_port,new_master_hosts\$new_master_host,new_master_ips\$new_master_ip,new_master_porti\$new_master_port,);exitmain();sub main{print\n\nIN SCRIPT TEST$ssh_stop_vip$ssh_start_vip\n\n;if($commandeqstop||$commandeqstopssh){my$exit_code1;eval{printDisabling the VIP on old master:$orig_master_host\n;stop_vip();$exit_code0;};if($){warnGot Error:$\n;exit$exit_code;}exit$exit_code;}elsif($commandeqstart){my$exit_code10;eval{printEnabling the VIP -$vipon the new master -$new_master_host\n;start_vip();$exit_code0;};if($){warn$;exit$exit_code;}exit$exit_code;}elsif($commandeqstatus){printChecking the Status of the script.. OK\n;exit0;}else{usage();exit1;}}substart_vip(){ssh$ssh_user\$new_master_host\ $ssh_start_vip\;}## A simple system call that disable the VIP on the old_mastersubstop_vip(){ssh$ssh_user\$orig_master_host\ $ssh_stop_vip\;}sub usage{printUsage: master_ip_failover --commandstart|stop|stopssh|status --orig_master_hosthost --orig_master_ipip --orig_master_portport --new_master_hosthost --new_master_ipip --new_master_portport\n;}创建 MHA目录并拷贝配置文件这里用app1.cnf配置文件来管理 mysql 节点服务器mkdir/etc/masterhacp/opt/mha4mysql-manager-0.57/samples/conf/app1.cnf /etc/masterha删除原有内容直接复制并修改节点服务器的IP地址vim/etc/masterha/app1.cnf[server default]manager_log/var/log/masterha/app1/manager.logmanager_workdir/var/log/masterha/app1master_binlog_dir/usr/local/mysql/datamaster_ip_failover_script/usr/local/bin/master_ip_failovermaster_ip_online_change_script/usr/local/bin/master_ip_online_changepasswordmanagerping_interval1remote_workdir/tmprepl_password123456repl_usermyslavesecondary_check_script/usr/local/bin/masterha_secondary_check-s10.8.0.30-s10.8.0.50shutdown_scriptssh_userrootusermha[server1]hostname10.8.0.10port3306[server2]candidate_master1check_repl_delay0hostname10.8.0.30port3306[server3]hostname10.8.0.50port3306第一次配置需要在 Master 节点上手动开启虚拟IP# master节点/sbin/ifconfig ens33:110.8.0.200/16# 若无法执行可以yum install -y net-tools在 manager 节点上测试 ssh 无密码认证masterha_check_ssh-conf/etc/masterha/app1.cnf# 正常最后会输出 successfully在 manager 节点上测试 mysql 主从连接情况masterha_check_repl-conf/etc/masterha/app1.cnf2.8 启动与验证MHA2.8.1 启动 MHA 服务# 启动MHA服务nohupmasterha_manager--conf/etc/masterha/app1.cnf\--remove_dead_master_conf--ignore_last_failover/dev/null/var/log/masterha/app1/manager.log212.8.2 查看 MHA 状态# 检查MHA状态masterha_check_status--conf/etc/masterha/app1.cnf2.8.3 查看master 的 VIP 地址 10.8.0.200 是否存在ipa三、故障模拟与恢复3.1 主库宕机模拟# 在Manager节点观察日志tail-f/var/log/masterha/app1/manager.log#在 Master 节点 master 上停止mysql服务systemctl stop mysqld# 验证VIP漂移# 正常自动切换一次后MHA 进程会退出。HMA 会自动修改 app1.cnf 文件内容将宕机的 master 节点删除。查看 slave1 是否接管 VIPipa3.2 故障恢复步骤3.2.1 修复mysql# 重启数据库systemctl restart mysqld#在现主库服务器10.8.0.30 slave1 查看二进制文件和同步点show master status;#在原主库服务器10.8.0.10 mysql1 执行同步操作change master tomaster_host10.8.0.10,master_usermyslave,master_password123456,master_log_filemaster-bin.000005,master_log_pos154;start slave;# 检查一下状态show slave status\G;3.2.2 在 manager 节点上修改配置文件app1.cnfvim/etc/masterha/app1.cnf......secondary_check_script/usr/local/bin/masterha_secondary_check-s10.8.0.10-s10.8.0.50......[server1]hostname10.8.0.10port3306[server2]candidate_master1check_repl_delay0hostname10.8.0.30port3306[server3]hostname10.8.0.50port33063.2.3 在 manager 节点上启动 MHAnohupmasterha_manager--conf/etc/masterha/app1.cnf--remove_dead_master_conf--ignore_last_failover/dev/null/var/log/masterha/app1/manager.log21总结故障切换mha会做哪些动作1mha会多次尝试检测master的存活状态2mhah会多次尝试、尽可能的保存master的二进制日志3mha会根据app1.cnf中的配置进行从服务器------》 主服务器的筛选与切换4mha会将master的VIP地址 切换到从服务器的位置5mha再选择完新的master后会在其余的salve上执行change master操作指向性的master, 来保证Mysql的集群的健康性