灯下哥谭 灯下哥谭
首页
关于
  • Hermes Agent 平台
  • Claude Code
  • OpenClaw
  • GPU 推理节点运维
  • DeepSeek Harness
  • MySQL 运维知识地图
  • Elasticsearch 运维知识地图
  • Redis 运维知识地图
  • TiDB 体系
  • DBA 常用 SQL 与命令
  • Nginx 运维知识地图
  • Prometheus 监控
  • Docker
  • Systemd
  • Iptables
  • Firewalld
  • Sshd
  • MySQL8 运维 SOP 手册
  • MySQL 实战 45 讲(读书笔记)
  • 分类
  • 标签
  • 归档
GitHub (opens new window)

灯下哥谭

灯还亮着
首页
关于
  • Hermes Agent 平台
  • Claude Code
  • OpenClaw
  • GPU 推理节点运维
  • DeepSeek Harness
  • MySQL 运维知识地图
  • Elasticsearch 运维知识地图
  • Redis 运维知识地图
  • TiDB 体系
  • DBA 常用 SQL 与命令
  • Nginx 运维知识地图
  • Prometheus 监控
  • Docker
  • Systemd
  • Iptables
  • Firewalld
  • Sshd
  • MySQL8 运维 SOP 手册
  • MySQL 实战 45 讲(读书笔记)
  • 分类
  • 标签
  • 归档
GitHub (opens new window)
  • MySQL

    • MySQL 运维知识地图:从入门配置到高可用排障
    • MySQL8 配置文件 my.cnf 重要参数解读
    • MySQL 导出 CSV 中文乱码:字符集链路从头讲一遍
    • MySQL 角色管理
    • MySQL网络抓包审计
    • MySQL 性能压测:Sysbench 1.0 实战
    • MySQL Router 实现读写分离
    • Gh-ost重建表,清除表碎片率
      • 为什么用 gh-ost 重建表,而不是 OPTIMIZE TABLE
      • 一条实际用过的命令
      • 验证
      • 坑与边界
    • MySQL MGR配合MySQL-router实现innodb-cluster
    • MySQL 快速分析binlog定位问题
    • MySQL执行计划分析
    • DBA常用SQL和命令整理备查
    • 单表数据同步方案选型:为什么不该用 mysqldump 做「实时同步」
    • MySQL的事务隔离级别
    • MySQL存储过程批量生成数据
    • MySQL insert on duplicate key update,replace into , insert ignore的理解
    • MySQL不同字符集之间的区别和选择
    • MySQL为什么有时候会选错索引
    • MySQL死锁问题
    • MySQL使用SQL语句查重去重
    • MySQLdump逻辑备份
    • MySQL 基于 GTID 主从复制:跳过异常事务的正确姿势
    • MySQL8快速克隆插件使用指南
    • MySQL8双1设置保障安全
    • MySQL锁
    • innodb cluster安装
    • OPTIMIZE TABLE 和 ANALYZE TABLE 的区别:用实测数据说话
    • MySQLReplicaSet 安装
    • MySQL 的 Left join、Right join 和 Inner join 的区别
    • ORDER BY 配合 LIMIT 触发的索引选择陷阱
  • Redis

  • 高性能KV

  • TiDB

  • Elasticsearch

  • 数据管道

  • 其他数据库

  • 数据库
  • MySQL
灯下哥谭
2022-03-10
目录

Gh-ost重建表,清除表碎片率

# 为什么用 gh-ost 重建表,而不是 OPTIMIZE TABLE

清理表碎片的标准动作是整表重建。OPTIMIZE TABLE / ALTER TABLE ... ENGINE=InnoDB 也能做到,但它们是在数据库内部重建:虽然支持 Online DDL、多数情况下允许并发 DML,重建过程本身仍要占用大量 I/O,最后的 cut-over 阶段还要拿元数据锁——大表上一旦卡住,整张表的读写全部排队。

版本说明

本文写于 2022-03。
gh-ost 的无锁在线 DDL 原理与常用参数未变,经 2026-07 复核仍适用。

gh-ost 的做法完全不同:它在数据库外面建一张影子表,一边按主键分块把存量行拷过去,一边伪装成从库订阅 binlog把增量变更追上,最后做一次极短的表名交换。关键差别是它可以随时被节流或中止——发现主库负载高了就自己停下来,不像 ALTER TABLE 一旦开始只能等它跑完或承担 KILL 后的回滚。

所以选型是这样的:

OPTIMIZE TABLE gh-ost
适合 小表、能接受一次性 I/O 冲击 大表、有业务在跑、要可控可中止
可否中途暂停 否 是(throttle / postpone flag file)
额外磁盘 需要约一倍表大小 同样需要约一倍
前提 无 binlog 为 ROW、表必须有主键或唯一键

先量化碎片率再决定要不要做(碎片率低时重建纯属白付出代价),方法见 OPTIMIZE TABLE 和 ANALYZE TABLE 的区别。

# 一条实际用过的命令

--alter="engine=innodb" 就是「只重建、不改结构」的写法——这正是清碎片要的效果。

/opt/gh-ost/bin/gh-ost \
--max-load=Threads_running=20 \
--critical-load=Threads_running=50 \
--critical-load-interval-millis=5000 \
--chunk-size=1000 \
--user="root" \
--password="" \
--host='127.0.0.1' \
--port=3316 \
--database="test" \
--table="b" \
--verbose \
--alter="engine=innodb" \
--assume-rbr \
--cut-over=default \
--cut-over-lock-timeout-seconds=1 \
--dml-batch-size=10 \
--allow-on-master \
--concurrent-rowcount \
--default-retries=10 \
--heartbeat-interval-millis=2000 \
--panic-flag-file=/tmp/ghost.panic.flag \
--postpone-cut-over-flag-file=/tmp/ghost.postpone.flag \
--timestamp-old-table \
--execute 2>&1 | tee  /tmp/rebuild_t1.log
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25

几个值得单独说的参数:

  • --max-load=Threads_running=20:超过就节流(暂停拷贝,不退出)。这是保护业务的第一道闸。
  • --critical-load=Threads_running=50:超过就直接退出。第二道闸,防止 gh-ost 自己把库压垮。
  • --postpone-cut-over-flag-file:最有用的一个参数。存量拷贝完成后不立即切换,而是一直挂着追增量,直到你删掉这个文件才做 cut-over。意味着你可以让它半夜跑完数据、白天你在场时才切表。
  • --panic-flag-file:紧急刹车。创建这个文件 gh-ost 立刻退出。
  • --allow-on-master:直接连主库跑。gh-ost 默认连从库更安全(拷贝压力落在从库),但需要有从库;本文场景是单机所以开了它。
  • --assume-rbr:确认 binlog_format=ROW,这样 gh-ost 不需要 SUPER 权限、也不会去 stop/start slave。

版本提示:下面这段帮助文本抄自 gh-ost 1.0.x,与新版有出入,其中两处以文档为准而不是这段文本:-max-lag-millis 的单位是毫秒(默认 1500 毫秒 = 1.5 秒,不是"1500s");-throttle-flag-file / -throttle-additional-flag-file 的效果是节流暂停,不是"操作立即停止"(立即停止的是 -panic-flag-file)。

gh-ost --help
-allow-master-master:
是否允许gh-ost运行在双主复制架构中,一般与-assume-master-host参数一起使用
-allow-nullable-unique-key:
允许gh-ost在数据迁移依赖的唯一键可以为NULL,默认为不允许为NULL的唯一键。如果数据迁移(migrate)依赖的唯一键允许NULL值,则可能造成数据不正确,请谨慎使用。
-allow-on-master:
允许gh-ost直接运行在主库上。默认gh-ost连接的从库。
-alter string:
DDL语句
-assume-master-host string:
为gh-ost指定一个主库,格式为”ip:port”或者”hostname:port”。在这主主架构里比较有用,或则在gh-ost发现不到主的时候有用。
-assume-rbr:
确认gh-ost连接的数据库实例的binlog_format=ROW的情况下,可以指定-assume-rbr,这样可以禁止从库上运行stop slave,start slave,执行gh-ost用户也不需要SUPER权限。
-chunk-size int:
在每次迭代中处理的行数量(允许范围:100-100000),默认值为1000。
-concurrent-rowcount:
该参数如果为True(默认值),则进行row-copy之后,估算统计行数(使用explain select count(*)方式),并调整ETA时间,否则,gh-ost首先预估统计行数,然后开始row-copy。
-conf string:gh-ost的配置文件路径。
-critical-load string:
一系列逗号分隔的status-name=values组成,当MySQL中status超过对应的values,gh-ost将会退出。-critical-load Threads_connected=20,Connections=1500,指的是当MySQL中的状态值Threads_connected>20,Connections>1500的时候,gh-ost将会由于该数据库严重负载而停止并退出。
-critical-load-hibernate-seconds int :
负载达到critical-load时,gh-ost在指定的时间内进入休眠状态。它不会读/写任何来自任何服务器的任何内容。
-critical-load-interval-millis int:
当值为0时,当达到-critical-load,gh-ost立即退出。当值不为0时,当达到-critical-load,gh-ost会在-critical-load-interval-millis秒数后,再次进行检查,再次检查依旧达到-critical-load,gh-ost将会退出。
-cut-over string:
选择cut-over类型:
atomic/two-step,atomic(默认)类型的cut-over是github的算法,two-step采用的是facebook-OSC的算法。
-cut-over-exponential-backoff
-cut-over-lock-timeout-seconds int:
gh-ost在cut-over阶段最大的锁等待时间,当锁超时时,gh-ost的cut-over将重试。(默认值:3)
-database string:
数据库名称。
-default-retries int:
各种操作在panick前重试次数。(默认为60)
-dml-batch-size int:
在单个事务中应用DML事件的批量大小(范围1-100)(默认值为10)
-exact-rowcount:
准确统计表行数(使用select count(*)的方式),得到更准确的预估时间。
-execute:
实际执行alter&migrate表,默认为noop,不执行,仅仅做测试并退出,如果想要ALTER TABLE语句真正落实到数据库中去,需要明确指定-execute
-exponential-backoff-max-interval int
-force-named-cut-over:
如果为true,则'unpostpone | cut-over'交互式命令必须命名迁移的表
-heartbeat-interval-millis int:
gh-ost心跳频率值,默认为500
-initially-drop-ghost-table:
gh-ost操作之前,检查并删除已经存在的ghost表。该参数不建议使用,请手动处理原来存在的ghost表。默认不启用该参数,gh-ost直接退出操作。
-initially-drop-old-table:
gh-ost操作之前,检查并删除已经存在的旧表。该参数不建议使用,请手动处理原来存在的ghost表。默认不启用该参数,gh-ost直接退出操作。
-initially-drop-socket-file:
gh-ost强制删除已经存在的socket文件。该参数不建议使用,可能会删除一个正在运行的gh-ost程序,导致DDL失败。
-max-lag-millis int:
主从复制最大延迟时间,当主从复制延迟时间超过该值后,gh-ost将采取节流(throttle)措施,默认值:1500s。
-max-load string:
逗号分隔状态名称=阈值,如:'Threads_running=100,Threads_connected=500'. When status exceeds threshold, app throttles writes
-migrate-on-replica:
gh-ost的数据迁移(migrate)运行在从库上,而不是主库上。
-nice-ratio float:
每次chunk时间段的休眠时间,范围[0.0…100.0]。0:每个chunk时间段不休眠,即一个chunk接着一个chunk执行;1:每row-copy 1毫秒,则另外休眠1毫秒;0.7:每row-copy 10毫秒,则另外休眠7毫秒。
-ok-to-drop-table:
gh-ost操作结束后,删除旧表,默认状态是不删除旧表,会存在_tablename_del表。
-panic-flag-file string:
当这个文件被创建,gh-ost将会立即退出。
-password string :
MySQL密码
-port int :
MySQL端口,最好用从库
-postpone-cut-over-flag-file string:
当这个文件存在的时候,gh-ost的cut-over阶段将会被推迟,数据仍然在复制,直到该文件被删除。
-skip-foreign-key-checks:
确定你的表上没有外键时,设置为'true',并且希望跳过gh-ost验证的时间-skip-renamed-columns ALTER
-switch-to-rbr:
让gh-ost自动将从库的binlog_format转换为ROW格式。
-table string:
表名
-throttle-additional-flag-file string:
当该文件被创建后,gh-ost操作立即停止。该参数可以用在多个gh-ost同时操作的时候,创建一个文件,让所有的gh-ost操作停止,或者删除这个文件,让所有的gh-ost操作恢复。
-throttle-control-replicas string:
列出所有需要被检查主从复制延迟的从库。
-throttle-flag-file string:
当该文件被创建后,gh-ost操作立即停止。该参数适合控制单个gh-ost操作。-throttle-additional-flag-file string适合控制多个gh-ost操作。
-throttle-query string:
节流查询。每秒钟执行一次。当返回值=0时不需要节流,当返回值>0时,需要执行节流操作。该查询会在数据迁移(migrated)服务器上操作,所以请确保该查询是轻量级的。
-timestamp-old-table:
在旧表名中使用时间戳。这会使旧表名称具有唯一且无冲突的交叉迁移。
-user string :MYSQL用户
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86

# 验证

跑之前先空跑一次。不加 --execute 时 gh-ost 只做检查和试算然后退出,这一步能提前发现「没有主键」「binlog 不是 ROW」「权限不足」这类问题:

/opt/gh-ost/bin/gh-ost --host=127.0.0.1 --port=3316 --database=test --table=b \
  --alter="engine=innodb" --user=root --password=<password> --verbose
# 不带 --execute = dry run
1
2
3

跑的过程中,gh-ost 每隔一段时间打一行进度,形如:

Copy: 4200000/8400000 50.0%; Applied: 1250; Backlog: 0/1000; Time: 12m30s(total), 12m10s(copy); ETA: 12m10s
1
  • Backlog 持续上涨说明增量追不上存量拷贝,业务写入太快,需要调小 --chunk-size 或直接放弃
  • 进度长时间不动,多半是在节流——日志里会写明是撞了 max-load 还是复制延迟

也可以随时通过它的 socket 交互查询:

echo status | socat - /tmp/gh-ost.test.b.sock
1

跑完之后,确认碎片确实降下来了:

SELECT table_name,
       ROUND(data_length/1024/1024, 2) AS data_mb,
       ROUND(data_free/1024/1024, 2)  AS free_mb,
       ROUND(data_free/(data_length+data_free)*100, 2) AS frag_pct
FROM information_schema.tables
WHERE table_schema = 'test' AND table_name = 'b';
1
2
3
4
5
6

预期 frag_pct 显著下降。同时确认行数没丢:

SELECT COUNT(*) FROM test.b;
1

再看一眼旧表还在不在(没加 --ok-to-drop-table 时它会保留成 _b_del):

SHOW TABLES LIKE '%_del';
1

确认业务正常后再手工删掉它,别急着在同一时刻删——万一发现问题,这张旧表是唯一的回退路径。

# 坑与边界

  • 表必须有主键或非空唯一键,否则 gh-ost 直接拒绝执行。无主键的大表要先加主键,而加主键本身又是一次整表重建——这是历史遗留表最难受的地方。

  • 需要约一倍的空闲磁盘。影子表是真实存在的一张新表,重建 100GB 的表就要另外 100GB。开始前先 df -h,中途磁盘满会留下一张半成品影子表要手工清理。

  • 不支持外键。表上有外键、或被别的表外键引用时,gh-ost 会拒绝(--skip-foreign-key-checks 只是跳过检查,不是支持——强行跳过会导致外键指向被删掉的旧表,务必不要用)。

  • 触发器也不支持。表上有触发器时 gh-ost 拒绝执行。

  • cut-over 的那一瞬间仍然要锁表。虽然只有毫秒到秒级,但如果此时有长事务持有该表的元数据锁,cut-over 会等待并重试(--cut-over-lock-timeout-seconds);重试次数用完就整个失败回滚。所以切换前要确认没有长事务:

    SELECT trx_id, trx_started, TIMESTAMPDIFF(SECOND, trx_started, NOW()) AS dur_s, trx_query
    FROM information_schema.INNODB_TRX ORDER BY trx_started;
    
    1
    2
  • 重建期间 binlog 会暴涨。整表数据会以 ROW 事件的形式再写一遍 binlog,重建 100GB 的表就产生约 100GB binlog,可能撑爆 binlog 磁盘、把从库延迟拉到几小时。做之前确认 binlog_expire_logs_seconds 与磁盘余量。

  • gh-ost 进程被杀掉后残留物要手工清:影子表 _b_gho、变更日志表 _b_ghc、以及 socket 文件。下次重跑前必须清理干净,否则会因表已存在而失败(--initially-drop-ghost-table 能自动清,但官方不建议开——它可能删掉另一个正在运行的 gh-ost 的影子表)。

  • OPTIMIZE TABLE 在从库上不会自动执行。gh-ost 的重建通过 binlog 传到从库,从库同样会重建一遍,延迟会明显上升。主从都要清碎片时这反而省事,但要预留延迟窗口。

#容量规划#MySQL
上次更新: 9/11/2026

← MySQL Router 实现读写分离 MySQL MGR配合MySQL-router实现innodb-cluster→

最近更新
01
DeepSeek Harness 实战 06|学习笔记:插件、工具、技能不在同一个维度上 原创
09-11
02
DeepSeek Harness 实战 05|让两个编码 Agent 共用一份长期记忆 原创
09-09
03
DeepSeek Harness 实战 04|学习笔记:从「已知限制」里读出三处设计张力 原创
09-08
更多文章>
Theme by Vdoing
  • 跟随系统
  • 浅色模式
  • 深色模式
  • 阅读模式