单区域多 AZ 部署集群,tikv节点替换空间不回收

【TiDB 使用环境】生产环境
【TiDB 版本】v7.5.7
【遇到的问题:问题现象及影响】
单区域多 AZ 部署集群,tikv节点总计15个,三个可用区【A\B\C】部署,每个可用区均为5个节点。
其中A可用区有2个tikv节点存在宿主机风险,A区新增2个同时剔除有问题的2个tikv节点。
新增的2个tikv节点,region和磁盘使用量一直在增长,而剔除的2个tikv节点,region数量一直在减少,但空间使用率一直没有发生变化。
单AZ部署的集群,tikv节点替换没有该问题。



都已经是Tombstone状态,ECS容量还是不变


相同版本的集群,如果是单可用区部署,发起节点替换后,被替换的tikv节点容量随着region迁移会慢慢变少。当tikv节点变成Tombstone后,磁盘占用量就归0了。

看截图确认是Tombstone状态了,但空间不回收大概率是以下原因:

  1. PD调度限制:检查 pd-ctl config show 里的 max-store-down-timeleader-schedule-limit 等参数,确认旧节点下线后region迁移是否完成。如果还有大量leader或peer残留,用 pd-ctl operator show 查看。

Tombstone 只表示 PD 已摘除该 store,RocksDB 的 SST 不会随 region 迁走自动删掉,所以磁盘占用可以一直不变。多 AZ 下 placement rule 常让副本优先留在本 AZ,迁出更慢,空间回收也更不明显。先确认 tombstone store 上 region 已到 0,用 pd-ctl store remove-tombstone 清掉记录;空间仍不降就对残留数据目录做 compact,或确认无副本后直接销毁该节点数据目录再释放云盘。单 AZ 往往迁得更快,看起来像“没有这个问题”。新增节点涨空间是在接副本,属于预期。

当前待剔除 TiKV 节点状态为Pending Offline,Region 已经基本迁走,但磁盘占用始终不变。

同版本单可用区部署的集群,发起节点替换后,当tikv节点变成Tombstone后,磁盘占用量就归0了。

leader和region都已经归0了



相同版本的集群,如果是单可用区部署,发起节点替换后,被替换的tikv节点容量随着region迁移会慢慢变少。当tikv节点变成Tombstone后,磁盘占用量就归0了。

相同版本的集群,如果是单可用区部署,发起节点替换后,被替换的tikv节点容量随着region迁移会慢慢变少。当tikv节点变成Tombstone后,磁盘占用量就归0了。

能 tombstone 就是下线成功了。
手动清理就行

对的,手动清理