说明:平凯数据库是平凯星辰企业级分布式HTAP数据库,兼容MySQL协议,采用**PD(调度)+TiDB(计算)+TiKV(存储)**存算分离架构,支持Raft多副本,自带TEM运维平台、Tiup集群管理工具,本手册面向生产环境日常运维、巡检、备份、故障处置、安全管理。
一、架构简介
- PD:集群元数据管理、全局时间戳、数据分片调度、负载均衡,集群核心控制点,一般部署3节点保证高可用。
- TiDB Server:计算层,接收SQL、解析、生成执行计划,无状态,可横向扩缩,对外提供MySQL协议端口。
- TiKV:分布式存储引擎,数据按Region分片,Raft协议3副本存储,负责事务、MVCC、行锁。
- TiFlash(可选):列式存储,用于HTAP实时分析负载。
- 监控组件:Prometheus+Grafana,Dashboard;企业版配套TEM可视化运维平台,支持集群管理、告警、备份、巡检。
运维核心要点:TiDB无状态,TiKV是数据载体,PD管理元数据;节点故障自动Raft主从切换,少数副本故障业务不中断。
二、环境基线与操作系统前置规范
- OS:推荐Linux(CentOS/银河麒麟/UOS),关闭swap分区,swap开启会严重拖垮TiKV性能;
- 文件系统:TiKV数据盘使用EXT4,挂载参数增加
barrier=0; - 时间同步:所有节点NTP时间严格同步,时间漂移会造成事务、TS时间戳异常;
- 系统参数:文件句柄nofile调大,关闭透明大页transparent_hugepage;
- 网络:节点间内网低延迟,推荐万兆网卡,PD/TiKV节点之间网络丢包会直接影响Raft复制。
三、集群生命周期管理(Tiup / TEM平台)
1. 集群部署
使用tiup部署,编写topology.yaml拓扑文件,中控机执行tiup cluster deploy;企业版推荐TEM平台可视化一键部署。
# 集群状态查看
tiup cluster display pkdb-cluster
# 启停集群
tiup cluster start pkdb-cluster
tiup cluster stop pkdb-cluster
2. 扩缩容
- 扩容:新增TiDB/PD/TiKV节点,tiup scale-out,PD自动调度Region分片,在线无感,不中断业务;
- 缩容:TiKV缩容会自动迁移Region,必须等待迁移完成再下线节点,禁止直接关机。
3. 版本升级
优先滚动升级,业务不中断;遵循PD→TiKV→TiDB顺序;升级前全量备份,准备回滚预案;TEM平台支持可视化灰度升级。
四、日常巡检(每日/每周)
每日巡检项
- 集群组件状态:PD、TiDB、TiKV全部Up,无Offline节点;Dashboard查看Region健康,无missing/down副本。
- 监控指标:CPU、内存、磁盘使用率、磁盘IO、网络延迟;TiKV写入流量、Raft日志复制延迟。
- 业务指标:QPS、连接数、慢查询、事务失败率、锁等待时长。
- 磁盘预警:预留至少20%空闲空间,TiKV磁盘满会触发写入阻塞。
每周巡检
- 检查Region均衡状态,确认调度正常,无长时间pending迁移任务;
- 慢SQL审计,优化大事务、全表扫描、不合适的DDL;
- 备份任务校验,验证备份文件可恢复;
- 安全巡检:账号权限、审计日志、漏洞版本核查。
五、备份与恢复(生产必备)
平凯数据库推荐两种备份方案:BR(Backup & Restore)分布式快照备份(首选)、dumpling逻辑导出。
- BR(物理快照):适合大集群,速度快,在线备份,几乎不影响业务;基于Raft快照,支持全量、增量备份。
备份前提:集群Region健康,无副本缺失。
- Dumpling:逻辑导出,兼容mysqldump,适合小库、迁移、逻辑校验,大库速度慢。
- 恢复:BR恢复支持按库/表恢复;恢复前确认目标集群为空,避免数据覆盖。
备份策略:每日全量BR备份,备份文件异地存储;定期执行恢复演练,验证备份有效性。
六、参数调优(核心组件)
TiDB(计算层)
tidb_mem_quota_query:单SQL内存上限,防止大SQLOOM;tidb_slow_log_threshold:慢查询阈值,默认300ms,按需调整;max_connections:数据库最大连接。
TiKV(存储层)
storage.block-cache.capacity:TiKV数据页缓存,推荐服务器内存50%左右;raftstore相关参数:Raft复制、快照生成、Region大小(默认96MB);- 控制compaction(分层合并)IO,业务高峰避免大量合并抢占IO。
注意:平凯数据库参数可在线动态set global修改,部分底层参数需要重启TiKV/TiDB节点。
七、故障排查与应急处置
- TiKV节点宕机:Raft自动选主,3副本场景单节点宕机业务持续运行;后台自动补副本,等待副本补齐再做节点修复。
- PD节点故障:PD三节点集群,单节点宕机不影响;超过半数PD故障,集群元数据不可写入,业务阻断。
- Region副本丢失:Dashboard查看Region状态,优先排查网络、磁盘;严重场景使用
pd-ctl做Region恢复。 - 慢SQL/锁等待:通过TiDB Dashboard查看慢查询、事务视图,定位长事务(长事务会占用MVCC版本,造成空间暴涨);生产禁止长时间未提交的大事务。
- 磁盘满:立即停止大写入,清理过期快照、垃圾版本;不要直接删除TiKV数据目录。
重要红线:禁止直接手动删除TiKV数据文件;不要随意修改PD元数据,操作前联系原厂支持。
八、安全管理
- 账号管理:最小权限原则,业务账号只分配DML权限,禁止业务账号DDL权限;定期清理闲置账号,定期轮换密码。
- 审计:开启数据库审计,记录登录、DDL/DML操作,日志留存满足合规要求。
- 网络安全:数据库端口只允许业务服务器访问,防火墙限制源IP;传输开启TLS加密。
- 漏洞管理:定期版本漏洞扫描,按照官方安全公告执行补丁升级,高危漏洞优先低峰窗口修复。
九、运维禁忌与最佳实践
- 禁止关闭Raft副本、随意修改副本数量;
- 避免业务高峰执行DDL,TiDB在线DDL虽然无锁,但大量DDL会占用集群资源;
- 控制事务大小,禁止超大事务(千万行级一次性写入),拆分为小批量;
- 定期监控MVCC版本,长事务会造成垃圾版本堆积,磁盘持续上涨;
- 重要变更(扩容、升级、参数大调整)必须提前窗口评估、备份、准备回滚方案。
十、运维工具清单
- tiup:集群生命周期管理(部署、启停、扩缩容、升级)
- br:分布式备份恢复
- dumpling:逻辑导出;lightning:高速数据导入
- pd-ctl:PD元数据查看、Region运维
- Grafana + TiDB Dashboard:监控、性能诊断、慢SQL
- TEM平台(企业版):统一可视化运维、告警、巡检