集群scale-out后状态正常,但是grafana监控面板报错。

【TiDB 使用环境】
生产环境

【TiDB 版本】
8.5.5

【部署方式】
虚拟化部署

【操作系统/CPU 架构/芯片详情】
Rocky Linux release 9.6 (Blue Onyx)
INTEL(R) XEON(R) GOLD 6530

【机器部署详情】CPU大小/内存大小/磁盘大小
32C 128G 2TB

【集群数据量】
2TB

【集群节点数】
2tidb+3tikv+1tiflash 库容到 2tidb+4tikv +1tiflash

【问题复现路径】做过哪些操作出现的问题
grafana监控,cluster-Overview的面板,Storage capacity、Current storage size、Number of Regions报错。

跨版本问题源于优化器规则和存储引擎层变更。

集群扩容后监控多指标报错,可编辑面板查询语句,适配多节点时序数据,或者重新导入对应版本监控面板。试下呗

扩容后pd_cluster_status指标返回多条时序数据(多 TiKV/TiFlash 节点数据), Grafana 面板查询规则仅支持单条时序,引发展示报错;

原面板 SQL 查询逻辑仅适配单条时序,扩容新增 TiKV 节点后,pd_cluster_status 指标会按 store 维度拆分输出多条时序;单值面板无法接收多组时序数据,直接抛出展示报错。

如何解决此问题呢?

如何解决此问题呢??

仅供参考

可以解决,谢谢。

MySQL迁移注意自增主键,高并发写入集中在最后一个Region。

扩容新增 TiKV 后 Prometheus 未自动抓取新节点指标,面板存储、Region 相关监控无数据源而报错。

此话题已在最后回复的 7 天后被自动关闭。不再允许新回复。