楼上说得差不多了,我补一下先后顺序:
- 先啃 Failed Queries——executor 报错每秒上百这个才是真正打爆的源头,去 TiDB 日志里按错误码 grep,大概率慢 SQL 就藏在这批报错里。
- 再治 TiKV 负载不均:16.62 基本闲着、其他几台都打满,用 pd-ctl hot read/write 找热点 region 拆掉;表没加 AUTO_RANDOM 或 SHARD_ROW_ID_BITS 的加上。
- cop 高说明不少计算压在 TiKV 上,单实例的话 coprocessor 并发可以适当调大一点,但根子还是把慢 SQL 优化掉。
QPS 1.2K 不算高,先把上面三件事过一遍基本就能定位了~