现象
集群响应时间突增,同时伴随 cpu 使用率升高,导致集群整体性能下降。如下图:


排查
在此期间,做了操作系统服务及参数调整,其中比较可疑的配置为systemctl stop tuned.servce,即关闭了tuned服务。
1、检查/etc/tuned/目录下是否配置tuned.conf的文件(例如/etc/tuned/balanced-tidb-optimal/tuned.conf),未找到相关配置文件。
2、通过tuned-adm list 发现该配置设置为throughput-performance,且由于未启动tuned服务,导致该配置未生效。
解决方法
启动tuned服务(systemctl start tuned.service)后,throughput-performance 配置生效,集群性能恢复。

总结
Tuned 是一个系统级动态调优守护进程,基于插件式架构(cpu, vm, sysctl, disk 等)动态调整内核运行时参数。
经查询 redhat-tuned 手册 , throughput-performance(优化模式)配置会关闭各类节能机制,启用系统内核参数(sysctl)以提升磁盘、网络 IO 的吞吐性能,并切换至deadline I/O 调度器;同时将 CPU 调频策略设为performance(性能模式),tuned 服务关闭会降低服务器的处理性能。