请问一下,如果用br log去进行增量备份,那么br log 的状态怎么监控呢
自己写脚本肯定是可以的,官方有什么推荐的方式嘛,好像没有到prometheus 监控里面吧
TiDB 官方提供了 BR 相关的 Prometheus 指标,可通过 Grafana 可视化监控,并配置告警规则
核心指标有:tidb_br_log_backup_checkpoint_ts、tidb_br_log_backup_error_count、tidb_br_log_backup_speed_bytes、tidb_br_log_backup_running
这个好像是没有告警策略的
granafa监控是可以自己添加告警的,但是比较麻烦,默认的图表监控中使用了模版变量,granafa告警不支持,需要自己修改这个Dashboard 的 json
一层看任务状态,另一层看 Grafana 指标。
最直接的是先用命令看任务是否正常运行:
tiup br log status --task-name=<task_name> --pd <pd_ip>:2379
这个命令会返回任务的关键信息,包括:
status:任务状态,常见有 NORMAL、PAUSED、ERROR
checkpoint[global]:当前全局检查点
speed(est.):估算传输速度
storage:备份存储位置
其中最重要的是 checkpoint[global]。
它表示当前日志备份已经推进到哪个时间点,PITR 只能恢复到这个时间点之前。官方文档就是这样定义的。
例如输出里如果看到:
status: ● NORMAL
checkpoint[global]: 2026-03-18 10:30:00 +0800; gap=20s
说明任务正常,且日志备份落后当前时间大约 20 秒。gap 越小通常越好;如果持续变大,就要排查。
除了命令行,官方还建议在 Grafana 的 TiKV-Details > Backup Log 面板看监控。这个面板可以观察日志备份过程中的监控数据;而命令里显示的 speed(est.) 只是一个近几秒的估算值,更准确的流量统计建议看 Grafana。
还得看看官网关于这个br工具的参数介绍才能确定怎么获取具体的数据信息啊
好的。

