【求助大佬】CDC同步卡住,状态正常,重启TiKV才能恢复

【 TiDB 使用环境】生产环境
【 TiDB 版本】V7.5.3
【复现路径】
【遇到的问题:问题现象及影响】
TiCDC任务卡住,tso、checkpoint不动,状态是normal,error是null,暂停、继续任务不能恢复,重启cdc日志里报错最多的TiKV节点后恢复
【资源配置】进入到 TiDB Dashboard -集群信息 (Cluster Info) -主机(Hosts) 截图此页面
【附件:截图/日志/监控】




接收region报错,其他地方没有啥报错啊

看着像Region Leader 异常

估计又是bug导致的

有什么方法能查到是卡到哪里了吗,或者卡住的时间是哪些表的数据变更比较多

你这处理方法不是已经查到卡在哪里了么。
下次遇到就还用这种方法吧:查看日志,异常多的 tikv 节点,重启下。

推荐可以考虑升级到 7.5.7 看看稳定性是否有提升。

大佬,没有查到根本原因,不知道为什么,现在是每次都得重启tikv

对啊 所以让你试试升级到 757 可能解决。看起来是遇到 bug 了。

可能源于 TiKV 区域(region)不可用、拉取变更日志阻塞,或 TiCDC 与特定 TiKV 节点的 gRPC 连接异常,而非任务本身报错。‌

多为 TiKV Region 扫描线程卡死、raft 日志阻塞,CDC 拉取变更无进度。
优化 TiKV readpool/raft 参数、清理堆积 region,临时方案重启故障 TiKV 节点恢复同步。

状态 normal 只表示 changefeed 未进入 failed,不代表 eventfeed 正在推进;重启某个 TiKV 后恢复,更像该节点的 CDC endpoint/gRPC 流或部分 Region 卡住,但仅凭截图不能定性。下次卡住时先保留现场:查询 changefeed 的 resolved-ts/checkpoint-ts,找出不推进的 Region/processor,并在 CDC 日志中按 event feedregionrequest timed outnot leader 检索,同时对齐该 TiKV 的日志和 gRPC/raftstore 指标。生产上不应把重启 TiKV 当长期方案,建议先升级到 v7.5 最新补丁版本并核对 TiCDC/TiKV 修复项;若复现,提交首次异常前后的 CDC、TiKV 日志和 changefeed 配置。

通常是因为该 TiKV 节点陷入了以下某种“假死”或阻塞状态