Flink Checkpoint 问题排查实用指南

巴蜀真人 2019-09-16

阿里云实时计算专项

作者:邱从贤(山智)

在 Flink 中,状态可靠性保证由 Checkpoint 支持,当作业出现 failover 的情况下,Flink 会从最近成功的 Checkpoint 恢复。在实际情况中,我们可能会遇到 Checkpoint 失败,或者 Checkpoint 慢的情况,本文会统一聊一聊 Flink 中 Checkpoint 异常的情况(包括失败和慢),以及可能的原因和排查思路。

1. Checkpoint 流程简介

首先我们需要了解 Flink 中 Checkpoint 的整个流程是怎样的,在了解整个流程之后,我们才能在出问题的时候,更好的进行定位分析。

flink_checkpoint.jpg

从上图我们可以知道,Flink 的 Checkpoint 包括如下几个部分:

  • JM trigger checkpoint
  • Source 收到 trigger checkpoint

登录 后评论
下一篇
corcosa
12295人浏览
2019-10-08
相关推荐
G7在实时计算的探索与实践
607人浏览
2019-04-26 14:08:25
0
0
1
3041