扫一扫加入大数据公众号和技术交流群,了解更多大数据技术,还有免费资料等你哦
目录
二、 Flink 相比传统的 Spark Streaming 有什么区别?
十一、Flink的并行度了解吗?Flink的并行度设置是怎样的?
十二、Flink的Slot和parallelism有什么区别?
二十、Flink Table & SQL 熟悉吗?TableEnvironment这个类有什么作用
二十、Flink SQL的实现原理是什么? 是如何实现 SQL 解析的呢?
第一部分:Flink 中的核心概念和基础考察
一、 简单介绍一下 Flink
Flink 是一个框架和分布式处理引擎,用于对无界和有界数据流进行有状态计算。并且 Flink 提供了数据分布、容错机制以及资源管理等核心功能。
Flink提供了诸多高抽象层的API以便用户编写分布式任务:
- DataSet API, 对静态数据进行批处理操作,将静态数据抽象成分布式的数据集,用户可以方便地使用Flink提供的各种操作符对分布式数据集进行处理,支持Java、Scala和Python。
- DataStream API,对数据流进行流处理操作,将流式的数据抽象成分布式的数据流,用户可以方便地对分布式数据流进行各种操作,支持Java和Scala。
- Table API,对结构化数据进行查询操作,将结构化数据抽象成关系表,并通过类SQL的DSL对关系表进行各种查询操作,支持Java和Scala。
此外,Flink 还针对特定的应用领域提供了领域库,例如:
Flink ML,Flink 的机器学习库,提供了机器学习Pipelines API并实现了多种机器学习算法。
Gelly,Flink 的图计算库,提供了图计算的相关API及多种图计算算法实现。
根据官网的介绍,Flink 的特性包含:
<
本文详细介绍了Flink的核心概念和基础面试题,涵盖Flink与Spark Streaming的区别、组件栈、是否依赖Hadoop、集群规模、编程模型、角色与作用、常用算子、分区策略、并行度、Slot与parallelism、重启策略、分布式缓存、广播变量、窗口机制、状态存储、时间概念、水印机制、Table API与SQL支持等。内容深入浅出,适合Flink学习者和开发者巩固基础知识和准备面试。

订阅专栏 解锁全文
155

被折叠的 条评论
为什么被折叠?



