NiceFlow是一个类似Kettle数据ETL工具,同时比Kettle更加易用和轻量,目前还没有GUI界面
1. git地址
2. 特性
- 基于python的插件机制,目前提供70+插件,同时支持自定义插件
- 基于json的flow任务,支持自定义任务配置
- 提供好用的cli命令,无需写代码,完成数据分析工作
3. 安装依赖
pip install NiceFlow
4. MySQL数据全量/增量/按天分区同步HDFS(Hive)实战
4.1. 说明
NiceFlow 数据同步,只需要配置一个json文件,配置好后,执行任务即可,无需写任何代码,网上数据同步的工具非常多,NiceFlow和这些工具有非常多相似的地方,下面列举一些常用的数据同步工具
- SeaTunnel 基于java,更新非常活跃,使用较为简单,支持的特性比较丰富,博主比较看好的一个数据同步工具
- DataX 插件基于java,调用基于python,更新不活跃,执行速度较快,数据清洗转换插件较少,目前正在使用的同步工具
- Kettle kettle是博主最开始用的数据同步工具,开发过一些kettle的插件,kettle的问题点是缺失任务调度,插件开发复杂,在linux上运行较费内存,高级特性文档不够丰富,任务多了,容易让人崩溃,因为使用kettle的时候博主还是个菜鸟,使用kettle出现的各种坑爹的问题给博主造成了不小的精神上的伤害,因此博主想开发一个更加好用的数据ETL的工具,让大家轻松完成各种ETL任务。
- Sqoop 基于java,未更新,依赖 Hadoop MR 实现分布式,仅支持 MySQL、Oracle、DB2、Hive、HBase、S3 等几种数据源,使用较少
- Flume 基于java,更新不活跃,使用较少
4.2. 全量同步
下面是MySQL数据全量同步HDFS(Hive)的配置
{
"flow": {
"name": "",
"uid": "",
"param": {
}
},
"nodes": [
{
"id": "MySQLInput",
"name": "read1",
"type": "input",
"properties": {
"host": "127.0.0.1",
"port": 3306,
"username": "root",
"password":


1780

被折叠的 条评论
为什么被折叠?



