一般情况下对于CSV格式文件数据,有多种第三方SerDer来处理。本文采用CSVSerDe:
一、添加第三方SerDe
首先在Hive classpath中添加第三方SerDe JAR包,命令如下:
hive> add jar /home/hadoopUser/cloud/hive/apache-hive-0.13.1-bin/lib/csv-serde-1.1.2.jar;
Added /home/hadoopUser/cloud/hive/apache-hive-0.13.1-bin/lib/csv-serde-1.1.2.jar to class path
Added resource: /home/hadoopUser/cloud/hive/apache-hive-0.13.1-bin/lib/csv-serde-1.1.2.jar
可以从该链接下载:csv-serde-1.1.2.jar,以某CSV文件为例介绍处理过程
二、某CSV日志文件格式如下:
1997,Ford,E350,"ac, abs, moon",3000.00
1999,Chevy,"Venture ""Extended Edition""","",4900.00
1999,Chevy,"Venture ""Extended Edition, Very Large""","",5000.00
1996,Jeep,Grand Cherokee,"MUST SELL!air, moon roof, loaded",4799.00以逗号分隔,分别表示:年,制造商,型号,说明,价值

本文介绍了如何使用Hive配合CSVSerDe处理CSV格式的文件数据。首先,需要将csv-serde-1.1.2.jar添加到Hive的classpath中。然后,通过示例展示了一种CSV日志文件的格式,并说明了创建对应Hive表的步骤。

2268

被折叠的 条评论
为什么被折叠?



