SparkSQL DataFrame
sparksql DataFrame 定义:一种分布式的数据集,类似于二维表格(MySQL数据库中的数据表)
一、在pom.xml中导入一个相关的包
<dependency>
<groupId>org.scala-lang</groupId>
<artifactId>scala-library</artifactId>
<version>2.12.15</version>
</dependency>
<dependency>
<groupId>org.apache.spark</groupId>
<artifactId>spark-sql_2.12</artifactId>
<version>3.3.1</version>
</dependency>
二、创建一个csv文件

三、开始写代码
读取文件

四、案例
1. 筛选出quantity > 5 的记录(调用API来实现相关功能)

2.选出quantity > 2 的记录:调用SQL语句来实现相关功能


3449

被折叠的 条评论
为什么被折叠?



