set spark.sql.autoBroadcastJoinThreshold=-1;
set spark.sql.shuffle.partitions=1000;
set spark.sql.files.maxPartitionBytes=536870912;
set spark.sql.files.openCostInBytes=4194304;
set spark.sql.adaptive.shuffle.targetPostShuffleInputSize=134217728;
set hive.hadoop.supports.splittable.combineinputformat=true;
set hive.new.job.grouping.set.cardinality=128;
set mapreduce.input.fileinputformat.split.maxsize=536870912;
set mapreduce.input.fileinputformat.split.minsize=536870912;
set mapreduce.input.fileinputformat.split.minsize.per.node=536870912;
set mapreduce.input.fileinputformat.split.minsize.per.rack=536870912;
本文详细介绍了如何通过调整Spark SQL与Hive的相关参数来优化大数据处理性能,包括设置广播连接阈值、shuffle分区数、文件读取大小等关键配置。

1501

被折叠的 条评论
为什么被折叠?



