在做一些酒店产量分析时,用到统计学中常用的分位数函数,所以就学习了一下分位数函数在HIVE中的应用。
HIVE中有两个关于分为数的函数:percentile和percentile_approx。
使用方式:
percentile:percentile(col, p) col是要计算的列(值必须为int类型),p的取值为0-1,若为0.2,那么就是2分位数,依次类推。
percentile_approx:percentile_approx(col, p)。列为数值类型都可以。
percentile_approx还有一种形式percentile_approx(col, p,B),参数B控制内存消耗的近似精度,B越大,结果的精度越高。默认值为10000。当col字段中的distinct值的个数小于B时,结果就为准确的百分位数。
如果需要多个分位数,可以一次性取出来,案例如下:
去每天的UV的第二个十分位数、第四个十分位数,第六个十分位数、第八个十分位数:
select d,
percentile_approx(uv, array(0.2,0.4,0.6,0.8), 9999) as uv --2%分位数作为最小值
from aa
group by d
结果如下:


在酒店产量分析中,学习了分位数函数在HIVE中的应用。HIVE有percentile和percentile_approx两个分位数函数,介绍了它们的使用方式,包括参数要求等,还提及可一次性取出多个分位数用于分析。
&spm=1001.2101.3001.5002&articleId=82185576&d=1&t=3&u=7041a2c908da46cb93e40380f87b9ecb)
2483

被折叠的 条评论
为什么被折叠?



