2023年泰迪杯数据挖掘挑战赛B题完整数据分析与预测(5.针对完整数据的组合预测-机器学习+深度学习)

文章介绍了使用机器学习(如随机森林)和深度学习(LSTM)结合时间序列分析对泰迪杯数据进行商品需求预测的过程。首先,通过非线性回归的树模型建立预测基准,然后利用LSTM考虑时间序列信息,发现按周粒度预测能提高模型泛化能力。最终,通过线性加权组合两种模型的结果得到最终预测。

背景

==2023年泰迪杯完整数据最新出炉,博主根据最新完整数据对原来的预测方案进行了调整,采用机器学习+深度学习的组合预测来实现最终预测 ==

全部数据已经出炉,可以看出训练样本和预测样本都增加了十倍,这对于数据的处理复杂程度也有所增加。其实本道题最难的地方就是数据预处理,跑模型反而是最简单的。

1.先跑机器学习模型(不考虑时间序列)

在这里插入图片描述
检查变量之间相关性,无明显线性相关特征,因此考虑非线性回归模型来解决,

在这里插入图片描述

效果较好的主要还是传统的树模型,尤其在随机森林上有较好表现。下面是随机森林回归得到的重要特征排序。
在这里插入图片描述

利用效果较好的机器学习模型进行预测,并且保存预测结果作为预测基准结果。
在这里插入图片描述

2.深度学习-LSTM(考虑时间序列)

  • 数据预处理流程,按照预测数据集样本数将训练数据集分割成对应时间序列数据集
  • 循环训练模型进行预测
  • 组合预测,加权得到最终预测结果

按照商品code:20002按天维度预测的demo

下面是lstm模型训练随着训练轮次的损失函数收敛情况。

在这里插入图片描述

下面是在验证集上的拟合效果图:可以看出按照天的预测效果一般,但也进行了很好的拟合。
在这里插入图片描述
在这里插入图片描述
进一步开了按照周的时间粒度进行预测。

在这里插入图片描述
模型训练损失函数下降过程。
在这里插入图片描述
根据验证集对比效果可以看出,按照周的时间粒度预测,模型的泛化能力有所增强。这是因为按照周的时间预测可以保证大部分数据不会缺失,从而保证模型预测的合理性。
在这里插入图片描述
可以看出该商品在周的时间粒度上能够取得更好的预测效果。

最终将该商品未来三个月的商品需求预测出来,并且进一步建立组合预测模型尽心给处理,组合预测最简单的一种方式就是线性加权,以机器学习预测结果作为基准,考虑时间序列的深度学习进行加权,得到最终预测结果。

在这里插入图片描述
在这里插入图片描述

3.分享

有任何问题都可以私信我讨论
2023泰迪杯完整数据的源码和结果

评论 21
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

maligebilaowang

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值