Excel文件包括两个标签,一个是单体帆船,一个是双体帆船。在每个选项卡中,各栏都标有品牌、品种、长度(英尺)、地理区域、国家/地区/州、上市价格(美元)和年份(制造)。
	对于一个给定的品牌、变体和年份,除了所提供的Excel文件外,还有许多其他来源可以提供关于特定帆船特征的详细描述。你可以用你选择的任何其他数据来补充所提供的数据集;但是,你必须在你的建模中包括 "2023_MCM_Problem_Y_Boats.xlsx "的数据。请确保充分识别和记录所使用的任何补充数据的来源。

问题一

	建立一个数学模型,解释所提供的电子表格中每艘帆船的上市价格。**包括任何你认为有用的预测因素。**你可以利用其他资料来了解特定帆船的其他特征(如船宽、吃水、排水量、索具、帆面积、船体材料、发动机小时数、睡眠容量、净空、电子设备等),以及各年和各地区的经济数据。**标明并描述所有使用的数据来源。**包括**讨论你对每一种帆船的价格估计的精确度。**
	第一问需要分为三个小问,分别是搜集认为有用的数据,标明并描述数据来源后,以价格作为因变量建模,并讨论预测的精准度。

1.1搜集有用的数据

在这里插入图片描述
在这里插入图片描述
题目中所给的Variant变量已经详细描述了每个帆船的品牌,针对这些品牌和制造商可以从网络上查找帆船的其他信息。上图所示的是在外网通过帆船品牌所搜集到(开梯子)的信息,题目中所建议的“beam, draft, displacement, rigging, sail area, hull materials, engine hours, sleeping capacity, headroom, electronics, etc”均涉及了部分或全部,根据excel去重,Monohulled Sailboats共有398个不同的品牌,Catamarans共有111个不同的品牌。在没有已有的数据集的情况下,建议参赛队伍安排一个队员花费半天的时间对五百多个品牌一一查找。
(此后我们工作室会提供搜集好的数据,目前先用已有的数据进行算法演示)

1.2表明并描述所使用的数据来源

	利用查找到的数据,需要描述数据的来源,证明数据是准确可靠的。
	(我们工作室提供数据时会标记数据来源)

1.3数据预处理

在这里插入图片描述
在这里插入图片描述
在建模之前,首先要对原始数据进行预处理。根据上图所示,原始数据包含大量的字符串,仅length和year是数值型,其余的变量都无法直接带入数学模型进行建模。因此,我们需要将原始数据转换成机器学习算法中需要的格式。
**处理缺失值:**根据初步的统计分析,以Monohulled Sailboats数据集为例,在Country/Region/Stata中存在3条缺失值。 在这里插入图片描述
**处理异常值:**异常值存在两种情况,一种是人为标记数据的异常,另一种是与其他数据点显著不同的数据点。异常值可能会导致机器学习和统计模型存在一定问题,需要在建模之前进行筛选和处理。题目中可能出现异常值的地方就是Listing Price,需要注意预测值。
**标准化:**由于价格的数值存在较大的波动,使用标准化是一种常见的处理技术。通过将数据的平均值放缩为0,标准差放缩为1,不仅可以使数据摆脱量纲的影响,获得可比性,也可以提高算法性能,加快收敛速度,并提高自变量对因变量影响的可解释性。
以下是部分操作的完整思路
在这里插入图片描述

1.4建模预测价格,并解释精确度

	考虑到第二问需要“解释区域对上市价格的影响”,第一问对价格预测的模型就尤为重要。从统计、可解释性强等方面来考虑,可以选择使用多元线性回归分析;从机器学习、高性能的角度考虑,可以选用XGBoost、AdaBoost、LightGBM等集成模型或是BP神经网络来训练。
	在建模的过程中,需要着重注意模型建立、模型训练、模型检验、性能度量的过程完整。在使用统计模型中,需要有明确详细的统计检验过程,并且给出参数估计的值和置信区间。在使用机器学习模型时,需要注意性能度量的标准,数据集的划分,超参数的调节等问题。只有完整的建模才有望拿到高分,更加容易获奖。

2.问题二

	用你的模型来解释**区域对上市价格**的影响(如果有的话)。**讨论任何区域性的影响是否在所有帆船变体中都是一致的。**讨论**任何区域效应的实际和统计意义。**

2.1区域对上市价格的影响

	Monohulled Sailboats数据集中区域共有73个不同的取值,Catamarans中则有52个。解释区域对价格的影响,一般有两种方法。
	第一是利用回归分析的回归系数,在经过标准化后,可以直观反映自变量对因变量的影响程度。第二是利用树模型的特征重要下,例如XGBoost会利用增益来表示特征对因变量的影响程度大小。

	**接下来是完整思路的部分展示**
	![在这里插入图片描述](https://img-blog.csdnimg.cn/27c753f80dc3437c8ce84bdb17c9fddf.png#pic_center)

在这里插入图片描述

问题三

	讨论一下你对给定的地理区域的建模对香港(特区)市场有什么用。从提供的电子表格中选择一个信息量大的帆船子集,分为单体船和双体船。**从香港(特区)市场找到该子集的可比上市价格数据。**如果有的话,模拟香港(特区)对你子集中的每艘帆船价格的**区域影响是什么。对双体船和单体船的影响是否相同?**

3.1从香港特区市场自己搜集上市价格数据

在这里插入图片描述
如上图所示,在外网中能搜索到香港特区的帆船价格,对应数据集中make和Variant后,可以扩充数据集,得到问题三的数据。
在这里插入图片描述

问题四

	识别并讨论你的团队从数据中得出的任何其他有趣的、有信息量的推论或结论。
	本题目较为开放,通常来说需要重新回顾我们的研究问题,仔细思考每个变量是否还有值得挖掘的信息。在前三小问中,我们建立回归模型、分析自变量对因变量的影响、分析交互作用、搜集新数据分析…...除此之外,根据题目本身的信息以及我们搜集到的数据,我们还可以从以下几个角度进行切入:
	**接下来是完整思路的部分展示**

在这里插入图片描述

问题五

	为香港(特区)的帆船经纪人准备一份一到两页的报告。包括一些精心选择的图形,以帮助经纪人理解你的结论

	本题注意的要点不多,一般注意以下几条即可:
	题目要求的是report,同时题目明确指出需要图表,因此请将建模过程中比较重要的结论性图标放在report中
	最好写满25页,报告后只留一页写参考文献,报告写满两页为佳。

后续详细思路获取方式可进QQ群了解:784396893
或直接购买链接:
https://mbd.pub/o/bread/mbd-ZJeUmZZq

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐