数据挖掘:SPSS Statistics与SPSS Modeler的对比与应用
1. 引言
在当今数据驱动的时代,预测分析变得至关重要。虽然我们很多人在统计方面有一定基础,但在预测分析中,借鉴计算机科学、知识发现和机器学习领域的技术是很有必要的。不过,这并不意味着我们必须使用专门的数据挖掘工具,实际上,SPSS Statistics也能完成很多数据挖掘任务。本文将探讨三个关键问题:什么是数据挖掘,它与统计学有何不同;SPSS Modeler数据挖掘工作台是什么;能否在SPSS Statistics中有效地执行数据挖掘任务。
2. 数据挖掘的定义
数据挖掘利用在正常业务过程中积累的历史数据,涉及选择、准备和分析数据,发现并确认先前未知的模式,构建预测模型,并将这些模型应用于当前数据。以下是对该定义各要素的详细阐述:
- 历史数据 :数据挖掘需要已获得感兴趣结果的数据。由此得到的模型随后应用于结果未知但可预测的新数据。
- 正常业务过程 :在统计学中,通常先有假设,然后设计实验来收集能验证假设的数据。而数据挖掘的数据是为了业务运营而收集的,并非用于实验。
- 选择和准备 :人们常认为数据挖掘是对所有可用数据进行分析,算法会自动搜索模式,这是错误的。数据挖掘通常只针对数据的一小部分进行,这部分数据与业务问题相关。
- 先前未知的模式 :数据挖掘不是凭直觉探索数据以确认预感,也不同于假设检验。它是系统地搜索能为业务带来价值的模式,若没有意外发现,那将是令人失望的,但这种情况很少见。
-
超级会员免费看
订阅专栏 解锁全文

3580

被折叠的 条评论
为什么被折叠?



