大数据技术概述
1.1 大数据时代
1.1.1第三次信息化浪潮
- 根据IBM前首席执行官郭士纳的观点,IT领域每隔十五年就会迎来一次重大变革

1.1.2信息科技为大数据时代提供技术支撑
-
- 存储设备容量不断增加
-
- CPU处理能力大幅提升
-
- 网络带宽不断增加
1.1.3数据产生方式的变革促成大数据时代的来临

1.2 大数据概念

1.2.1 数据量大
- 根据IDC作出的估测,数据一直都在以每年50%的速度增长,也就是说每两年就增长一倍(大数据摩尔定律)(已失效)
- 人类在最近两年产生的数据量相当于之前产生的全部数据量
- 预计到2020年,全球将总共拥有35ZB的数据量,相较于2010年,数据量将增长近30倍
1.2.2 数据类型繁多
- 大数据是由结构化和非结构化数据组成的
- 10%的结构化数据,存储在数据库中
- 90%的非结构化数据,它们与人类信息密切相关
- 应用:
- 科学研究:基因组;LHC 加速器;地球与空间探测
- 企业应用:Email、文档、文件;应用日志;交易记录
- Web 1.0数据:文本、图像、视频
- Web 2.0数据:查询日志/点击流、Twitter/ Blog / SNS、Wiki
1.2.3 处理速度快
- 从数据的生成到消耗,时间窗口非常小,可用于生成决策的时间非常少
- 1秒定律:这一点也是和传统的数据挖掘技术有着本质的不同
1.2.4 价值密度低
- 价值密度低,商业价值高
- 以视频为例,连续不间断监控过程中,可能有用的数据仅仅有一两秒,但是具有很高的商业价值
1.3 大数据的影响
- 图灵奖获得者、著名数据库专家Jim Gray 博士观察并总结人类自古以来,在科学研究上,先后历经了实验、理论、计算和数据四种范式
- 在思维方式方面,大数据完全颠覆了传统的思维方式:
- 全样而非抽样
- 效率而非精确
- 相关而非因果
1.4 大数据关键技术

- 两大核心技术

1.5 大数据计算模式
- 大数据计算模式及其代表产品

1.6 代表性大数据技术
1.6.1 Hadoop
-
Hadoop
- Hadoop生态系统

- Hadoop生态系统
-
Hadoop - MapReduce
- MapReduce将复杂的、运行于大规模集群上的并行计算过程高度地抽象到了两个函数:Map和Reduce
- 编程容易,不需要掌握分布式并行编程细节,也可以很容易把自己的程序运行在分布式系统上,完成海量数据的计算
- MapReduce采用“分而治之”策略,一个存储在分布式文件系统中的大规模数据集,会被切分成许多独立的分片(split),这些分片可以被多个Map任务并行处理
- MapReduce工作流程:

-
Hadoop - YARN
- YARN的目标就是实现“一个集群多个框架”
- 一个企业当中同时存在各种不同的业务应用场景,需要采用不同的计算框架
- MapReduce实现离线批处理
- 使用Impala实现实时交互式查询分析
- 使用Storm实现流式数据实时分析
- 使用Spark实现迭代计算
- 这些产品通常来自不同的开发团队,具有各

文章介绍了大数据时代背景,包括第三次信息化浪潮、技术支撑和数据产生方式变革。接着,详细阐述了大数据的概念,如数据量大、类型繁多、处理速度快和价值密度低的特点。然后,重点讨论了Spark的设计与运行原理,包括其与Hadoop的对比、生态系统、运行架构和RDD的核心概念。此外,还涵盖了Spark环境的搭建、使用方法以及RDD编程实践。

2493

被折叠的 条评论
为什么被折叠?



