数据中台怎么选型?终于有人讲明白了

ac7e1113af79f30aca2b08bd57e59c37.gif

ed624c79e87cdc32fd97e7ec8595acff.png

导读:数据中台选型主要包括数据仓库选型、调度平台选型、BI工具选型3个方面,好的工具可以大幅提升开发效率,降低运维工作量。

46d58e73572fcc3228463365c4882726.png

150680629e352305cc9ef43ce28d8d0e.png

01

数据仓库选型

数据仓库选型是整个数据中台项目的重中之重,是一切开发和应用的基础。而数据仓库的选型,其实就是Hive数仓和非Hive数仓的较量。Hive数仓以Hive为核心,搭建数据ETL流程,配合Kylin、Presto、HAWQ、Spark、ClickHouse等查询引擎完成数据的最终展现。而非Hive数仓则以Greenplum、Doris、GaussDB、HANA(基于SAP BW构建的数据仓库一般以HANA作为底层数据库)等支持分布式扩展的OLAP数据库为主,支持数据ETL加工和OLAP查询。

自从Facebook开源Hive以来,Hive逐渐占领了市场。Hive背靠Hadoop体系,基于HDFS的数据存储,安全稳定、读取高效,同时借助Yarn资源管理器和Spark计算引擎,可以很方便地扩展集群规模,实现稳定地批处理。Hive数据仓库的优势在于可扩展性强,有大规模集群的应用案例,受到广大架构师的推崇。

虽然Hive应用广泛,但是其缺点也是不容忽视的。

Hive的开源生态已经完全分化,各大互联网公司和云厂商都是基于早期的开源版本进行个性化修改以后投入生产使用的,很难再回到开源体系。Hive现在的3个版本方向1.2.x、2.1.x、3.1.x都有非常广泛的应用,无法形成合力。

开源社区发布的Hive版本过于粗糙,漏洞太多。最典型的就是Hive 3.1.0版本里面的Timestamp类型自动存储为格林尼治时间的问题,无论怎么调整参数和系统变量都不能解决。据HDP官方说明,需要升级到3.1.2版才能解决。根据笔者实际应用的情况,Hive 3.1.2版在大表关联时又偶尔出现inert overwrite数据丢失的情况。

Hive最影响查询性能的计算引擎也不能让人省心。Hive支持的查询引擎主要有MR、Spark、Tez。MR是一如既往的性能慢,升级到3.0版也没有任何提升。基于内存的Spark引擎性能有了大幅提升,3.x版本的稳定性虽然也有所加强,但是对JDBC的支持还是比较弱。基于MR优化的Tez引擎虽然是集成最好的,但是需要根据Hadoop和Hive版本自行编译,部署和升级都十分复杂。

Hive对更新和删除操作的支持并不友好,导致在数据湖时代和实时数仓时代被迅速抛弃。

Hive的查询引擎也很难让用户满意,最典型的就是以下查询引擎。

1)Spark支持SQL查询,需要启动Thrift Server,表现不稳定,查询速度一般为几秒到几分钟。

2)Impala是CDH公司推出的产品,一般用在CDH平台中,查询速度比Spark快,由于是C++开发的,因此非CDH平台安装Impala比较困难。

3)Presto和Hive一样,也是Facebook开源的,语法不兼容Hive,查询速度一般为几秒到几分钟。

4)Kylin是国人开源的MOLAP软件,基于Spark引擎对Hive数据做预算并保存在Hbase或其他存储中,查询速度非常快并且稳定,一般在10s以下。但是模型构建复杂,使用和运维都不太方便。

5)ClickHouse是目前最火的OLAP查询软件,特点是查询速度快,集成了各大数据库的精华引擎,独立于Hadoop平台,需要把Hive数据同步迁移过去,提供有限的SQL支持,几乎不支持关联操作。

以Hadoop为核心的Hive数据仓库的颓势已经是无法扭转的了,MapReduce早已被市场抛弃,HDFS在各大云平台也已经逐步被对象存储替代,Yarn被Kubernetes替代也是早晚的事。

我们把视野扩展到Hive体系以外,就会发现MPP架构的分布式数据库正在蓬勃发展,大有取代Hive数仓的趋势。

其中技术最成熟、生态最完善的当属Greenplum体系。Greenplum自2015年开源以来,经历了4.x、5.x、6.x三个大版本的升级,功能已经非常全面和稳定了,也受到市场的广泛推崇。基于Greenplum提供商业版本的,除了研发Greenplum的母公司Pivotal,还有中国本地团队的创业公司四维纵横。此外,还有阿里云提供的云数据库AnalyticDB for PostgreSQL、百度云FusionDB和京东云提供的JDW,都是基于Greenplum进行云化的产品。华为的GaussDB在设计中也参考了Greenplum数据库。

OLAP查询性能最强悍的当属SAP商业数据库HANA,这是数据库领域当之无愧的王者。HANA是一个软硬件结合体,提供高性能的数据查询功能,用户可以直接对大量实时业务数据进行查询和分析。

HANA唯一的缺点就是太贵,软件和硬件成本高昂。HANA是一个基于列式存储的内存数据库,主要具有以下优势。

  • 把数据保存在内存中,通过对比我们发现,内存的访问速度比磁盘快1000000倍,比SSD和闪存快1000倍。传统磁盘读取时间是5ms,内存读取时间是5ns。

  • 服务器采用多核架构(每个刀片8×8核心CPU),多刀片大规模并行扩展,刀片服务器价格低廉,采用64位地址空间—单台服务器容量为2TB,100GB/s的数据吞吐量,价格迅速下降,性能迅速提升。

  • 数据存储可以选择行存储或者列存储,同时对数据进行压缩。SAP HANA采用数据字典的方法对数据进行压缩,用整数代表相应的文本,数据库可以进一步压缩数据和减少数据传输。

百度开源的Doris也在迎头赶上,并且在百度云中提供云原生部署。Apache Doris是一款架构领先的MPP分析型数据库产品,仅须亚秒级响应时间即可获得查询结果,高效支持实时数据和批处理数据。Apache Doris的分布式架构非常简洁,易于运维,并且支持10PB以上的超大数据集,可以满足多种数据分析需求,例如固定历史报表,实时数据分析,交互式数据分析和探索式数据分析等。Apache Doris支持AGGREGATE、UNIQUE、DUPLICATE三种表模型,同时支持ROLLUP和MATERIALIZED VIEW两种向上聚合方式,可以更好地支撑OLAP查询请求。另外,Doris也支持快速插入和删除数据,是未来实时数仓或者数据湖产品的有力竞争者。

尝试在OLTP的基础上融合OLAP的数据库TiDB、腾讯TBase(云平台上已改名为TDSQL PostgreSQL版)、阿里的OceanBase都在架构上做了大胆的突破。TiDB采用行存储、列存储两种数据格式各保存一份数据的方式,分别支持快速OLTP交易和OLAP查询。TBase则是分别针对OLAP业务和OLTP业务设置不同的计算引擎和数据服务接口,满足HTAP场景应用需求。OceanBase数据库使用基于LSM-Tree的存储引擎,能够有效地对数据进行压缩,并且不影响性能,可以降低用户的存储成本。

02

ETL工具选型

目前,业界比较领先的开源ETL数据抽取工具主要有Kettle、DataX和Waterdrop。商业版本的DataStage、Informatica和Data Services三款软件不仅配置复杂、开发效率低,执行大数据加载也非常慢。

Kettle(正式名为Pentaho Data Integration)是一款基于Java开发的开源ETL工具,具有图形化界面,可以以工作流的形式流转,有效减少研发工作量,提高工作效率。Kettle支持不同来源的数据,包括不同数据库、Excel/CSV等文件、邮件、网站爬虫等。除了数据的抽取与转换,还支持文件操作、收发邮件等,通过图形化界面来创建、设计转换和工作流任务。

DataX是阿里巴巴集团内部广泛使用的离线数据同步工具/平台,实现包括MySQL、Oracle、SQL Server、Postgre、HDFS、Hive、ADS、HBase、TableStore(OTS)、MaxCompute (ODPS)、DRDS等各种异构数据源之间高效的数据同步功能。

Waterdrop是一款易用、高性能、支持实时流式和离线批处理的海量数据处理工具,程序运行在Apache Spark和Apache Flink之上。Waterdrop简单易用、灵活配置、无需开发,可运行在单机、Spark Standalone集群、Yarn集群、Mesos集群之上。Waterdrop支持实时流式处理,拥有高性能、海量数据处理能力,支持模块化和插件化,易于扩展。用户可根据需要来扩展插件,支持Java/Scala实现的Input、Filter、Output插件。

总的来说,Kettle适合中小企业ETL任务比较少并且单表数据量在百万以下的项目,开发速度快,支持的数据来源丰富,方便快速达成项目目标。DataX支持需要批处理抽取数据的项目,支持千万级、亿级数据的快速同步,性能高效、运维稳定。Waterdrop是后起之秀,在DataX的基础上还支持流式数据处理,是DataX的有力竞争者和潜在替代产品。

03

调度平台选型

调度平台可以串联ETL任务并按照指定的依赖和顺序自动执行。调度平台一般用Java语言开发,平台实现难度小,大多数数据仓库实时厂商都有自研的调度平台。

在早期银行业的数据仓库项目中,大多数据ETL过程都是通过DataStage、Informatica或者存储过程实现的。笔者接触过最好用的产品就是先进数通公司的Moia Control。Moia Control定位于企业统一调度管理平台,致力于为企业的批处理作业制定统一的开发规范、运维方法,对各系统的批量作业进行统一管理、调度和监控。Moia Control的系统架构如

图1所示,系统分为管理节点和Agent节点,管理节点负责调度任务的配置和分发作业,Agent节点负责任务的执行和监控。Moia Control在金融领域具有非常广泛的应用。

cfa90e21bed2a8fb87baf11c5d285c64.png

图1 Moia Control系统架构

在开源领域,伴随着大数据平台的崛起,虽然先后涌现了Oozie、Azkaban、AirFlow等深度融合Hadoop生态的产品,但都是昙花一现,目前已经逐步被DolphinScheduler取代。DolphinScheduler于2019年8月29日由易观科技捐赠给Apache启动孵化。DolphinScheduler的产品架构如图2所示。

0cf5bd1cd0844df11dfa569ffd99fa02.png

图2 DolphinScheduler 产品架构

DolphinScheduler是全球顶尖架构师与社区认可的数据调度平台,把复杂性留给自己,易用性留给用户,具有如下特征。

1)云原生设计:支持多云、多数据中心的跨端调度,同时也支持Kubernetes Docker的部署与扩展,性能上可以线性增长,在用户测试情况下最高可支持10万级的并行任务控制。

2)高可用:去中心化的多主从节点工作模式,可以自动平衡任务负载,自动高可用,确保任务在任何节点死机的情况下都可以完成整体调度。

3)用户友好的界面:可视化DAG图,包括子任务、条件调度、脚本管理、多租户等功能,可以让运行任务实例与任务模板分开,提供给平台维护人员和数据科学家一个方便易用的开发和管理平台。

4)支持多种数据场景:支持流数据处理,批数据处理,暂停、恢复、多租户等,对于Spark、Hive、MR、Flink、ClickHouse等平台都可以直接调用。

此外,Kettle本身包含调度平台的功能,我们可以直接在KJB文件中定义定时调度任务,也可以通过操作系统定时任务来启动Kettle,还可以去Kettle中文网申请KettleOnline在线调度管理系统。

Kettle通过KJB任务里面的START组件可以设置定时调度器,操作界面如图3所示。

95927850292d5008ef30d730e3ae2a4a.png

图3 Kettle定时页面

此外,在Kettle中文网还提供了功能更为强大的KettleOnline工具,非常适合较大型Kettle项目使用,具体功能这里就不展开介绍了。

除了上述调度工具之外,还有一些小众的Web调度工具,例如Taskctl、XXL-JOB等。总的来说,都能满足基本的需求。有研发实力的公司可以在开源版本的基础上进一步完善功能,打造属于自己的调度平台。

04

BI工具选型

BI是一套完整的商业解决方案,用于将企业现有的数据进行有效的整合,快速、准确地提供报表并提出决策依据,帮助企业做出明智的业务经营决策。BI工具是指可以快速完成报表创建的集成开发平台。

和调度平台不一样,BI领域商业化产品百花齐放,而开源做成功的产品却基本没有。这也和产品的定位有关,调度平台重点关注功能实现,整体逻辑简单通用,便于快速研发出满足基本功能的产品。而BI则需要精心打磨,不断完善和优化,才能获得市场的认可。

在早期Oracle称霸数据库市场的年代,BI领域有3个巨头,分别是IBM Cognos、Oracle BIEE和SAP BO。在早期BI领域,IBM 50亿美元收购Cognos、SAP 68亿美元收购BO都曾创造了软件行业的收购纪录。这两起收购发生分别发生在2007年和2008年。此后是传统BI的黄金十年,这三大软件占领了国内BI市场超过80%的份额。笔者参加工作的第一个岗位就是BIEE开发工程师,而后又兼职做过两年的Cognos报表开发,对二者都有比较深刻的认识。

在传统BI时代,主要按照星形模型和雪花模型构建BI应用,在开发BI报表之前,必须先定义各种维度表和事实表,然后通过各BI软件配套的客户端工具完成数据建模,即事实表和维度表的关联,以及部分指标逻辑的计算(例如环比、同比、年累计等)。最后在Web页面上定制报表样式,开发出基于不同筛选条件下,相同样式展现不同数据的固定报表。整个开发过程逻辑清晰,模块划分明确,系统运行也比较稳定,作为整个数据分析项目的“脸面”,赢得了较高的客户满意度。

传统BI以固定表格展现为主,辅以少量的图形。虽然模型和页面的分离让开发变得简单,目前广泛应用于金融行业和大型国企管理系统中,但是也有不少缺点,例如,星形模型的结构在大数据场景下查询速度非常慢、模型与页面的分离造成版本难以管控、模型中内嵌函数导致查找数据问题变得困难等。

2017年前后,Tableau强势崛起,以“敏捷BI”的概念搅动了整个BI市场,引领BI进入一个全新的时代。

Tableau最大的特点是以可视化为核心,强调BI应用构建的敏捷性。Tableau抛弃了传统BI的模型层,可以直接基于数据库的表或者查询来构建报表模块,大大降低了开发难度,提升了报表的开发效率和查询性能。曾经需要一天才能完成的报表开发,现在可能一个小时不到就可以完成,极大提升了产出效率。

在传统BI时代,国产BI软件虽然也在发展,但是不够强大。在敏捷BI时代,FineBI、永洪BI、SmartBI、观远BI等商业化产品顺势崛起,开始抢占国内BI市场。帆软公司的Fine Report和FineBI更是其中的佼佼者,稳坐国产BI软件的头把交椅,将产品铺向了广大中小企业。国产BI在培训体系上做得更为完善,以至于笔者发现在最近半年的面试中,差不多有一半的应聘者使用过帆软公司的产品。

在国产化BI之外,跨国软件公司也在敏捷BI方向上做出了调整,其中笔者接触过的就有微软的Power BI和微策略的新一代MSTR Desktop。同时,云厂商也加入BI市场的争夺,其中百度云Sugar、阿里云QuickBI都是内部产品对外提供服务的案例。

总的来说,在敏捷BI领域,国外厂商的软件成熟度高,版本兼容性好。国内厂商的软件迭代比较快,也容易出现Bug。从实现效果上看,以上软件的差异并不大,BI战场已经变成了UI的较量了,只要UI能设计出好的样式,绝大多数BI软件都可以实现近似的效果。

关于作者:王春波,资深架构师和数据仓库专家,现任上海启高信息科技有限公司大数据架构师,Apache Doris和openGauss贡献者,Greenplum中文社区参与者。 公众号“数据中台研习社”运营者。精彩书评

精彩书评

本文摘编于《高效使用Greenplum:入门、进阶与数据中台》

c4dcffc9e456d7dfb0f52b2b6dc4641c.png

延伸阅读《高效使用Greenplum》

点击以下链接了解及购买

转载请联系微信:zj06220_0

推荐语:这不仅是一本从原理到使用、从入门到进阶讲解Greenplum的著作,而且是一本指导企业用更省钱、更高效地方式使用Greenplum构建企业级数据仓库和数据中台的著作。 

93f85cf13db6cbd1d96890e43c52ef17.png

2022华章科技年度新知发布

0205fe45fc9761a9bed1f6bf5539b858.png

40cd5324e421f3f3ba84cade31559106.gif

6f36fcc3e4ecf1a7af0774d61762b051.png

扫码关注【华章计算机】视频号

每天来听华章哥讲书

38a379da78d6b5edd745bcb4ca1f9c85.gif

更多精彩回顾

书讯 | 1月书讯(下)| 2022年的第一本书

书讯 | 1月书讯(上)| 2022年的第一本书

资讯 | 重磅!达摩院发布2022十大科技趋势

书单 | 6本书,读懂2022年最火的边缘计算

干货 | Flink1.14.2发布,除了log4j漏洞你还需要关注什么?

收藏 | Docker冲顶技术热词,微服务应用热度不减,中国云原生开发者真实现状如何?

上新 | 【新书速递】金融领域可解释机器学习模型与实践

f4f40b22e3b4fabbb266d8325eda7d87.gif

0a875979e5d1e28a280457549927cab0.gif

点击阅读全文购买

相关推荐

什么是AB实验?能解决什么问题?终于有人讲明白了

导读:走向身边的AB实验。作者:木羊同学来源:大数据DT(ID:hzdashuju)“AB实验”是一个从统计学中借来的工具。我和大家一样,每次只要看到“统计学”这三个字,下意识就觉得这事和我没啥关系,然后手就忍不住想要点击下一条文章。不过且慢,开篇我说AB实验是一个从统计学中借来的工具,借来给谁用呢?给我们自己用。所以下面不会介绍太多的统计学知识,主要讲讲AB实验能和我们发生怎样的故事。01 什么...

华章IT官方博客 4500

【第115期】世界一流大学计算机专业,都在用哪些书当教材?

导读:转眼间离新学期开学又不远了。清华、北大、MIT、CMU、斯坦福的学霸们在新学期里要学什么?本文就带你盘点一下那些世界名校计算机专业采用的教材。不用多说,每本都是经典的烧脑技术书,建议配合防脱发产品一起食用。(要囤书的同学,一定要看到最后!)1深入理解计算机系统(原书第3版)作者:兰德尔 E.布莱恩特 大卫 R. 奥哈拉伦????卡内基-梅隆大学、北京大学、上海交大等国内外众多知名高校选用指定教材...

华章IT官方博客 3930

腾讯大数据总体架构图,对外公开!

导读:腾讯作为国内体量最大的互联网公司之一,业务涵盖用户日常生活的方方面面,面对如此巨大业务数据量,如果不能对数据进行专业化处理并高效有序地存、管、用,如果不能使数据产生应有的价值,那么数据资产将会成为数据垃圾,成为社会和企业的负担。大数据平台作为腾讯底层的基础设施之一,每天必须处理千万级规模的离线数据任务及十万亿级别的实时计算,否则无法满足业务每天数以亿计的数据分析计算的需求。本文主要介绍腾讯大...

华章IT官方博客 3706

API安全实战

一提起“信息安全”,不管是业内专家还是所谓的“吃瓜群众”,多半都会在脑海中浮现“网络安全”“Web安全”“软件安全”“数据安全”等常见的词汇。市面上绝大多数安全类书籍也多集中在这几个领域,而从API视角阐释信息安全的资料却凤毛麟角,也很少有人从软件系统之间“接口”的角度来分析和挖掘安全漏洞。API最初的应用基本都在本地系统之上。时至今日,API已经成为各类软件系统(尤其是大型Web系统)集成的一种...

华章IT官方博客 2995

Roblox、Epic Games和Meta,详解三巨头如何引爆元宇宙

导读:在元宇宙趋势确立的过程中,标志性公司的价值确立起到了重要支撑作用。元宇宙第一股Roblox、元宇宙游戏第一股Epic Games和元宇宙社区代表公司Facebook(已改名为Meta)这三家公司对于确立元宇宙趋势起到了重要推动作用,我们称它们是元宇宙先锋队并不为过。下面对三家公司分别做详细的介绍和分析。作者:周掌柜来源:大数据DT(ID:hzdashuju)01 Roblox与元宇宙▲Rob...

华章IT官方博客 1550

干货:23 个示例,吃透ES!

为了说明Elasticsearch的不同查询类型,我们将搜索一个图书文档集合,其中有以下字段:标题、作者、摘要、发布日期和评论数量。但首先,让我们创建一个新的索引,并使用批量API索引一些文档:PUT /bookdb_index { "settings": { "number_of_shards": 1 }}POST /bookdb_index/book/_bulk { "inde...

华章IT官方博客 1188

SaaS 定位:赢得市场

‍‍一.什么是产品定位通常我们讲定位时,可能涵盖 3 种意思。坐标,当前所处的位置。方向,指想要去的地方。声明,对定位的具体描述。在定位前加上“产品”,也有其 3 种意思。该产品在不同维度中(例如价格和市场、对象和业务等)的市场位置。确定该产品的发展方向,以及如何发展。对该产品定位的文字描述和解释。二.为什么做 SaaS 定位概念弄清楚后,我们来看看为什么要做 SaaS 产品的定位。2.1 认...

华章IT官方博客 1170

数据、算法、场景:工程化的“三驾马车”

作者:陆兴海 彭华盛编著来源:大数据DT(ID:hzdashuju)人们对新事物的认知过程总是螺旋式迭代演进的,对于智能运维也是如此,智能运维是运维发展的方向,而且是一个长期的过程—从经验主义到数据驱动,再回归到业务驱动的过程。从2016年对于Gartner的概念的理解,到之后每一年不断的探索与实践,到2020年,在笔者参加的智能运维国家标准编写组会议上,行业内达成了高度的、更加面向现实的共识:...

华章IT官方博客 1582

【第114期】五大经典风控系统全面解读

什么是风控系统?系统是由多个相互联系的元素组成、能完成特定功能的整体。风控系统是系统的一种,除了具备系统的三个特征之外,还具有两个特征:一是计算机系统,包含软件、硬件、数据。二是服务于风控业务,在风控领域使用。风控系统的分类风控系统分为在线系统和离线系统。在线系统:即产生真实业务结果,如审批系统;离线系统:不产生真实业务结果,主要作用是展示和分析,如BI系统,建模平台。典...

华章IT官方博客 4144

云计算的发展现状及未来

作者:阿里云智能-全球技术服务部来源:大数据DT(ID:hzdashuju)01 云计算的发展现状1. 云计算市场的马太效应云计算已走过十几个年头,从异军突起到百花齐放再到巨头崛起,云计算市场同样出现了马太效应。当前的云计算市场有以下几个比较明显的态势。聚类分化:由于云计算是一个规模性业务场景,只有达到一定规模后,边际成本才会出现,所以近年来,云计算出现了有趣的变化。一方...

华章IT官方博客 5853

OLAP:实现高效BI分析的必备技术

“每个做大数据的同学,都应该听过OLAP或者实践过。”什么是OLAP多维分析,它究竟有啥作用,如今都有哪些流行的技术解决方案来实现?今天我们详细聊一聊。文中部分内容参考了朱凯老师的《ClickHouse原理解析》,感兴趣的朋友可以买来读一读。01—BI系统的演进在聊OLAP之前,我们先把时间拉长,聊聊BI系统。(1)传统BI系统上个世纪,IT技术迅猛发展,主要特征就是线...

华章IT官方博客 1242

10000 字的 pandas 核心操作知识大全!

工作中最近常用到pandas做数据处理和分析,特意总结了以下常用内容。内容较多,建议收藏。引入依赖#导入模块importpymysqlimportpandasaspdimportnumpyasnpimporttime#数据库fromsqlalchemyimportcreate_engine#可视化importmatplot...

华章IT官方博客 1066

企业数据治理面临的 6 大挑战!

来源:谈数据,作者:石秀峰全文共3825个字,建议阅读8分钟数据作为数字经济时代新型生产要素,是企业的重要资产,也是赋能企业数字化转型的基石。在向着数字化快速迈进的同时,当前企业数据治理都面临着各种挑战和不足。企业越大,需要和产生的数据也就越多,数据越多,意味着就越需要定制适合自己企业的有效的、正式的数据质量策略。对企业而言,不同的行业、不同的业务特点,不同的信息...

华章IT官方博客 1141

你必须要掌握的大数据计算技术,都在这了

导读:分布式的并行计算框架,从数据处理时效角度可以分为离线的批处理框架和实时的流处理框架。当前最流行的批处理框架是Spark,流处理框架是Flink。01离线批处理这里所说的批处理指的是大数据离线分布式批处理技术,专用于应对那些一次计算需要输入大量历史数据,并且对实时性要求不高的场景。目前常用的开源批处理组件有MapReduce和Spark,两者都是基于MapReduce...

华章IT官方博客 2460

终于有人把AB实验讲明白了

导读:近几年AB实验的曝光度越来越高。AB实验并不是近几年才有的,从推荐系统诞生开始,AB实验就扮演着重要的角色。本文主要介绍AB实验的基本概念,包括AB实验和在线AB实验的定义以及AB实验的常见类型。作者:刘玉凤来源:大数据DT(ID:hzdashuju)01 AB实验的定义AB实验又称为受控实验(Controlled Experiment)或者对照实验。AB实验的概念...

华章IT官方博客 1529

看了无数篇文章,终于有人把大前端讲清楚了

近几年,大前端一直是行业热点。相较于单一端工程师,大前端工程师具有更大的职业广度。本文将带领读者快速了解大前端的生态、人才需求,帮助读者从整体掌握行业需求与个人发展路线。1.大前端能做什么有人把前端+移动端称为大前端,也有人把前端+服务端称为大前端,或者把“前端+移动端+后端”称为大前端,后来又出现了全栈工程师的概念,以及所谓的泛前端概念。我们不争论具体哪个概念或者定义是...

华章IT官方博客 7864

【第113期】分布式事务处理方案大 PK!

首先先说一个大原则:分布式事务能不用就不要用,毕竟这个用起来还是有一些麻烦的。当然,不用和不会用可是两码事。1. 分布式事务基础理论学习分布式事务,有一些基础理论需要我们先来了解下。1.1 本地事务本地事务是指将多条语句作为一个整体进行操作的功能,通过数据库事务可以确保该事务范围内的所有操作都可以全部成功或者全部失败,如果事务失败,那么效果就和没有执行这些SQL一样,不会...

华章IT官方博客 1053

逆流而上:计算机专业图书破圈营销,这个直播间做到了

你在直播间买过东西吗?是生活日用?还是零食饮料?或者是实体店优惠券?7月27日晚7点到10点,一场顺时而生却又处处“反其道而行之”的直播间打破了“直播带货”和“专业知识”的壁垒,将计算机专业图书带入直播当中,并在直播现场与众多知名计算机领域KOL连麦互动,交流分享经验。这是一场怎样的直播,这场直播背后又有哪些故事呢?| 一次叫好叫座的分享,一场事先张扬的直播“Java学习...

华章IT官方博客 1397

Jenkins 也宣布弃用 Java 8

出品 | OSC开源社区(ID:oschina2013)继Java 之父 James Gosling 先前称,开发者应尽快弃用 JDK 8,可以选择 JDK 17 LTS,因为后者在各个方面都带来了巨大的改进。开源 Devops 工具 Jenkins 宣布:从 6 月 28 日发布的 Jenkins 2.357 和即将发布的 9 月 LTS 版本开始,Jenkins 最低...

华章IT官方博客 1189

对话知道创宇丨如何守住内容安全生命线?

信息安全主要包括以下五方面的内容,即需保证信息的保密性、真实性、完整性、未授权拷贝和所寄生系统的安全性。信息安全本身包括的范围很大,其中包括如何防范商业企业机密泄露、防范青少年对不良信息的浏览、个人信息的泄露等。网络环境下的信息安全体系是保证信息安全的关键,包括计算机安全操作系统、各种安全协议、安全机制(数字签名、消息认证、数据加密等),直至安全系统,如UniNAC、DL...

华章IT官方博客 1088

《前端跨界开发指南》重磅来袭!

谨以此书献给相信“努力有用”的你by 大史不说话《 前端跨界开发指南:JavaScript工具库原理解析与实战》先做个自我介绍我是大史不说话,是一名前端工程师,一个相信“努力有用”的、不太聪明的、行动力还可以的程序员。曾经因为一篇《10000小时后,我从外包走进了字节跳动》而出圈,被朋友们戏称为“万时大佬”????。我2017年走进前端领域,2018年开始技术写作。为什么写这本...

华章IT官方博客 1328

李三红:Java版本升级需要纳入到可持续性维度

嘉宾 |李三红 撰稿 |云昭 审校 |千山如果从1992年Oka(Java的前身)算起,Java已经走过了30年的道路。作为公认的革新性的编程语言,Java怀揣着James Gosling,Patrick Naughton,Chris Warth,Ed Frank和Mike Sheridan的“可移植”、“跨平台”的初衷,在Bill Joy,Arth...

华章IT官方博客 372

换个角度看契约测试

本文作者:付彪,Thoughtworks总监级质量分析咨询师,常年专注于软件测试与软件质量保障领域。精通经典测试理论、自动化测试设计与实施,以及通用型软件系统前后端的各种测试活动,在敏捷测试和微服务系统测试方面有非常丰富的实践经验。长期关注工程效能与新兴技术对传统软件测试的革新,坚持通过博客和开源软件助力行业和社区发展。如今,契约测试在测试策略层面已经确确实实地被很多团队...

华章IT官方博客 353

Apache ShenYu毕业成为Apache顶级项目!

Apache ShenYu官宣毕业2022 年 7 月 28 日,全球最大的开源软件基金会 Apache 软件基金会发布博客,宣布 ShenYu 正式毕业,成为 Apache 顶级项目(TLP)。以上内容引用:https://blogs.apache.org/foundation/entry/the-apache-software-foundation-announces...

华章IT官方博客 548

超全!腾讯数据科学家深度长文讲透AB实验

导读:在数字化时代的大背景下,在数据驱动的产品增长理论和实践中,AB实验起的作用越来越重要。越来越多的岗位需要产品、运营、数据等职位候选人掌握AB实验相关的知识。作者:刘玉凤来源:华章计算机(hzbook_jsj)本文首先介绍AB实验的基本概念和原理,然后介绍AB实验的3个基本要素—实验参与单元、实验控制参数、实验指标,以及对于这3个基本要素的要求,之后介绍AB实验的2个...

华章IT官方博客 1706

8月书讯(下) | 人工智能、机器人、网络安全不可多得的好书上市!

豆瓣评分9.4、GitHub标星1.57万的“蒲公英书”《神经网络与深度学习》的实践篇8月重磅上市!机器学习、情感分析、对偶学习、智能无线机器人、网络安全等领域不可多得的好书,本本值得入手!参与文末赠书活动,好书就要抢先读。— 新书速览—1、《神经网络与深度学习:案例与实践》2、《机器学习Python版》3、《机器学习:从基础理论到典型算法(原书第2版)》4、《情感分析...

华章IT官方博客 1290

图解 3 种主流企业架构模式(建议收藏!)

导读:数字化转型的重要举措之一就是构建数字平台,实现对客户、员工、供应商及生态合作伙伴等的连接,为业务的发展提供坚实的基础。在UVCA时代,对于企业架构的诉求是既要保障业务的稳定运行,也要能够快速适应需求的变化。所以在规划数字平台时要积极引入业界成功的架构模式,达成解耦、服务化等目标。作者:新华三技术有限公司来源:大数据DT(ID:hzdashuju)业界主流的架构模式包...

华章IT官方博客 1374

市面上的大前端岗位到底是做什么的?

市面上的大前端岗位到底是做什么的?大前端这个词出现了不是一天两天了,但是这个岗位到底是做什么的,到目前也是仁者见仁智者见智,今天小编就带大家解开这个岗位的神秘面纱。其实对于所谓的【大前端】技术,市面上常见的有两种说法:一种是关于跨端技术,如Flutter、RN、小程序的集合称之为大前端。另一种是关于开发人员所具备的素质,把工程师同时具备前端+移动端的研发能力称之为大前端。...

华章IT官方博客 1239

华为数字化转型规划“三阶十二步法”

作者:华为公司企业架构与变革管理部来源:华夏基石e洞察(ID:chnstonewx)数字化转型是企业的必答题,企业必须自己主导自身的数字化转型,支撑主营业务成功。那么,怎样才能更好地帮助主营业务成功,又应该从哪里开始转型工作呢?这就涉及企业的数字化转型规划。我们说数字化转型是一项复杂的系统工程,而规划就是这项系统工程的顶层设计。一个好的规划应该对准业务战略,既能描绘出企业...

华章IT官方博客 2762

7行代码让B站崩溃3小时,竟因“一个诡计多端的0”

鱼羊 丰色 发自 凹非寺来源:量子位 | 公众号 QbitAI一个小小字符“0”,竟引得B站全面崩溃。不知你是否还记得那一夜,B站“大楼停电”、“服务器爆炸”、“程序员删库跑路”的彻夜狂欢。(手动狗头)时隔一年,背后“真凶”现在终于被阿B披露出来——没想到吧,就是这么简单几行代码,直接干趴B站两三个小时,搞得B站程序员彻夜无眠头发狂掉。你可能会问,这不就是个普普通通用来求...

华章IT官方博客 561
上一篇: 什么是贝叶斯定理?朴素贝叶斯有多“朴素”?终于有人讲明白了
下一篇: 自主IT行业生态需要会造计算机的人才
hzbooks
hzbooks 企业官方账号 企业官方账号
博客等级 码龄19年 2400粉丝 969原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值