【技术分享】“霸道总裁解锁新姿势” 关于实现实时深度数据挖掘

本文整理自DTCC2016主题演讲内容,录音整理及文字编辑IT168@杨璐。如需转载,请先联系本公众号获取授权!

演讲嘉宾

刘伟

SAP大中华区副总裁

大数据与平台事业部负责人

目前负责SAP在大中华地区的大数据及平台事业部,致力于推动客户向数字化企业的全面转型,并携手合作伙伴一起打造一个基于HANA大数据平台的生态系统。在此之前,刘伟先生曾长期负责微软的合作伙伴业务,以及开发工具及平台事业部。刘伟毕业于北京大学光华管理学院,并拥有美国Thunderbird国际管理商学院的硕士学位,他在硅谷开始其IT职业生涯,拥有丰富的行业及管理经验。

分享内容

在过去几年,大家经常会听到,中国的经济进入新常态。如今IT行业,也在进入新常态。传统行业对互联经济颠覆、再造,IT技术同样也被新技术影响甚至取代。

 

几年前,可能还有争议,但现在没有人怀疑数据与生俱来的价值。但如何把数据价值变现,还有很多需要探讨的地方。数据价值变现需要两个条件:第一个是必要的条件,我们需要有非常高超的数据处理技术;第二需要对业务有比较深刻的理解。只有对业务有理解才能找到合适业务的场景去解决客户业务的问题,创造新的业务价值。

 

基于内存计算的数据平台 实现实时深度数据挖掘

 

今天重点介绍在数据处理能力下,基于内存计算下一代的数据平台,怎么样能够帮助大家实现实时深度数据挖掘,怎么样帮助大家把我们企业内部和外部的数据能够打通,帮助大家把我们OT和IT技术打通,真正实现数据的联动。

 

首先问大家两个相关的问题,第一个在今天DT的时代,现在收入最高的IT技能是什么?大家想一想,看跟我们接下来讲的是不是一致的。

这是美国一个专注于技术类职位2015年的数据, 2015年十大高薪IT职能,第一位的是SAP HANA,之后是Cassandra、Cloudera。一半是大数据,另外一半是云计算。第二个问题,与我们职业还是有关系。二十一世纪最性感的职业是什么?

在IT和DT的时代,最性感的职业是什么?其实有一个说法是二十一世纪最性感的职位是数据科学家。数据科学家需要懂IT技术、需要懂开发、需要懂数理统计、需要懂客户业务。这样的人是万千宠爱于一身。真的很不容易找到。

 

数据科学家具体工作内容是什么?举例:我们看看有两份税务申报单。在西方成熟市场每年几亿计的税务申报单,但是怎么样分别真假?这是数据科学家所需要做的工作。把刚才提到的各项技能整合起来,建立模型,在数以亿计的税务申报单里找出来哪份是真的哪份是假的。那这两份哪份是真的呢? 

带着这个小问题回顾IT系统的演进。企业IT建设刚刚开始的时候,我们可能首先有一个基础的,比如ERP,对我们企业业务流程的运算,处理数据交易。那么在这些时候我们的数据可能是以关系型为主,我们对一致性、持续性要求非常高。所以我们说基于磁盘的关系型数据库。

一个企业要发展,我们需要比竞争对手做得更好,怎样有更多的对业务的洞察帮助做预测性分析等,就要用差异化的系统。这时数据源不一样,要把多个数据源整合。开源技术便大放异彩。因为开源技术还是有些缺陷,在性能方面开始尝试内存计算。

随着技术的发展,近年来企业受到互联网巨大的冲击。这时传统企业开始重塑再造业务。尝试借助IOT改善供应链,也可能借助一些消费者的大数据做对客户的精准营销,对客户画像等。数据在这时代变成大量的、实时的。我们既要处理事务性的交易,还要处理多维分析、数据挖掘。这时,无论商业技术还是开源技术方向不约而同,也就是内存计算。

 

SAP大概六年前推出基于内存计算的系统。随着业内关注而越来越多,SAP也与时俱进,这种开源技术会被更多用户所采用。SAP推出了一个叫SAP Vora,在spark节点上实现SQL 分析。Hadoop有一些技术架构的限制。在这些方面它们弱一些,SAP Vora可以实现两者之间的整合。

 

无论是开源还是商用,内存技术是共同的选择。就这点来说,内存技术已经成为新时代大数据分析技术的主流。十年前,数据库的奠基人Jim Gray,在2006年曾经预言,他说磁盘已死,磁盘已经落伍,内存才是王道。

回顾过去,正好是这样。所以,过去我们是在磁盘IO读写,但有了内存计算之后,再处理时CPU首先会就近用高速缓存来处理每个现存任务,之后才会在主内存里对数据进行查询和修改。实际上,现在新的瓶颈变成怎样能把数据更快从主内存里加载到高速缓存,让我们的CPU能持续的进行运算,然后提供更快速的反应。

 

在这点上,因特尔与SAP一直有紧密合作。比如在一期的志强芯片V3版本里专门针对HANA做了内存指令优化。即使我们不在其他软件里面做任何修改,性能至少也可提升两倍,这样可以更好的支持运行。

 

有了内存计算,但大数据时代开源架构还是有缺陷的。我们是不是可以利用内存计算对它进行一些修改、优化呢?讲到开源,要说 CAP原理,基本上就是一致性、可用性、和分区容错性。因为分布式的计算,必须要保证我们的分区容错性。这样就导致我们在C和A之间要做出取舍,我们不可能鱼与熊掌兼得,要么就是CP、要么就是AP,很难做到均衡。

有了内存计算,我们有了新的架构可以帮助,就有技术大拿推出实时大数据架构。这里应用了实时内存计算。简单讲,基本上静态数据就用Batch Layer的技术。这个计算,其中有新的数据进来,然后对其中的数据进行批次计算。这里重要的是不可变性。数据是不会修改的。就是不管是删除还是修改,所有的都会被保存。所以有很好的容错性。

 

另外在对新增的数据,所谓的C,对新增的增量做的增量视图。最后在服务层,把实时视图和批量视图进行合并,给用户提供服务。所以,在这里面其实每一个点上都可以用到我们开源的来实现。HDFS, Spark等等都可以在里面对应上。

 

但是我们知道,并不一定全部要用开源,我们选择的时候希望选最优的方案。分享我们和开源技术做一个深度无缝的融合。在Batch Layer的时候基本上还是用Hadoop。然后在速度层建议用HANA。利用内存计算技术来对实时的大量技术来生成增量视图。在服务层用HANA Vora,是在Hadoop上实现多维分析。通过一些计算,我们通过Vora把数据曝露出来,然后提供给客户。

 

疑问来了:这两套框架怎么在一块,会不会有什么问题,会不会让应用架构非常复杂。

首先有一个概念,数据的温度,我们有热的数据、温的和冷的。按数据的存在的时间长短等等来定义我们数据的温度。在这个里面我们的管理是由我们HANA自带数据周期管理来实现的。我们可以先看黄颜色的一组箭头,我们应用里的数据,首先是在内存里在存储,如果过了一段时间,按照事先定义的热数据当变成一个温数据之后会放在扩展存储。在我们扩展层之间的流动对应用来说是透明的,它感知不到,完全是机制自动维护的。当数据温度进一步降低的,变成冷数据的时候,会放在Hadoop系统里存放。

 

我们可以换一个方向来看,我们肯定有很多大数据,来自社交媒体等等,进入Hadoop之后我们透过Vora把它提交到HANA里来,供应用使用。所以无论哪个方向,在这里面有非常关键的观点,大家要注意的就是说最终对我们应用来说都感知不到数据在里面流动,所有的都是在我们后面来实现,对应用来说它面对接口非常简单,这样让应用在开发的时候架构也简单。我们不用特别关注数据在不同体系之间的流动。

案例分析

芯片制造非常类似于流程制造,过程不可逆,但是一旦发生问题对厂家的成本非常大。但是怎么去控制这个?所以我们客户就提出来有没有可能基于它们的海量生产的数据、工厂的数据,HANA内存计算、机器学习,由我们预测分析,这些技术能不能帮助他来满足以下几个需求:

 

第一,在生产制造的过程当中能不能帮他找到产品良率的根因追溯、质量率。我们基于大量数据做出模型以后应用到生产系统,然后基于生产实时数据进行预警、分析,然后去优化这个数据,持续来改进我们所出的预测模型。

 

第二,怎么样把海量的数据处理缩短到秒,这样质控人员、分析师就可以把大量时间放在其他方面,而不是每天在这里看,而且还不见得精准。

 

第三,他希望借助这个项目帮助他们搭建数据平台,帮助他们实现实时的动态和产品的分析。而且这个平台要好用,在未来还有新的产品、新的生产线可以复用,而不用再做个新的项目。

还是同样我们的数据,首先在生产工厂的大量数据,热数据,我们首先是在HANA内存里做计算。然后当温度降下来,通过动态分层,就会存储在磁盘、闪存里。冷数据就会存在Hadoop里面,然后透过Vora来实现HANA和Hadoop之间的交互。我们看一下基础的架构,我们对HANA内存节点,用了14个T的内存,然后在动态分层我们一个节点、2T内存,Hadoop是10个节点。这是当时的技术架构。就用到了因特尔E至强V3版本,本身因为它对内存指令优化,性能就非常高。

 

实现的结果就是:速度很快,五亿条记录38秒。但这并不是这个方案的根本出发点,根本出发点还是我们提供了非常好的业务洞察,在这里实际上当客户把他的需求明确之后,我们双方的数据科学家在一块讨论,怎么样把数据输入,选择什么样的模型、用什么样的测算工具。对于他们选择了HANA里的PAL我们的预测分析库。借助这个库里的,分类回归树来建立这个模型。如下图,是一个可视化结果。

在根节点上实际上我们这里面不良品的数量和比率,我们再度分解,把其中一个影响因素按不同的区间,我们又可以看到它的不良品数量和概率。这期间又进一步分析,一层层分解下来。最终到不可分解为止。这个都可以在算法的配置参数里控制。

 

通过这个我们建立了一个模型,把它用在生产里,实时数据进来,我们会用这个模型做计算、去做预警,在某个节点上有问题了,只要匹配的话就可以。随着更多数据可以进一步优化模型,可以预测更精准。大家可以看到这是非常典型的Lambda架构,HANA加上Hadoop这么一个架构整合,可以帮助客户且回报巨大。

关于DTCC

中国数据库技术大会(DTCC)是目前国内数据库与大数据领域最大规模的技术盛宴,于每年春季召开,迄今已成功举办了七届。大会云集了国内外顶尖专家,共同探讨MySQL、NoSQL、Oracle、缓存技术、云端数据库、智能数据平台、大数据安全、数据治理、大数据和开源、大数据创业、大数据深度学习等领域的前瞻性热点话题与技术,吸引IT人士参会5000余名,为数据库人群、大数据从业人员、广大互联网人士及行业相关人士提供了极具价值的交流平台。

内容概要:本文档名为《赵家湾学校后大门一百三十六栋.txt》,实则是一份综合性科研仿真资源索引,集中展示了多个技术领域的Matlab/Simulink与Python代码实现项目。内容涵盖风光互补制氢合成氨系统容量-调度优化、微电网能量管理、无人机三维路径规划、图像分割、信号处理、电力系统建模、模型预测控制(MPC)、深度学习预测模型(如LSTM、Transformer)、联邦学习、强化学习应用等多个前沿方向。文档不仅列出具体研究题目和算法模型,还整合了智能优化算法(如PSO、GWO、DBO等)、路径规划、车间调度、通信优化、雷达跟踪、元胞自动机模拟等通用技术模块,并附有网盘链接提供完整代码与仿真模型下载,旨在为科研人员提供可复现的技术支持与开发参考。; 适合人群:具备一定编程基础,从事电气工程、自动化、计算机科学、人工智能、控制工程、能源系统等相关领域的研究生、科研人员及工程技术开发者。; 使用场景及目标:①辅助高水平学术论文复现与科研项目开发;②为硕士/博士论文、课程设计、学科竞赛提供算法实现与仿真建模支持;③提升在能源并网、智能控制、路径规划、负荷预测、故障诊断等领域的工程实践与创能力。; 阅读建议:此文档为资源导航型材料,建议结合个人研究方向筛选对应主题,通过提供的百度网盘链接获取完整代码包,并配合相关文献进行仿真实验与参数调试,以实现高效复用、二次开发与技术
内容概要:本文深入解析了AI Agent(智能体)的技术原理与系统架构,阐述其如何通过“思考-行动-观察”的闭环循环,使大语言模型(LLM)从被动应答的对话系统进化为能主动完成复杂任务的智能实体。文章详细介绍了Agent四大核心模块:作为决策中枢的LLM(大脑)、实现外部交互的工具调用(双手)、支持状态延续的记忆模块(记忆),以及驱动自主执行的规划与协调机制(协调)。同时对比了Agent与传统聊天机器人在任务规划、工具使用、记忆能力和执行闭环等方面的本质差异,并探讨了从单智能体到多智能体系统的架构演进趋势,强调专业分工对处理复杂任务的重要性。最后,文章分析了Agent模式与预设工作流模式的应用权衡,指出前者适用于灵活探索类任务,后者更适合确定性高的固定流程。; 适合人群:对人工智能、大模型应用开发感兴趣的技术人员、产品经理及研究人员,尤其适合具备一定AI基础知识、希望深入了解Agent系统设计的专业人士; 使用场景及目标:①理解AI Agent的核心架构与关键技术组件;②掌握ReAct等主流执行范式;③区分Agent与传统聊天机器人的能力边界;④判断在实际业务中应采用Agent模式还是工作流模式; 阅读建议:本文理论性强且结构清晰,建议结合实际Agent案例(如AutoGPT、LangChain应用)进行对照学习,重点关注各模块间的协同机制与设计权衡,以深化对Agent系统级思维的理解。
内容概要:本文针对三相并网逆变器在瞬态过程中的全局最优控制问题,提出一种基于有限字符集预测控制(FCS-MPC)的渐进式调控策略,旨在实现从电流畸变抑制到功率无差拍响应的平滑过渡。通过构建电流与功率双模态预测控制框架,结合Simulink仿真与Matlab代码实现,系统分析了有限控制集对系统动态响应、谐波含量及功率调节性能的影响机理,深入探讨了预测模型构建、代价函数设计与控制参数优化的关键技术路径,验证了该策略在提升并网电能质量、增强动态响应能力和实现多目标协同控制方面的优越性与可行性; 适合人群:具备电力电子、自动控制理论基础,熟悉Matlab/Simulink仿真环境,从事能源发电并网、逆变器先进控制策略研究等相关领域的研究生、科研人员及工程技术人员; 使用场景及目标:①深入研究有限集模型预测控制在三相并网系统中的理论与应用;②掌握电流与功率双模态预测控制策略的设计方法与实现流程;③实现高动态性能、低谐波畸变与功率快速无差拍响应的综合控制目标; 阅读建议:建议结合文中提供的Matlab代码与Simulink仿真模型进行复现实验,重点剖析预测时域设定、代价函数权重配置及开关状态枚举策略对系统性能的影响,以全面理解FCS-MPC的核心原理及其在工程实践中的优化技巧。
内容概要:本文系统阐述了多层感知机(MLP)神经网络的底层原理、从零手写代码实现、工程化框架落地及超参数优化的完整体系。内容涵盖MLP的理论基础、前向传播与反向传播的数学推导、激活函数与损失函数的选择、NumPy原生实现与PyTorch/TensorFlow工业级封装,并深入解析了网络结构、训练优化、正则化等超参数的系统化调参策略。通过构建“数学原理→代码实现→调参优化→故障排查→工业实战”的闭环体系,提供可复用的标准化模型开发流程,结合分类与回归实战案例,全面指导模型评估、可视化与部署落地。; 适合人群:具备一定Python和机器学习基础,从事AI研发、数据科学、工程建模的1-5年经验技术人员,以及高校科研人员与企业AI落地团队。; 使用场景及目标:①掌握MLP神经网络的数学本质与代码实现机制;②系统学习超参数调优策略,解决过拟合、欠拟合、梯度异常等常见问题;③实现从学术理解到工业级模型部署的全流程落地;④提升在结构化数据建模任务中的模型性能与鲁棒性。; 阅读建议:建议结合文中提供的NumPy与PyTorch代码边学边练,重点理解反向传播推导与调参逻辑,对照实战案例进行调试与优化,建议按章节顺序学习,尤其重视第5章超参体系与第9章故障排查,以建立系统性调参思维与问题解决能力。
内容概要:本文研究了基于UPML的三维有限差分时域法(3D FDTD)在微带低通滤波器分析中的应用,通过Matlab代码实现对平面微带电路电磁特性的精确仿真。文章系统阐述了3D FDTD方法的核心原理,包括麦克斯韦方程的离散化处理、Yee网格的空间配置、时间步进迭代算法以及数值稳定性条件(如Courant-Friedrichs-Lewy条件)。重点介绍了UPML(单轴各向异性完全匹配层)吸收边界条件的数学建模与编程实现,有效抑制了计算域边界的非物理反射,提升了高频电磁仿真精度。通过建立微带低通滤波器的三维几何模型,进行精细网格剖分,并施加端口激励,计算获得了S参数曲线、电磁场分布云图等关键结果,验证了该方法在高频电路设计中对信号完整性与电磁兼容性分析的有效性与高精度优势。; 适合人群:具备电磁场与微波技术理论基础、熟悉Matlab编程,从事高频/高速电路设计、天线工程、PCB信号完整性分析及相关领域的研究生、科研人员及电子系统研发工程师。; 使用场景及目标:①掌握3D FDTD方法在平面微波器件仿真中的全流程实现技术;②深入理解UPML边界条件的物理机制及其在减少截断误差中的关键作用;③为微带滤波器、功率分配器、耦合器等无源器件及高速互连结构的设计优化提供可靠的数值仿真手段; 阅读建议:建议读者结合所提供的Matlab代码逐行调试,重点关注差分格式的离散过程、UPML区域的参数设置与场量更逻辑,并尝试调整介质基板参数或滤波器拓扑结构,观察S参数和场分布的变化,以深化对电磁波传播特性、谐振行为及边界吸收机制的理解。
内容概要:本文聚焦于有源中点箝位(ANPC)三电平并网逆变器的高性能控制策略研究,针对传统逆变器在电网不平衡、谐波扰动等复杂工况下存在的谐波含量高、动态响应慢、稳定性差等问题,提出了一种融合双极性倍频脉宽调制(DPWMA)、正负序分离锁相技术与电网电压前馈控制的一体化控制方案。通过深入分析ANPC三电平拓扑的结构优势,结合DPWMA调制策略优化开关动作以改善输出波形质量,利用正负序分离锁相实现电网相位的精确跟踪,并引入电网电压前馈有效抑制外部扰动对系统的影响,从而全面提升并网电能质量与系统鲁棒性。研究在Simulink环境中搭建了完整的仿真模型,对稳态运行、电网不平衡及动态切换等多种工况进行了验证,结果表明该控制策略能显著降低电流谐波、提高锁相精度和动态响应速度,具备良好的工程应用前景。此外,文档还整合了大量基于Matlab/Simulink的科研资源,覆盖微电网优化、电动汽车接入、风光储协同调度、路径规划、神经网络预测等多个前沿方向。; 适合人群:具备电力电子、自动控制或能源系统背景,从事相关科研工作的研究生、工程师及高校教师,尤其适合有一定Matlab/Simulink仿真基础的研发人员。; 使用场景及目标:①用于能源并网逆变器控制系统的设计与优化;②支撑高水平论文复现、科研项目开发与工程仿真验证;③为电力系统、智能控制、无人机路径规划等领域的算法研究提供代码参考和技术路线借鉴。; 阅读建议:建议结合文中提供的仿真模型与代码资源,按照目录结构系统学习控制策略设计逻辑,并通过实际仿真实验加深对DPWMA调制、正负序分离、前馈补偿等核心技术的理解与掌握。
代码下载地址: https://pan.quark.cn/s/1065f510e03d Hackerrank是一个国际性的技术人才招聘平台,它借助一系列的编程挑战和练习活动,旨在帮助求职者提升编程能力并为职业发展做好准备。本解析涵盖了多种编程语言和算法的核心内容,以下将从所提供的文档资料中归纳出相关学习要点。 ## 学习要点总结 ### 关于Hackerrank - Hackerrank是一个面向程序开发者的在线编程学习平台。 - 通过攻克具有难度的编程任务,能够促进程序员精通不同的编程语言和算法技术。 - 该平台既适合准备进入北美就业市场的求职者,也适合在中国寻求工作机会的人群。 ### 编程语言应用 - C++11:这是一种C++编程语言的版本,引入了多项增强功能。 - Scala:一种支持多种编程范式的语言,融合了面向对象和函数式编程的特点。 ### 算法与数据结构 - 该资料包含了HackerRank上所有题目的解题方案。 - 适合读者深入研究和学习,有助于增强对数据结构和算法的理解程度。 ### 编程风格与规范 - 采取较为简洁的代码编写方式,以快速完成功能实现为主。 - 递归方法优先于栈的使用,采用STL(标准模板库)而非自行构建数据结构。 - 不提倡防御式编程,不进行指针和参数的有效性检查。 ### 算法竞赛与北美就业 - 对于初次接触ACM算法竞赛的手,该书提供了理想的入门训练。 - 对于准备进入北美就业市场的求职者,书中内容同样具有参考价值。 ### 学习要点详细说明 接下来,将详细阐释书中涉及到的关于链表和排序的各个学习内容。 #### 链表 - **链表元素的输出**:设计一个函数来遍历并展示链表中所有节点的值。需要处理头节点为空的情况...
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值