论文笔记: iDice: Problem Identification for Emerging Issues

本文为博客 VIP 文章,开通 VIP 后可阅读全文

开通 VIP

1. 问题引入

1.1 背景

微软公司向大众提供很多大型在线软件系统,例如Microsoft Office 365, Windows Azure, 和Visual Studio Online,当这些产品的用户遇到问题时,可以通过提交反馈、咨询在线客服、拨打客服热线等方式将问题上报给运维团队,一次问题上报称为一个Issue Report。通常情况下,一个软件系统下的issue report的数量是相对稳定的,但是有时会发生issue report的数量突变(通常是骤增)的情况,快速且有效的定位这些问题相当重要。

本文提出了iDice算法,用于帮助技术支持工程师识别与**新出现问题(emerging issue)**相关的有效组合的自动化算法。这里将识别属性组合作为一个模式挖掘问题:给定一段时间内的客户问题报告量,目标是搜索一个属性组合,将整个多维时间序列数据集隔离成两个部分:一部分问题量的显著增加,另一部分没有这种显著增加。

1.2 实际案例

Table 1
表1是某团队收到的用户发过来的一组issue report的例子,这些report中包含许多属性,同时还有时间戳,可以认为是一个多维时间序列。
Figure 1
图一显示了2013年检测到的一个真实的emerging issue。12月8日起,包含以下属性组合的问题报告数量明显增加。
{Country="India"; TenantType="Edu"; DataCenter="DC6"}
进一步研究显示,在2013年12月8日之前,这个属性组合平均每天与70个问题报告相关。从12月8日开始,与该属性组合相关的问题报告数量上升到每天300多份。这个特定的属性组合表征了新出现的问题,并为问题调查提供了有用的信息。我们称这样的属性组合为有效组合(Effective Combination)
在确定了新出现的问题后,技术支持工程师很快发现,这些问题报告与一个软件配置错误有关,它未能为印度的客户创建账户,这些客户是通过TenantType EDU订阅服务的。因此,许多客户联系了微软的支持团队,请求帮助。

1.3 挑战

而目前(by 2016)的情况是,技术支持工程师们使用Excel Pivot Table 去逐个查询可能的属性组合,来定位问题。

人工的方法如下问题:

  1. Inefficient。候选集(属性的组合)可能是一个极大的量,人工识别成本太高。
  2. Ineffective。人工方法是非常ad-hoc的探寻工作,手工方法可能会遗漏有效的组合,有时找到的结果包含冗余和重复信息。

传统的频繁项集挖掘方法无法使用,原因:

  1. 传统封闭项集挖掘只能处理多维数据,没有考虑时间属性。
  2. Emerging issue 可能不是整个数据集的频繁模式。

1.4 问题描述

由于问题报告数据可能包含大量的属性组合,因此iDice的目标是从所有可能的组合中有效识别出能够反映问题的有效组合(effective combinations)。

剪枝策略的基础

请添加图片描述
整个属性组合通过它们的子集-超集关系形成一个网格结构,对于两个属性组合X和Y,如果包含X的数据也都包含在Y的数据中,称X为Y的子集,Y为X的超集。

如图2所示,节点表示一个属性组合,边表示子集和超集的关系。黑色节点表示一个effective combinations,他可以有效的分隔开issue明显增长的节点和issue没有明显增长的节点。如果一个effective combinations X是一个emerging issue的症状,并且它与问题报告量的爆发有关,那么X的所有子集也应该受到同一问题的影响,并同时表现出一定程度的issue的数量增加,因为其他属性与这个新出现的问题是正交的。

例如,如果集合

{Country=Japan, ProductVersion=V16SP2, ClientOS=Win8.1}

是一个有效集合,那么他的所有子集如

{Country=Japan,ProductVersion=V16SP2, ClientOS=Win8.1, TenantType=Edu}

{Country=Japan, ProductVersion= V16SP2, ClientOS=Win8.1, UserAgent=IE7.0}

他们的issue report数量都应该会有显著的增长。相反,X的超集可能不会表现出issue数量的明显增加,例如,我们可能不会看到所有关于{ClientOS=Win8.1}的issue report出现明显的爆发。

需求

要进行定位的effective combinations,应该具备一些性质,可以供运维工程师来识别和区分与其他combinations。本文通过对实际案例的分析,确定了effective combinations 应有以下一些需求:

  1. 影响力(Impactful)。由于用以运维的各项资源有限,首先要解决的问题肯定是影响力最大的问题。因此,一个effective combination对应的issue report数量应该是比较大的。
  2. 反映变化(Reflecting changes)。一个effective combination应该在变化程度上足够显著,才能够将自己与其他combination区分开。
  3. 冗余要少(Less redundant): 一个effective combination应该是简洁的,因为冗余度高的结果会降低检测的准确性,并且浪费的后续调查工作的时间。

1.5 Note

  1. 本文专注于寻找issue report数量增加的根因(effective combination),即考虑的指标只有issue report的数量。
  2. 和Adtributor不同,这是一个超集影响子集的问题。

2. iDice算法

2.1 算法概况

寻找Effective combination的关键挑战是,候选的属性组合形成了一个巨大的搜索空间。相应的,iDice的核心算法是在不遗漏有效组合的情况下有效减少搜索空间。

主要有如下三个剪枝策略来降低搜索空间。

  • 基于影响的剪枝(Impact based Pruning)
  • 基于变化检测的剪枝(Change Detection based Pruning)
  • 基于隔离能力的剪枝(Isolation Power based Pruning)
    请添加图片描述
    图3是iDice算法的概况。iDice将问题报告数据作为输入,这些数据是多维的时间序列数据,如表1所示。iDice执行以下三个步骤来有效地搜索有效的组合:基于影响的修剪,基于变化检测的修剪,以及基于隔离能力的修剪。最后,对得到的结果进行排序并返回给用户。

2.2 基于影响的剪枝

首先根据属性组合的影响力进行剪枝,也就是只考虑issue report数量大的属性组合,对于那些数量不足够大的属性组合,直接剪枝删掉的报告。

iDice采用基于BFS(广度优先搜索)的封闭项集挖掘方法进行影响力剪枝。基本思想是:作为有效组合的一个属性,如果一个属性组合没有足够的issue report数量(support threshold),显然它的所有子集也没有足够的容量。因此,我们可以直接删除这个属性组合和它的所有子集。

例如两个属性组合:

X={
   
   Country=India; TenantType=Edu; DataCenter=DC6}
Y={
   
   Country=USA; TenantType=Edu; DataCenter=DC1}

如果Y出现数量小于support threshold则Y及其子集全部删掉;若X出现次数大于support threshold,则保留X。

2.3 基于变化检测的剪枝

Effective combination除了具有影响力之外,还应该与新出现的问题相关。换句话说,需要找出与问题报告数量显著增加相对应的effective combination。

为了实现这一点,考虑数据的时间戳信息,并为封闭的项目集建立了时间序列数据。时间序列中的每个数据点都表示在某个特定的时间戳中包含相应封闭项集的issue report数量。然后使用变点检测的算法找到问题爆发的爆发时间点。这里应用异常检测算法(GLR: Generalized Likelihood Ratio 算法)来寻找异变点,然后将异变点前后变化不显著的候选组合剪枝删除。

例如,在图1中,时间序列从27-Nov到7-Dec服从一个分布,8-Dec到10-Dec服从另一个分布,而 8-Dec这一点是一个变化点。对于没有任何变化点的时间序列数据,相应的属性组合将被修剪掉。
考虑以下两个属性组合。

X={
   
   Country=India; TenantType=Edu; DataCenter=DC6}
Y={
   
   Country=UK; TenantType=Home; DataCenter=DC1}

它们对应的时间序列分别是SXS_XSXSYS_YSY。如果检测到SXS_XSX从12月8日开始有明显的变化,而SYS_YSY在一段时间内没有明显的变化,那么Y将被修剪,X将进入下一步剪枝流程。

2.4 基于隔离能力的剪枝

一个effective combination应该能够将具有变化的combinations与没有变化的其他combinations隔离开来。这里提出了Isolation Power的概念:

IP(X)=−1Ωaˉ+Ωbˉ(Xaˉln1P(a∣X)+Xbˉln1P(b∣X)+(Ωaˉ−Xaˉ)ln1P(a∣Xˉ)+(Ωbˉ−Xbˉ)ln1P(b∣Xˉ))IP(X)=-\frac{1}{\bar{\Omega_{a}}+\bar{\Omega_{b}}}(\bar{X_a}ln\frac{1}{P(a|X)}+\bar{X_b}ln\frac{1}{P(b|X)}+(\bar{\Omega_{a}}-\bar{X_{a}})ln\frac{1}{P(a|\bar{X})}+(\bar{\Omega_{b}}-\bar{X_{b}})ln\frac{1}{P(b|\bar{X})})IP(X)=Ωaˉ+Ωbˉ1(XaˉlnP(aX)

Spark MLlib模型训练—回归算法 GLR( Generalized Linear Regression) 广义线性回归作为线性回归的扩展,在处理不同分布类型的目标变量时具有极大的灵活性。Spark 提供了强大的分布式计算能力,使得广义线性回归可以在大规模数据集上高效训练和应用。本文从原理、代码实现、参数调优等多个角度,详细介绍了 Spark 中广义线性回归的使用方法,希望为读者提供实用的指导。通过合理的模型选择和调优,广义线性回归能够在各种复杂数据场景中提供准确的预测与分析 阅读详情

相关推荐

构建编译器:语法分析器的实战指南

本文还有配套的精品资源,点击获取 简介:语法分析器是编译原理中至关重要的环节,负责将源代码转换为机器可执行代码。它包括词法分析和语法分析两个阶段,使用诸如LL、LR、LALR和GLR等分析方法。语法分析器的实现基于不同类型的文法,常用工具如Yacc、ANTLR等自动化构建过程。本指南深入探讨语法分析器的设计与实现,帮助开发者掌握其在编译器和IDE等软件开发工具中的应用,提升...

weixin_36464343的博客 1937

论文笔记】Joint Discriminative and Generative Learning for Person Re-identification

笔记目录摘要1.简介2.相关工作3.方法3.1生成器模块3.2判别模块3.3优化4.实验4.1实验实现细节4.2生成评估4.3判别评估5.结论论文部分英文解释论文翻译参考 Joint Discriminative and Generative Learning for Person Re-identification arXiv:1904.07223v2 [cs.CV] 22 May 2019 注:限于作者水平,本笔记难免存在不妥之处,欢迎批评指正 摘要 以往的方法生成数据流程与判别性re-id学习阶段保持相对分离 本文则通过更好地利用生成的数据来寻求改进学习的re-id特征 提出了一个将re

ICSE-2016-1-iDice-Problem-Identification-for-Emerging-Issues

故障诊断:ICSE-2016-1-iDice-Problem-Identification-for-Emerging-Issues

AIops相关算法

文章目录分析清华FOCUS:找影响系统性能瓶颈的原因MSRA iDice:多维指标突变定位清华Hotspot:多维因定位智能变更清华FUNNEL:评估变更影响异常检测雅虎EGADS:KPI异常检测框架清华Opprentice:KPI自动化异常检测清华DeepLog: 日志异常检测清华StepWise:指标模式漂移后的准确异常检测故障预测IBM: 磁盘故障预测聚类微软Yading:时序数据聚类...

iwtbs 5248

iDice: Problem Identification for Emerging Issues

paper link https://www.microsoft.com/en-us/research/wp-content/uploads/2016/07/ICSE-2016-1-iDice-Problem-Identification-for-Emerging-Issues.pdf Backgroud: For clould machine problemd identification, t...

很吵请安静 1510

HotSpot 蒙特卡洛树搜索定位多维指标异常

对于网络运维中多数的关键性能指标(KPI,CPU利用率、某页面点击量等),对其应用实时的异常检测算法,即可快速发现异常状况、进而及时止损,然而,有一类可加和的多维度KPI体系(如网页访问量PV、收入指标、错误计数等),其指标元素数目繁多、之间具有复杂的相互影响关系。如图 1表示一个4维的PV指标体系(由一系列3维的结构来表示),维度是Province,ISP,DC和Channel(简记为P,I,D,C),其中每个cell表示一个最细粒度的指标元素对应的PV值,例如,相应的也有较粗粒度的元素,例如。

SmartSi 715

paper issues

21页,图2.2横纵坐标没有说明 36页,Fig.2.12 Work flow of 3-Finger MRake receiver 改为五号,现在为小四 42页,Fig.2.15 Code errors of three receivers change with different multipath delays 现在为小四 43页,Fig.2.16 Code errors of th

Adam 的专栏 -- 一步一脚印 897

Parser简介

开始看《编程语言实现模式》,补习了一下Parser的基础知识。英文是Wiki上的,中文是自己理解翻译的。Wiki LALR parserhttp://en.wikipedia.org/wiki/LALR_parser in 1965, Donald Knuth invented the LR parser (Left to Right, Rightmost derivation). T...

920

非侵入式负荷识别之事件检测方法论一

1、GLR广义似然比 参考文献: (1)非侵入式负荷监测的事件检测方法研究 (2)(GLR-2011)User-centered nonintrusive electricity load monitoring for residential buildings 算法内容:该方法主要检测两个连续相邻窗口是否具有相同分布。该方法通过相邻窗口中概率密度函数比率的自然对数计算决策统计量,依据统计...

qq_26877595的博客 3106

在看不见的地方,AI正在7×24为你在线服务

本文来自:微软研究院AI头条(ID:MSRAsia)编者按:当你使用在线系统来搜索网页、编辑文档、存储图片、听音乐、看视频、玩游戏,并享受着行云流水般的顺畅服务时,正有几十万到上百万台服务器坚守在大后方,为你提供着7×24小时的可靠服务。超大的规模和超高的复杂度给服务的可靠性、可用性和性能都带来了极大的挑战。近年来,微软亚洲研究院软件分析组在与微软在线服务部门合作,利用人工智能技术解决大规模在线系

AI科技大本营 1614

解决backgroud:transparent在低版本浏览器中的bug

今天在html页面上定义了一个button和一个div,大小相同,button使用绝对定位,覆盖在div上面一层,同时样式设置背景透明(background:transparent)。 这样就可以在看到div层的同时,点击div区域其实是点击了button。主流浏览器都可以正常运行。 但是ie8和360、世界之窗等一些小众浏览器的兼容模式下div会把button给挡住(可能因为我d...

aaztliz78857的博客 270

分布式ID生成算法 雪花算法

1、SnowFlake算法生成id的结果是一个64bit大小的整数,它的结构如下图: ● 1位,不用。二进制中最高位为1的都是负数,但是我们生成的id一般都使用整数,所以这个最高位固定是0 ● 41位,用来记录时间戳(毫秒)。 ○ 41位可以表示$2^{41}-1$个数字, ○ 如果只用来表示正整数(计算机中正数包含0),可以表示...

十年饮水不凉热血 494

B. 智能运维 --- 质量保障 --- 异常检测 --- 指标异常定位

B. 智能运维 --- 质量保障 --- 异常检测 --- 指标异常定位 瓶颈分析 --- 决策树 目标:找出哪些因素的影响会导致搜索响应时间大于1秒钟 解决方案 首先FOCUS使用系统每天产生的日志数据来训练决策树,从决策树中可以分析得到引发高搜索响应时间(HSRT)的条件,由于每天的数据会训练出一棵决策树,因此多天后会有多棵决策树产生; 接下来在多棵决策树中挖掘出相...

micklongen的专栏 1971

ICEID

文章目录基本信息样本基本信息主要执行流程office宏pfsdnskdf.exe解密exe傀儡进程关键技术概览1.时间差检测2.cpuid3.隐写术4.傀儡进程5.浏览器注入6.流量混淆详细分析宏代码部分PFSDNSKDF.EXE微步云在线分析手动分析PFSDNSKDF.EXE下载解密文件分析微步云在线分析手动分析新shellcode傀儡进程火绒剑分析开启监听端口生成自签名证书对谷歌浏览器执行远线程注入手动分析其他参考链接 基本信息 样本基本信息 文件名称 fram.doc 样本类型 doc

playmaker的博客 1349

智能运维 | 故障诊断与分析论文一览

近些年来,在需要支持多平台的互联网应用中,微服务架构越来越受欢迎。与此同时,对于互联网公司来说,微服务的性能质量至关重要,因为微服务故障会降低用户体验并带来经济损失。有效的定位故障的本原因对于快速恢复服务并减轻损失来说至关重要。随着5G与云计算的⼤⼒发展,如何进行更自动化的运维以管理⼤规模的服务设备,是当今云⼚商⾮常关心的问题。针对这⼀问题,全球权威的IT研究与顾问咨询公司 Gartner于2016年提出了AIOps(Artificial Intelligence for IT Operations)

weixin_53741275的博客 7252

告警分析

关于分析的一些知识梳理

weixin_39704065的博客 1491

建筑材料水泥基快速修补料CRRM-2C:公路工程2小时开放交通的高效修复解决方案设计

内容概要:CRRM-2C水泥基快速修补料是一种由水硬性胶凝材料、矿物掺合料、级配集料和添加剂组成的单组分干粉材料,加水搅拌后用于公路工程中水泥混凝土的快速修复。该材料具有大流态、自流性好、早期强度高、粘结力强、抗渗抗冻、耐磨耐久等特点,且无氯化物,不腐蚀钢筋。适用于2小时内开放交通的紧急修补工程,如混凝土道面起砂、蜂窝、麻面、骨料裸露、冻融损伤等病害的修复,并可通过切边、铣刨、湿润或涂刷界面剂等方式进行规范施工,确保修补质量。产品需按标准配比拌和,避免添加其他物料,施工环境应控制温度、湿度及天气条件,贮存时需防潮防冻,过期前经复检合格仍可使用。; 适合人群:从事公路养护、市政工程、混凝土维修施工的技术人员及施工管理人员。; 使用场景及目标:①用于高速公路、机场跑道、城市道路等需快速通车的混凝土破损修复;②解决因施工缺陷、环境侵蚀或长期磨损导致的混凝土表面病害,提升结构耐久性和行车安全性; 阅读建议:在实际应用中应严格遵循文档中的施工工艺与注意事项,关注环境条件对施工质量的影响,结合规范JT∕T 1211.1-2018进行操作,确保材料性能充分发挥。

上一篇: K均值(K-Means)聚类算法简介
Eaton18
博客等级 码龄12年 14粉丝 36原创
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值