目录
1、引言
心血管疾病已成为严重的全球公共卫生问题,在中国尤为突出。 值得注意的是,阻塞性睡眠呼吸暂停综合征(Obstructive Sleep Apnea, OSA)是高血压的重要危险因素,与心血管疾病(特别是高血压、心衰)的发生发展密切相关。 然而,公众对OSA危害的认知程度如何?其社会关注度与心血管疾病相比有何差异?
本文旨在利用文本挖掘技术(LDA主题模型),基于权威数据库(Resset行业数据库)和广泛的媒体平台数据(新闻媒体如人民日报、央视新闻;社交媒体如微博、抖音、微信公众号评论),分析社会公众对心血管疾病和阻塞性睡眠呼吸暂停(OSA)的关注度差异,以评估公众对OSA重要性的认识水平。
2、数据库介绍
2.1 Resset行业数据库
Resset行业数据库:业界结构最合理、分类最细致、数据量最丰富的行业数据库。数据来源包括国家局、地方局、农业部、交通部等权威部门。内容涵盖了财政与金融、人口与就业、教育与科技、文化与体育、资源与环境等多个领域的数据。在本文中主要借鉴了心血管疾病情况统计中的数据,对国内心血管疾病情况的分布进行统计研究。
2.2 媒体平台数据库
新闻媒体:国内媒体中,影响力最大的是人民日报和中央电视台,其所发布的新闻信息内容根据实际的事实情况进行事件的还原。本文的新闻咨询均来自以上权威部门,如:人民日报、央视新闻等。社交媒体:主要包括社交网站、微博、微信、博客、论坛等等。本文的社会舆论评论来自于微博、抖音和微信公众号评论等。
基于上述权威、全面的数据来源,本文将进行心血管疾病及阻塞性睡眠呼吸暂停现状的数据统计分析。
3、数据统计分析
3.1 心血管疾病现状
根据发布的《中国心血管病报告 2018》,中国心血管病患人数约 2.9 亿,其中冠心病约 1100 万,心力衰竭约 450 万,先天性心脏病约 200 万,高血压约 2.45 亿。冠心病的危害较大,表现为活动后气短、气促、胸闷,发生心肌梗塞。反复心梗、长期缺氧,最终导致心衰。心脏缺氧可诱发心肌梗死、心律失常。心力衰竭严重者还会导致心脏破裂和心脏坏死,甚至危及生命。

图1:心血管疾病患病人数及占比
心血管疾病死亡占中国疾病死亡总数的41%(约350万人)。50%的心肌梗死与高血压有关,40%-50%的心力衰竭是由高血压引起的。值得注意的是,睡眠呼吸暂停综合征是高血压的重要危险因素,而较高血压也会增加睡眠呼吸暂停综合征的严重程度,由于患者反复发作的低氧血症会引起系统性炎症反应,导致肾素-血管紧张素系统激活,从而引起血压升高。
3.2 阻塞性睡眠呼吸暂停现状
阻塞性睡眠呼吸暂停(Obstructive Sleep Apnea,OSA) ,是指患者在睡眠过程中反复出现呼吸暂停和低通气。临床上可表现为打鼾,鼾声大且不规律,白天出现嗜睡,记忆力下降,严重者出现认知功能下降、行为异常。由于OSA多发于肥胖及中老年人群,随着超重和肥胖人群的不断增多以及人口老龄化加剧,其患病率在全球范围内逐年提升已经成为一个重要的公共卫生问题。
根据2012年美国睡眠医学会判断标准,从2015年至2019年,全世界30-69岁OSA患病人数从 9.8 亿人增长至 10.5 亿人。预计到 2024 年,全球 OSA 患病人数将增加到 11.5 亿人左右。中国 30-69 岁 OSA 患病人数从 1.8 亿人上升 至 1.9 亿人。预计到 2024 年,中国 OSA 患病人数将增加到 2.1 亿人左右。中国 OSA患病率最高,其次是美国、巴西和印度。


图2 全球 OSA 患病人数 图3 中国 OSA 患病人数
OSA 患病率高,严重影响生活质量并且极易引发相关心血管高致死率的并发症,加剧患者疾病负担,随着患病人数的持续增加,患者健康管理和疾病预防意识提升,国内OSA诊断及治疗需求将进一步释放,检测睡眠呼吸暂停具有重要意义。
基于对心血管疾病及阻塞性睡眠呼吸暂停高患病率、高危害性及密切关联性的现状分析,为深入探究社会公众对此的关注度与认知差异,本文将建立基于文本挖掘的社会关注度模型进行分析。
4、模型的建立(基于文本挖掘的社会关注度模型)
基于文本挖掘的社会关注度模型。首先基于社会广泛关注的新闻媒体和社交媒体中的评论数据文本生成潜在狄利克雷分布模型(Latent Dirichlet Allocation, LDA),通过词云可视化方法选择最佳的主题数并进行分类;然后分析主题文本中的情绪分数;最后使用共现网络提取数据文本中的关系信息,可视化主题关键词的共生邻居关系,分析文本的空间分布特征。
4.1 文本生成模型LDA
潜在狄利克雷分配(LDA)模型是一种主题模型,用于发现文档集合中的基础主题。以单词分布为特征的主题对应于通常共同出现的单词组。LDA是一种无监督主题模型,这意味着它不需要标记数据。文本数据来源于微博、抖音和新闻网等心血管病和呼吸暂停的有关评论。
主题模型采用概率的产生式模型来对文本进行建模,它的基本思想是每个文本都可以表示成一系列主题的混合分布。同时每个主题是词汇表中所有单词上的概率分布。在LDA中,文本的单词是可观测到的数据,而文本的主题是隐式变量。根据文本的生成规则和已知数据,LDA通过概率推导可以求得文本的主题结构。
目标有两个:①:找到每一篇文档的主题分布。②:得到每一个主题中词的分布。

图4:LDA算法示意图




4.1.1 使用词云可视化主题
导入数据并从下载数据库中的列中提取文本数据,对文本进行标记化,从文档中删除无关信息,创建单词袋模型,拟合具有七个主题的 LDA 模型,使用词云可视化前四个主题。下图分别是心血管疾病和呼吸暂停的词云可视化主题图。

图5:词云可视化(心血管病)

图6:词云可视化(呼吸暂停)
4.1.2 使用词云可视化主题
使用与训练数据相同的预处理函数,为一组以前未见过的文档创建标记化文档数组。将文档转换为主题概率的向量。
1)在条形图中绘制第一个文档的文档主题概率
使用相应主题的前三个单词标记主题。

图7:主题概率条形图(心血管病)

图8:主题概率条形图(呼吸暂停)
2)可视化文档的主题混合
使用堆叠条形图可视化多个主题组合。

图9:主题堆叠条形图(心血管病)

图10:主题堆叠条形图(呼吸暂停)
图中颜色从左往右依次对应图7-8文档主题概率条形图中的相应主题词。
4.1.3 使用词云可视化主题
t-SNE算法将高维向量投影到 2-D 空间。这种嵌入使得可视化高维向量之间的相似性变得容易。通过根据 t-SNE 算法绘制文档主题混合,将属性中的主题混合投影到二维空间中,可视化类似文档的聚类。图中颜色标号依次对应于图12-13文档主题概率条形图中的相应主题词。

图11:t-SNE可视化主题(心血管)

图12:t-SNE可视化主题(呼吸暂停)
结果显示:心血管疾病的主题可视化较为集中,表现为社会对其的关注度趋于统一;而呼吸暂停的主题可视化较为分散,表现为社会各界呈不同的观点与态度。
4.1.4 为LDA模型选择最佳主题数
通过计算一组未保留的文档的困惑度来评估 LDA 模型的拟合优度。困惑度表示模型描述一组文档的程度。较低的困惑度表明选择的主题数更适合。
1)提取和预处理文本数据
- 加载心血管疾病和呼吸暂停疾病的文本数据
- 对文本数据进行标记化和预处理
- 随机留出10%的文档进行验证
- 从训练文档创建单词包模型。删除总共出现次数不超过两次的字词。删除任何不包含字词的文档。
2)选择主题数量
显示图中每个主题数的困惑度和经过时间。在左轴上绘制困惑度,在右轴上绘制经过的时间。同时计算拟合优度和拟合时间,最大限度地减少困惑和权衡效果选择合适的主题数量。

图13:困惑度验证(心血管病)

图14:困惑度验证(呼吸暂停)
结果表明,拟合具有 5~10 个主题的模型是一个不错的选择。与具有不同主题数量的模型相比,困惑度较低。
在利用LDA模型对文本数据进行主题建模和可视化分析后,为了更全面地理解公众态度,本文将进一步分析文本中的情绪倾向。
4.2 分析文本中的情绪
使用价感知字典和符号推理器(VADER)算法进行情绪分析。VADER算法使用带注释的单词列表(情绪词典)和相应的情绪评分。分数接近 1 表示积极情绪,分数接近 -1 表示消极情绪,分数接近 0 表示中立情绪。
1)加载提取文件中的文本数据
2)从文本数据创建标记化文档数组
3)在词云中可视化具有积极和消极情绪的文本

图15:可视化情绪文本(心血管病)

图16:可视化情绪文本(呼吸暂停)
4)评估标记化文档的情绪
(a)ans (心血管病)=
-0.9001
-0.6124
-0.3287
-0.8804
-0.9477
-0.7783
(b)ans (呼吸暂停)=
-0.1779
-0.0370
0.2716
0.1531
-0.00003
结果分析:
由(a)所示情绪分数结果可知,该文章的情绪分数大多接近-1,表示消极情绪。少数分数在0.5附近,表示轻微的积极情绪,话题最终观点趋于极化。在新闻文章中,用语除了介绍出心血管疾病的时事新闻,也包括一些书面化的用语。民众普遍处于消极情绪,认为心血管疾病的危害极大,需要予以充分的重视。
由(b)所示情绪分数结果可知,数据中显示,持中立态度的人群占主导地位。从另一方面反映出人们对于睡眠呼吸暂停的重视程度不够,仅有部分人意识到了睡眠呼吸暂停的危害或者认为呼吸暂停并不可怕,话题最终观点趋于中立共识。
除了主题分布和情绪分析,探究文本中关键词之间的关系网络对于理解信息传播和公众关注焦点也至关重要。因此,本文最后将进行共生网络分析。
4.3 共生网络分析
共生网络分析被广泛的应用于描述微生物群落之间的相互作用机制,对于本文中信息传播机制同样适用。共现网络是一个无向图,节点对应于词汇表中的唯一单词,边缘对应于文档中单词共同出现的频率。使用共现网络可视化和提取文档语料库中单词之间关系的信息。具体步骤如下:
1)提取文件中的文本数据;
2)标记文本,将其转换为小写,并删除非索引字;
3)使用字袋模型创建字数统计矩阵;
4)将字数统计矩阵乘以其转置,计算单词共出现次数;
5)将共生矩阵转换为网络;
6)可视化网络。

图17:可视化共生网络(心血管)

图18:可视化共生网络(呼吸)
7)查找特定单词“XXX”的邻居
8)通过提取“XXX”这个词及其邻居的子图来可视化这个词的共存

图19:“cardiovascular”邻可视化(心血管)

图20:“breathe”邻可视化(呼吸)
结果分析:观察共生网络图19可知,“cardiovascular”一词在报告文本中呈现观点统一的特征,观察共生网络图20可知,“breathe”一词在文本中呈现观点互异的特征。
综合运用LDA主题模型、情绪分析和共生网络分析等文本挖掘技术,本文对心血管疾病和阻塞性睡眠呼吸暂停的社会关注度进行了多维度探究,现将得出研究结论。
5、研究结论
本文建立了基于文本挖掘的社会关注度模型,由可视化词云主题、可视化情绪文本和共生网络分析可知,民众对于心血管疾病的重视程度较高,但是对于睡眠呼吸暂停的重要性认识不足,检测睡眠呼吸暂停具有重意义。
心血管疾病已经成为世界严重的公共卫生安全事件之一,尽管主流社交媒体和医学杂志在逐步科普强调心血管疾病和睡眠呼吸暂停的危害性,但对于未受这些疾病困扰的人群普遍防范意识不足。通过上述对网友评论调研可得,大多网络评论抱有“调侃”、“轻视”的态度,这需要政府、医院等权威机构进行更有力的宣讲活动、更精准的医疗定位、更全面的健康数据、更优秀的诊断手段来帮助患者更好的康复、帮助潜在患者更早的筛查、帮助为患病的患者规避风险。为实现“健康中国”提供有力的制度保障和完备的医疗体系,为人民心脏健康、睡眠安稳保驾护航。
Tips:下一讲,我们将进一步探讨,心电信号处理与应用的其他部分。
以上就是基于文本挖掘(LDA)的睡眠呼吸暂停社会关注度分析的全部内容啦~
我们下期再见,拜拜(⭐v⭐) ~
(Ps:有代码实现需求,请见下列【微信名片】或【主页信息】,谢谢支持!~)
303

被折叠的 条评论
为什么被折叠?



