「ECG/RESP信号处理——(19)基于文本挖掘(LDA)的睡眠呼吸暂停社会关注度分析」2025年6月25日

目录

1、引言

2、数据库介绍

2.1 Resset行业数据库

2.2 媒体平台数据库 

3、数据统计分析

3.1 心血管疾病现状

3.2 阻塞性睡眠呼吸暂停现状

4、模型的建立(基于文本挖掘的社会关注度模型)

4.1 文本生成模型LDA     

4.1.1 使用词云可视化主题

4.1.2 使用词云可视化主题

4.1.3 使用词云可视化主题

4.1.4 为LDA模型选择最佳主题数

4.2 分析文本中的情绪    

4.3 共生网络分析

5、研究结论


1、引言

        心血管疾病已成为严重的全球公共卫生问题,在中国尤为突出。 值得注意的是,阻塞性睡眠呼吸暂停综合征(Obstructive Sleep Apnea, OSA)是高血压的重要危险因素,与心血管疾病(特别是高血压、心衰)的发生发展密切相关。 然而,公众对OSA危害的认知程度如何?其社会关注度与心血管疾病相比有何差异?

        本文旨在利用文本挖掘技术(LDA主题模型),基于权威数据库(Resset行业数据库)和广泛的媒体平台数据(新闻媒体如人民日报、央视新闻;社交媒体如微博、抖音、微信公众号评论),分析社会公众对心血管疾病和阻塞性睡眠呼吸暂停(OSA)的关注度差异,以评估公众对OSA重要性的认识水平。

2、数据库介绍

2.1 Resset行业数据库

        Resset行业数据库:业界结构最合理、分类最细致、数据量最丰富的行业数据库。数据来源包括国家局、地方局、农业部、交通部等权威部门。内容涵盖了财政与金融、人口与就业、教育与科技、文化与体育、资源与环境等多个领域的数据。在本文中主要借鉴了心血管疾病情况统计中的数据,对国内心血管疾病情况的分布进行统计研究。       

2.2 媒体平台数据库 

        新闻媒体:国内媒体中,影响力最大的是人民日报和中央电视台,其所发布的新闻信息内容根据实际的事实情况进行事件的还原。本文的新闻咨询均来自以上权威部门,如:人民日报、央视新闻等。社交媒体:主要包括社交网站、微博、微信、博客、论坛等等。本文的社会舆论评论来自于微博、抖音和微信公众号评论等。

        基于上述权威、全面的数据来源,本文将进行心血管疾病及阻塞性睡眠呼吸暂停现状的数据统计分析。

3、数据统计分析

3.1 心血管疾病现状

        根据发布的《中国心血管病报告 2018》,中国心血管病患人数约 2.9 亿,其中冠心病约 1100 万,心力衰竭约 450 万,先天性心脏病约 200 万,高血压约 2.45 亿。冠心病的危害较大,表现为活动后气短、气促、胸闷,发生心肌梗塞。反复心梗、长期缺氧,最终导致心衰。心脏缺氧可诱发心肌梗死、心律失常。心力衰竭严重者还会导致心脏破裂和心脏坏死,甚至危及生命。

图1:心血管疾病患病人数及占比

        心血管疾病死亡占中国疾病死亡总数的41%(约350万人)。50%的心肌梗死与高血压有关,40%-50%的心力衰竭是由高血压引起的。值得注意的是,睡眠呼吸暂停综合征是高血压的重要危险因素,而较高血压也会增加睡眠呼吸暂停综合征的严重程度,由于患者反复发作的低氧血症会引起系统性炎症反应,导致肾素-血管紧张素系统激活,从而引起血压升高。

3.2 阻塞性睡眠呼吸暂停现状

        阻塞性睡眠呼吸暂停(Obstructive Sleep Apnea,OSA) ,是指患者在睡眠过程中反复出现呼吸暂停和低通气。临床上可表现为打鼾,鼾声大且不规律,白天出现嗜睡,记忆力下降,严重者出现认知功能下降、行为异常。由于OSA多发于肥胖及中老年人群,随着超重和肥胖人群的不断增多以及人口老龄化加剧,其患病率在全球范围内逐年提升已经成为一个重要的公共卫生问题。

        根据2012年美国睡眠医学会判断标准,从2015年至2019年,全世界30-69岁OSA患病人数从 9.8 亿人增长至 10.5 亿人。预计到 2024 年,全球 OSA 患病人数将增加到 11.5 亿人左右。中国 30-69 岁 OSA 患病人数从 1.8 亿人上升 至 1.9 亿人。预计到 2024 年,中国 OSA 患病人数将增加到 2.1 亿人左右。中国 OSA患病率最高,其次是美国、巴西和印度。

图2 全球 OSA 患病人数              图3 中国 OSA 患病人数

        OSA 患病率高,严重影响生活质量并且极易引发相关心血管高致死率的并发症,加剧患者疾病负担,随着患病人数的持续增加,患者健康管理和疾病预防意识提升,国内OSA诊断及治疗需求将进一步释放,检测睡眠呼吸暂停具有重要意义。

        基于对心血管疾病及阻塞性睡眠呼吸暂停高患病率、高危害性及密切关联性的现状分析,为深入探究社会公众对此的关注度与认知差异,本文将建立基于文本挖掘的社会关注度模型进行分析。

4、模型的建立(基于文本挖掘的社会关注度模型)

        基于文本挖掘的社会关注度模型。首先基于社会广泛关注的新闻媒体和社交媒体中的评论数据文本生成潜在狄利克雷分布模型(Latent Dirichlet Allocation, LDA),通过词云可视化方法选择最佳的主题数并进行分类;然后分析主题文本中的情绪分数;最后使用共现网络提取数据文本中的关系信息,可视化主题关键词的共生邻居关系,分析文本的空间分布特征。

4.1 文本生成模型LDA     

        潜在狄利克雷分配(LDA)模型是一种主题模型,用于发现文档集合中的基础主题。以单词分布为特征的主题对应于通常共同出现的单词组。LDA是一种无监督主题模型,这意味着它不需要标记数据。文本数据来源于微博、抖音和新闻网等心血管病和呼吸暂停的有关评论。

        主题模型采用概率的产生式模型来对文本进行建模,它的基本思想是每个文本都可以表示成一系列主题的混合分布。同时每个主题是词汇表中所有单词上的概率分布。在LDA中,文本的单词是可观测到的数据,而文本的主题是隐式变量。根据文本的生成规则和已知数据,LDA通过概率推导可以求得文本的主题结构。  

        目标有两个:①:找到每一篇文档的主题分布。:得到每一个主题中词的分布。

图4:LDA算法示意图

4.1.1 使用词云可视化主题

        导入数据并从下载数据库中的列中提取文本数据,对文本进行标记化,从文档中删除无关信息,创建单词袋模型,拟合具有七个主题的 LDA 模型,使用词云可视化前四个主题。下图分别是心血管疾病和呼吸暂停的词云可视化主题图。

                        图5:词云可视化(心血管病)                     

图6:词云可视化(呼吸暂停)

4.1.2 使用词云可视化主题

        使用与训练数据相同的预处理函数,为一组以前未见过的文档创建标记化文档数组。将文档转换为主题概率的向量。

1)在条形图中绘制第一个文档的文档主题概率

        使用相应主题的前三个单词标记主题。

图7:主题概率条形图(心血管病)

图8:主题概率条形图(呼吸暂停)

2)可视化文档的主题混合

        使用堆叠条形图可视化多个主题组合。

图9:主题堆叠条形图(心血管病)

图10:主题堆叠条形图(呼吸暂停)

        图中颜色从左往右依次对应图7-8文档主题概率条形图中的相应主题词。

4.1.3 使用词云可视化主题

        t-SNE算法将高维向量投影到 2-D 空间。这种嵌入使得可视化高维向量之间的相似性变得容易。通过根据 t-SNE 算法绘制文档主题混合,将属性中的主题混合投影到二维空间中,可视化类似文档的聚类。图中颜色标号依次对应于图12-13文档主题概率条形图中的相应主题词。

图11:t-SNE可视化主题(心血管)

图12:t-SNE可视化主题(呼吸暂停)

        结果显示:心血管疾病的主题可视化较为集中,表现为社会对其的关注度趋于统一;而呼吸暂停的主题可视化较为分散,表现为社会各界呈不同的观点与态度

4.1.4 为LDA模型选择最佳主题数

通过计算一组未保留的文档的困惑度来评估 LDA 模型的拟合优度。困惑度表示模型描述一组文档的程度。较低的困惑度表明选择的主题数更适合。

1)提取和预处理文本数据

  • 加载心血管疾病和呼吸暂停疾病的文本数据
  • 对文本数据进行标记化和预处理
  • 随机留出10%的文档进行验证
  • 从训练文档创建单词包模型。删除总共出现次数不超过两次的字词。删除任何不包含字词的文档。

2)选择主题数量

        显示图中每个主题数的困惑度和经过时间。在左轴上绘制困惑度,在右轴上绘制经过的时间。同时计算拟合优度和拟合时间,最大限度地减少困惑和权衡效果选择合适的主题数量。

图13:困惑度验证(心血管病)

图14:困惑度验证(呼吸暂停)

        结果表明,拟合具有 5~10 个主题的模型是一个不错的选择。与具有不同主题数量的模型相比,困惑度较低。

        在利用LDA模型对文本数据进行主题建模和可视化分析后,为了更全面地理解公众态度,本文将进一步分析文本中的情绪倾向。

4.2 分析文本中的情绪    

        使用价感知字典和符号推理器(VADER)算法进行情绪分析。VADER算法使用带注释的单词列表(情绪词典)和相应的情绪评分。分数接近 1 表示积极情绪,分数接近 -1 表示消极情绪,分数接近 0 表示中立情绪。

1)加载提取文件中的文本数据

2)从文本数据创建标记化文档数组

3)在词云中可视化具有积极和消极情绪的文本

图15:可视化情绪文本(心血管病)

图16:可视化情绪文本(呼吸暂停)

4)评估标记化文档的情绪

(a)ans (心血管病)=

   -0.9001

   -0.6124

   -0.3287

   -0.8804

   -0.9477

   -0.7783

(b)ans (呼吸暂停)=

      -0.1779

      -0.0370

       0.2716

       0.1531

      -0.00003

结果分析:

        由(a)所示情绪分数结果可知,该文章的情绪分数大多接近-1,表示消极情绪。少数分数在0.5附近,表示轻微的积极情绪,话题最终观点趋于极化。在新闻文章中,用语除了介绍出心血管疾病的时事新闻,也包括一些书面化的用语。民众普遍处于消极情绪,认为心血管疾病的危害极大,需要予以充分的重视。

        由(b)所示情绪分数结果可知,数据中显示,持中立态度的人群占主导地位。从另一方面反映出人们对于睡眠呼吸暂停的重视程度不够,仅有部分人意识到了睡眠呼吸暂停的危害或者认为呼吸暂停并不可怕,话题最终观点趋于中立共识。

        除了主题分布和情绪分析,探究文本中关键词之间的关系网络对于理解信息传播和公众关注焦点也至关重要。因此,本文最后将进行共生网络分析。

4.3 共生网络分析

        共生网络分析被广泛的应用于描述微生物群落之间的相互作用机制,对于本文中信息传播机制同样适用。共现网络是一个无向图,节点对应于词汇表中的唯一单词,边缘对应于文档中单词共同出现的频率。使用共现网络可视化和提取文档语料库中单词之间关系的信息。具体步骤如下:

1)提取文件中的文本数据;

2)标记文本,将其转换为小写,并删除非索引字;

3)使用字袋模型创建字数统计矩阵;

4)将字数统计矩阵乘以其转置,计算单词共出现次数;

5)将共生矩阵转换为网络;

6)可视化网络。

图17:可视化共生网络(心血管)

图18:可视化共生网络(呼吸)

7)查找特定单词“XXX”的邻居

8)通过提取“XXX”这个词及其邻居的子图来可视化这个词的共存 

图19:“cardiovascular”邻可视化(心血管)

图20:“breathe”邻可视化(呼吸)

        结果分析:观察共生网络图19可知,“cardiovascular”一词在报告文本中呈现观点统一的特征,观察共生网络图20可知,“breathe”一词在文本中呈现观点互异的特征。

        综合运用LDA主题模型、情绪分析和共生网络分析等文本挖掘技术,本文对心血管疾病和阻塞性睡眠呼吸暂停的社会关注度进行了多维度探究,现将得出研究结论。

5、研究结论

        本文建立了基于文本挖掘的社会关注度模型,由可视化词云主题、可视化情绪文本和共生网络分析可知,民众对于心血管疾病的重视程度较高,但是对于睡眠呼吸暂停的重要性认识不足,检测睡眠呼吸暂停具有重意义。

        心血管疾病已经成为世界严重的公共卫生安全事件之一,尽管主流社交媒体和医学杂志在逐步科普强调心血管疾病和睡眠呼吸暂停的危害性,但对于未受这些疾病困扰的人群普遍防范意识不足。通过上述对网友评论调研可得,大多网络评论抱有“调侃”、“轻视”的态度,这需要政府、医院等权威机构进行更有力的宣讲活动、更精准的医疗定位、更全面的健康数据、更优秀的诊断手段来帮助患者更好的康复、帮助潜在患者更早的筛查、帮助为患病的患者规避风险。为实现“健康中国”提供有力的制度保障和完备的医疗体系,为人民心脏健康、睡眠安稳保驾护航。

Tips:下一讲,我们将进一步探讨,心电信号处理与应用的其他部分。

以上就是基于文本挖掘(LDA)的睡眠呼吸暂停社会关注度分析的全部内容啦~

我们下期再见,拜拜(⭐v⭐) ~

(Ps:有代码实现需求,请见下列【微信名片】或【主页信息】,谢谢支持!~)

代码转载自:https://pan.quark.cn/s/a4b39357ea24 在本项研究中,我们研究了如何运用8155微处理器扩展单元与74LS164串行到并行转换电路来操控八段数码管的显示。74LS164被视为一个核心部件,它使得串行数据能够转化为并行输出,这对于驱动数码管极为关键,因为数码管普遍需要并行数据输入来点亮不同的段。74LS164的功能机制在于接收串行输入的数据,并在每个时钟脉冲之后将其转化为并行输出。在该配置中,8155的PB0引脚被用来管理数据位的输入,而PB1则承担时钟信号的角色。这表明我们可以通过调控8155的这两个引脚来决定何时将数据传输至74LS164,以及何时执行位移操作。 在编程层面,我们需要开发一段代码来处理上述流程。在提供的代码示例中,`DAT164`标识数据位地址,`CLK164`指代时钟位地址。`LEDBuf`是一个用于存放待显示数字的缓冲存储区,而`Num`则用于保存待显示的数值。`DisplayLED`子程序负责将数据从缓冲区`LEDBuf`搬运到74LS164,并通过8155的PB0和PB1引脚来调控74LS164的输入与时钟。 在`DisplayLED`子程序的操作中,首先会关闭所有的八段数码管,然后逐位从缓冲区`LEDBuf`中读取数据,通过循环右移指令(`rlc`)进行数据位移,并将最低位送入74LS164。在每次数据传输完成后,会通过变换PB1的电平(交替高低电平)来生成时钟脉冲,使74LS164能够接收新的数据。这一过程会重复8次,确保所有8段数码管的段码都被精确设置。通过调整`OUTBIT`的值来选择特定的数码管进行显示。 另外,实验还包含了8155 I/O/RAM扩展单元的应用。8155芯片提供...
内容概要:本文系统研究了计及电动汽车充电站接入的配电网承载能力评估与优化问题,提出了一套完整的基于Matlab代码实现的双层评价模型。通过构建涵盖系统安全性、经济性、电能质量及设备利用率等多维度的指标体系,采用熵权法进行客观权重计算,并结合模糊综合评价法实现承载能力的量化评分,全面评估不同渗透率下电动汽车接入对配电网的影响。研究通过算例仿真深入分析了各项指标的变化规律与灵敏度特性,验证了所提模型在承载能力动态评估中的科学性与实用性,为高比例电动汽车接入背景下的配电网规划、扩容改造与运行调度提供了有力的决策支持和技术路径。; 适合人群:具备电力系统分析基础、熟悉Matlab编程工具,从事新能源并网、智能配电网、电动汽车与电网互动(V2G)、电网承载力评估等相关领域的科研人员、工程技术人员及研究生。; 使用场景及目标:①科学评估大规模电动汽车充电负荷对配电网安全稳定运行的冲击及其承载极限;②优化充电站选址与接入策略以提升电网接纳能力;③为配电网的扩容规划、无功优化与调度运行提供量化的分析依据;④支撑相关科研项目、学位论文的建模、仿真与实证分析工作。; 阅读建议:建议结合文中提供的Matlab代码与详细的仿真算例进行复现,重点掌握熵权法确定权重与模糊综合评价的实现逻辑,深入理解各评估指标的物理含义及其在不同场景下的灵敏度表现,并可尝试将其拓展应用于其他类型的分布式电源接入评估或采用不同的优化算法进行模型改进。
打开链接下载源码: https://pan.quark.cn/s/a4b39357ea24 UDP(用户数据报协议)与TCP(传输控制协议)构成了互联网协议体系中的两大核心传输机制,它们在计算机网络通信过程中发挥着核心作用。本文将系统阐述这两种协议的特性以及相关的端口检测手段。 UDP是一种非连接型且不可信赖的传输协议。该协议无需建立连接即可传输数据,因此具备低时延与高效率的优势,常应用于视频会议、在线游戏等即时性应用场景。然而,由于缺乏可靠性保障,UDP无法确保数据包的顺序性、完整性及无重复性,可能引发数据遗失或错乱的情况。 另一方面,TCP是一种基于连接且可靠的传输协议。该协议在数据传输前必须先建立连接,从而确保数据能够准确且有序地抵达接收端,适用于文件传输、网页浏览等对稳定性要求较高的应用场景。尽管如此,这种可靠性也导致了较高的时延和资源消耗。 端口在网络通信领域中占据着关键地位,每个端口号均与特定的服务或应用程序相对应。端口号的取值范围介于0至65535之间,其中0-1023为知名端口,一般由系统进行预留使用;1024-49151为注册端口,可供应用程序选用;49152-65535为动态或私有端口。实施端口检测的主要目的是确认特定端口是否处于开放状态、是否已被占用,或是网络服务是否正常运作。 “UDP&TCP测试程序.exe”或许是一款用于检测UDP和TCP端口状态的实用工具,它能够协助用户评估网络连接的性能状况及潜在问题。此类工具通常具备以下几项功能: 1. 扫描:对指定的IP地址或IP地址段执行端口扫描,识别已开启的服务及其对应的端口。 2. 发送/接收数据:向特定端口发送UDP或TCP数据包,并记录接收到的响应,以此来验证端口的可用程度。 3. 连接测...
源码链接: https://pan.quark.cn/s/a4b39357ea24 在信息技术行业中,特别是在企业信息管理系统的应用中,常常需要应对多种数据整合与字段提取的挑战。本案例的核心在于利用Groovy脚本语言来达成一个具体目标:从明细数据表中提取相关字段值,并将其更新至主数据表对应的字段位置。此类操作在数据同步、报表制作以及业务流程自动化的多个场景中十分普遍。Groovy作为一种动态且适应性强的Java平台语言,具备精简的语法和卓越的元编程功能。在企业级应用系统如“致远”中,Groovy通常被用于开发满足特定业务需求的定制化逻辑。在此情境下,可能会涉及以下关键知识点: 1. **Groovy脚本编写**:Groovy使开发者能够以更贴近常语言的方式编写代码,从而减少不必要的语法复杂性。在自定义函数中,我们可以借助Groovy的面向对象特性,设立类和函数来处理明细表与主表的数据交换。 2. **数据访问**:Groovy能够便捷地与数据库建立连接,通过JDBC API或ORM框架(例如Hibernate)来查询明细表和主表。这可能包含SQL查询语句的编写,以及结果集的解析。 3. **字段映射**:为了将明细表中的字段值与主表对应,必须明确字段间的关联关系。这通常通过配置或编程实现,比如构建一个映射列表,以字段名称作为索引,随后依据索引值执行赋值操作。 4. **业务逻辑**:在描述中提及了依据表单字段进行计算,这可能包含条件筛选、循环处理、数学运算等复杂逻辑。Groovy提供了多样的控制流语句,可以方便地实现这些计算需求。 5. **动态更新主表**:计算所得的结果需要展示在主表的字段上,这涉及到对数据库的修改操作。Groovy能够调用更新指令,...
内容概要:本文针对有源中点箝位(ANPC)三电平并网逆变器在谐波抑制、电网不平衡工况适应性及动态响应性能方面的不足,提出了一种融合双极性倍频脉宽调制(DPWMA)、正负序分离锁相技术与电网电压前馈控制的一体化高性能并网控制策略。通过对ANPC拓扑结构的优势进行分析,结合DPWMA调制提升输出电能质量,利用正负序分离锁相实现电网异常工况下的精确同步,并引入电网电压前馈控制以增强系统抗扰能力和动态响应速度。仿真结果表明,该复合控制策略能显著降低并网电流谐波含量,提高锁相精度和系统稳定性,适用于电压不平衡、畸变及动态扰动等复杂电网环境下的大功率并网应用。; 适合人群:具备电力电子与电力系统基础知识,从事新能源并网、逆变器控制、微电网技术等相关领域的研究生、科研人员及工程技术人员。; 使用场景及目标:①提升大功率并网逆变器在非理想电网条件下的运行性能;②优化逆变器控制策略以实现高质量电能输出和快速动态响应;③为高性能并网系统的设计与仿真提供技术参考和实现方案。; 阅读建议:建议结合Simulink仿真模型进行实践验证,重点关注DPWMA调制的实现机制、正负序分离锁相环的设计方法以及前馈控制环节的参数整定过程,深入理解各模块之间的协同工作机制。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

知行算法

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值