本博客用于:
- 学习卫生统计学及流行病学中的各种概念与观点
- R语言实践方法
- 尝试融入数据科学
!!注意:虽然本博客是以数据科学的视角记录的,但文中用到的大部分术语都来自统计学而非数据科学,两者的相应关系会在后期补充,或于参考书籍【2】中查阅
参考书籍:
【1】R语言实战:第2版 / (美)卡巴科弗 著;王小宁等译. —— 北京 : 人民邮电出版社, 2016.5
ISBN 978-7-115-42057-2
【2】数据科学中的实用统计学 :第2版 /(美)彼得·布鲁斯,(美)安德鲁·布鲁斯,(德)彼得·格德克 著;陈光欣译. —— 北京 :人民邮电出版社,2021.10
ISBN 978-7-115-56902-8
【3】卫生统计学 / 李晓松主编.——8版.——北京:人民卫生出版社,2017
ISBN 978-7-117-24666-8
【4】统计学/贾俊平,何晓群,金勇进编著. ——8版.——北京:中国人民大学出版社,2021.10
ISBN 978-7-300-29310-3
【5】流行病学/沈洪兵,齐秀英主编.——9版.——北京:人民卫生出版社,2018
ISBN 978-7-117-26672-7
【6】流行病学/詹思延主编.——8版.——北京:人民卫生出版社,2017
ISBN 978-7-117-24557-9
什么是(卫生)统计学
统计学是关于数据的学科,其工作的展开即:
收集 分析
解释与表达
获得可靠结论
其是一门从经验中学习的学科,是面对不确定性时利用重复观测总结得到的经验和规律从而辅助决策的方法论
从经验中学习的过程属于归纳法,用统计学术语来表达则是:统计推断 —— 从总体(整体、普遍、事物内在规律)中抽取部分具有代表性的个体,对这些抽样所得的个体所组成的样本样本(个别、特殊、经验事实)进行观察与测量,获得相应数据,对数据进行分析并结合概率只是,透过样本数据对总体特征与规律进行推断的过程。
(因统计学最重要的特征是关注普遍性而非特殊性,所以其指导的决策不一定适用每一个个体)
我没见过!我怎么不是!我身边都是....
什么是流行病学
流行病学的相关定义很多,我们取其中最简要的:流行病学史研究疾病和健康状态在人群中的分布(此处的分布并不同于概率中的分布,这是流行病学的研究起点)及其影响因素(这是流行病学的研究重点),借以制定和评价预防、控制、消灭疾病及促进健康的策略与措施(这是流行病学的研究目的)的科学。
率
率表示的是一定条件下,某现象实际发生的例数与可能发生该现象的总例数之比,用来说明的是单位时间(指的是研究时间作为单位时间)能发生某现象的频率(即强度描述)

k = 100%,1000‰,10000/万,100000/10万等
比
-
相对比
表示两者之间的相对水平,常用倍数或百分数表示

当表示百分数时乘100%
甲乙指标可以性质相同或相异
-
构成比
表示事物内部各个组成部分所占总体的比重,常表示为百分数

实际使用中需要警惕使用比代替率
R的获取与安装
R是广泛应用于统计分析的高级语言,因为其开源、自由、免费的特征我们在这里使用R而不是SAS/SPSS
下载:https://cran.r-project.org/
根据你所使用的系统选择合适的已编译的二进制版本




Linux略 (都会吧应该都会的吧)
本文在Windows下使用R 4.2.1
觉得R本身的UI难看且不直观的可以加装RStudio
统计学基本概念
-
结构化数据的要素
结构化数据有两种基本类型:数值型(定量数据)和分类型(定性数据),当数值型数据的取值范围为连续不断的时其称为连续变量,而当其取值范围在某一区间上只取到离散值时称为离散变量,而对于定性数据,其有时会呈现出等级关系故称之为有序分类变量,又称之为等级变量,多数时间其并没有明显等级关系时称为无序分类变量,无序分类变量根据取值的不同又可分为两项分类变量又可分为多项分类变量

举个例子
整理好的数据形式样表
编号 年龄( 连续变量) 学历( 有序分类变量) 婚姻状况( 多项分类变量) 就业情况(两 项分类变量) 家庭人口数( 离散变量) 血型( 多项分类变量) 1 65 0 1 2 2 1 2 60 2 1 2 5 2 3 53 1 2 1 3 3 4 40 3 1 1 4 1 5 38 4 0 1 6 4其中编码意义:学历:文盲=0,小学=1,初中=2,高中=3,大专及以上=4;婚姻编码:未婚=0,已婚=1,离异=2,丧偶=3;就业情况编码:未就业=0,已就业=1,已退休=2;血型编码:A=1,B=2,O=3,AB=4
-
总体
包含所研究的全部个体的集合,它通常由所研究的全部个体组成
-
参数
用来描述总体特征的概括性数字度量,他是我们想要了解的总体的特征,参数通常用希腊字母表示
-
样本
指从总体中抽取的一部分元素的集合,构成样本的元素的数目称为样本量
-
统计量
用来描述样本特征的概括性数字度量,他是我们通过样本数据计算出的一个数字度量,样本通常用英文字母表示
数据的产生
-
数据的来源
所有的数据追踪其初始来源,都是来自调查或实验,但从使用者的角度来看,主要分为两类即:数据的间接来源(轶闻/可得数据)、数据的直接来源(抽样调查与试验研究数据)
-
数据的间接来源
指相关原始信息已经经过前人调查,我们只需要对这些原信息进行重新加工,整理,使之成为本次研究可用的数据,相对而言这种二手资料的收集比较容易,采集成本较低,并且能够快速获得,但其也具有局限性如可信度,收集时的口径是否一致,准确程度等等
-
数据的直接来源
这样的数据一般来自于我们经过明确的研究目的和严谨的设计,一般来自于抽样调查和实验研究两种统计设计和数据收集方法
-
抽样调查
描述性研究常常使用抽样调查,其从一总体之中抽取具有代表性的样本来调查,基本思想就是以样本推断总体(统计推断相关),在观察性研究中每个研究对象所处的状态无法由研究者决定
调查方法分为概率抽样和非概率抽样
概率抽样:简单随机抽样,分层抽样,整群抽样,系统抽样,分阶段抽样
非概率抽样:方便抽样,判断抽样,自愿样本,滚雪球抽样,配额抽样
根据研究情况后期补充其他调查方法,目前针对简单随机抽样进行介绍
-
简单随机抽样
样本与总体的概念在上一节已经做出了介绍,我们常常从一个总体中抽取一些有代表性的样本进行调查,不仅仅是简单随机抽样,所有的抽样调查的目的都是为了使用样本推测总体的信息
根据随机分配机制来进行样本的选择可以避免(降低)样本的选择偏倚,这种抽样不能融入抽样者或志愿者的主观意愿,但即便是这样仍然存在一些潜在的问题(误差)如:
抽样开始阶段并不能获得一个准确完整的总体列表
志愿者应答样本会使得调查产生偏倚,因为有极端意见的对象更有意愿进行回应
即便样本代表性很好,但因为测量存在误差得到的数据仍然具有问题
误差的相关概念在下一部分描述
-
实验研究
实验研究中研究对象的状态是由研究者决定的,由于研究对象的状态称为“给予人为的干预措施”,故又称为干预性研究
-
随机对照试验
施工中....
-
数据的误差
施工中....
数据的图表展示
注:此中可能会出现一些R函数
施工中....
数据的概括性度量
注:此中可能会出现一些R函数
-
集中趋势的度量
-
均值/算数均数
施工中...
-
截尾均值
施工中...
-
中位数
施工中...
-
四分位数
施工中...
-
众数
施工中...
-
几何均数
施工中...
-
离散趋势的度量
施工中...
-
全距
施工中...
-
四分位距
施工中...
-
方差和标准差
施工中...
-
离散系数
施工中...
-
标准分数
施工中...
-
分布形状的度量
施工中...
-
偏度系数
施工中...
-
峰度系数
施工中...
数据的关联性
注:此中可能会出现一些R函数
施工中....
常用的发病/患病指标
-
发病指标
-
发病率

k = 100%,1000‰,10000/万,100000/10万等
其中的一定时间需要根据问题特点来选定,一般以年为单位
新病例的确定依据其发病时间是否在研究时间内,对于难以确定的病症,发病时间常常用初次确诊时间代替,某些疾病在一年内可以多次发生于同一个人,那么可以计算为多个病例
分母中的同期暴露人口数一般难以获得,常用年平均人口数(7月1日零时人口数或年末年初相加/2)替代
当以年龄、性别、职业、地区将人群分组计算发病率时,发病率称为发病专率
发病率是衡量疾病流行程度的重要指标,反映疾病对人群健康影响的程度
-
罹(li)患率

k = 100%,1000‰
可以发现,罹患率与患病率公式相同,区别在于,罹患率中的一定时间一般被限定在较短的一段时间内,一般以日、周、月为单位,使用较为灵活,同期暴露人口数也较易于统计
-
续发率/二代发病率

指的是某些传染病在最短潜伏期和最长潜伏期之间,易感接触者中发病人数所占的百分比(定义上看更像是某种构成比)
常用于评价传染病传染力的强弱,分析传染病流行因素及评价卫生防疫措施的效果
-
患病指标
-
患病率/现患率
通常用来反映某些疾病的现患情况,可以为医院设施、人力、估计床位周转量、医疗质量及费用投入提供决策依据


其中以时点患病率易产生歧义,虽然使用“时点”这个词来描述,但实际上时点所指的时间并不超过一个月
期间为了避免季节交替带来的影响故一般所指时间不超过一个季度
-
患病率与发病率、病程的关系
当某种疾病的发病率和病程长期保持稳定时,患病率取决于发病率和病程

-
感染率

感染率性质类似于患病率,但其是用来计量使用检验手段检验出的感染者,一般用于隐性感染、病原携带、轻型、不典型、寄生虫患者的调查与防治评价
常用的死亡指标
-
死亡率
又称为粗死亡率,将不同地区死亡率进行比较时需要进行标准化
当人群以某种人口学特征(年龄,性别,职业等等)分别计算时称为死亡专率

常用来衡量某一时期某地区人群死亡风险性大小
当某些疾病生存时间很短,病死率很高时可以使用死亡专率代替发病率
-
病死率
一定时间内因某病死亡的人所占该病患病人群的比例,表达某病病人因该病死亡的风险性

病死率一般用来描述“确诊了xx病有xx%概率死亡” 以表达该疾病的严重性/某病的医疗诊治能力
-
婴儿/五岁及以下儿童死亡率

分子中的死亡婴儿总数存在一定的理解歧义
某年婴儿死亡总数实际上包括了:
上一年出生的未满周岁的婴儿在年内的死亡数
今年出生的未满周岁的婴儿在年内的死亡数

反映一周岁/五周岁以内儿童的死亡水平指标,正常情况下以一年/五年为一个计算单位,因某些地区婴儿死亡资料难以获得时使用五岁以下儿童死亡率
-
孕产妇死亡率
用来评价某地妇幼保健工作的质量的指标

孕产妇死亡总数包含两部分:
直接产科原因,包括妊娠合并症的疏忽和治疗不正确
简介产科原因,妊娠前已经存在的疾病由于妊娠使得病情恶化引起的死亡
-
生存率
指接受某种治疗后,经过n年随访尚且存活的人数所占比例,一般用于评价癌症,心血管疾病,结核等慢性病的研究

疾病的流行强度
-
散发
指某病在某地区人群中呈现历年的一般发病率水平,病例在人群中散在发生,相互之间无明显关联,一般当疾病的预防与控制手段有效时便会呈现散发状态
具体分析以当年的发病率和前三年的发病率作比较(虽然有些很明显可以目视识别出来,但严谨的研究设计应该使用假设检验来检验其显著性,这里先不对假设检验做介绍,仅仅需要知道假设检验可以判断数据是否存在显著性差异),如当年发病率未明显超过历年水平时为散发
-
流行
指某地区,某病在某时间的发病率显著超过历年水平,流行和散发作为相对的概念,当疾病超出散发的范围后即可说其出现了流行
-
大流行
首先应该满足流行的概念:某病在某时间的发病率现住超过历年水平,但疾病蔓延迅速,涉及地区广泛,短时间内成为省际,国际,洲际,甚至世界性的流行(H1N1,COVID-19等)
-
爆发
指在一个局部地区或者集体单位的人群中(这里就限制了爆发的界定范围在一个有限的人群中),短时间内突然发生了许多临床症状相似的病人,其往往是因为该局部地区的人群接触了共同的传染源或传播途径
疾病的分布
上述的几节我们介绍了一些常见的患病/发病指标,死亡指标,以及一些基本概念和R的安装,接下来开始描述疾病的分布,需要注意的是,这里的分布并不是概率中的概率分布的概念,而是一种比较抽象的概念,它实际是将发病/死亡/患病水平投射到空间,时间,人群上
-
地区分布
疾病在空间上的分布特征常常与地域空间的自然环境,社会环境等原因相关,如地形、温度、降水、微量元素、文化、经济、人口密度等种种因素将疾病的危险因素不均匀的分布在了空间上从而造成了疾病也不均匀的分布在人群中
一般在描述地区分布时采用基于社会分布的“行政区划法”或“自然景观法”对资料进行分析
-
行政区划法
行政区划法简单易行,具体的划分取决于研究主体的大小,如在世界范围内可以按照洲,区域,国家划分,而在国家范围内可以按照省,市(非直辖),县/区,乡等划分
但该方法也存在一些问题:单一行政规划内往往会包含多种不同的自然环境因素,这样只考虑了社会因素,但忽视了自然环境因素对疾病分布造成的影响
此类划分方法往往体现在国家之间,国家之内各个行政区间,城乡之间的疾病分布差异
-
自然景观法
自然景观法依照山区、平原、河流、湖泊、草原、森林等自然边界和空间来划分
同行政区划法一样,该方法也存在相同的问题:这样只考虑了自然因素,但忽视了社会环境因素对疾病分布造成的影响,且因为常常会跨越行政区,资料完备情况存在较大差异,可实施性较差
-
地区聚集性
某地区发病及患病等疾病频率高于周围地区且超过了随机概率的情况
-
地方性疾病
由于自然/社会因素的影响,某些疾病常常存在于某一地区或只在一定范围的人群中发生,而不需要自外地输入
-
统计地方性
施工中....
-
自然地方性
施工中....
-
自然疫源性
施工中....
-
输入性/外来性疾病
凡是本国或本地区不存在/已消灭的传染病自其他区域/国家传入时称为输入性疾病
-
地方性疾病
施工中....
-
时间分布
施工中....
-
人群分布
施工中....
R入门
-
R的使用
施工中....
-
包
施工中....
-
批处理
施工中....
-
结果重用
施工中....
R中的数据
-
数据集的概念
施工中....
-
数据结构
施工中....
-
数据输入
施工中....
-
数据集标注
施工中....
-
实用函数
施工中....
R的图形初阶
-
使用图形
施工中....
-
图形参数
施工中....
-
图像中的文本,坐标轴,图例
施工中....
-
图形组合
施工中....

本文介绍了统计学与流行病学的基本概念,如疾病分布、率和比,强调了R语言在统计分析中的应用。通过R的获取与安装,探讨了数据的收集、分析和表示,涵盖了数据的图表展示、概括性度量和关联性。同时,讨论了疾病的发生率、患病率等流行病学指标,以及数据的间接和直接来源。

1303

被折叠的 条评论
为什么被折叠?



