跳转到内容

偏相关

本页使用了标题或全文手工转换
维基百科,自由的百科全书

在概率论和统计学中,偏相关(:)度量了两个随机变量在移除了其他控制变量(Confounding variables)的影响后的相关程度。

在确定两个感兴趣变量之间的数值关系时,如果存在与这两个变量都相关的混杂变量,直接计算它们的相关系数可能会产生误导性结果(伪相关)。通过计算偏相关系数控制混杂变量,可以避免这种误导性信息。这正是多元线性回归中包含其他右侧变量的动机;虽然多元回归给出了效应值的无偏结果,但它并不直接给出一个数值来度量两个感兴趣变量之间关系的强度。

例如,给定关于个人消费、收入和财富的经济数据,如果希望分析消费与收入之间的关系,而在计算相关系数时未能控制“财富”这一变量,可能会得到误导性的结果。因为收入可能与财富相关,而财富又与消费相关;直接测量的消费与收入之间的相关性可能会被这些其他相关性所“污染”。使用偏相关可以避免这个问题。

与普通的相关系数一样,偏相关系数的取值范围也是从 -1 到 1。

  • 值 -1 表示在控制某些变量后,存在完全的负相关(即一个变量值越高,另一个变量值越低);
  • 值 1 表示完全的正线性关系;
  • 值 0 表示没有线性关系。

如果随机变量的联合分布是多元正态分布、其他椭圆分布、多元超几何分布、多元负超几何分布、多项分布或狄利克雷分布,则偏相关与条件相关一致,但一般情况下两者并不相同。[1]

正式定义

[编辑]

形式上,给定一组 个控制变量 ,变量 和 之间的偏相关系数 定义为: 关于 的线性回归的残差 与 关于 的线性回归的残差 之间的相关系数。

一阶偏相关(即 时)是相关系数与可移除相关系数之积的差,除以可移除相关系数的相异系数(coefficient of alienation)之积。[2]

计算方法

[编辑]

使用线性回归

[编辑]

计算样本偏相关的一种简单方法是求解两个相关的线性回归问题,并计算残差之间的相关性。

设 和 为取实数值的随机变量, 为 维向量值随机变量。设 表示从实随机变量 的联合分布中抽取的 个独立同分布(i.i.d.)观测值中的第 个(其中 增加了一个 1 以允许回归中的常数项)。

求解线性回归问题相当于找到 维回归系数向量 和 ,使得:

其中 是观测数量, 是向量 和 之间的标量积。

残差为:

样本偏相关系数即为这些新生成的残差值之间的样本相关系数:

在第一个表达式中,减号后的三项都等于 0,因为它们包含普通最小二乘法回归的残差和(必定为 0)。

示例

[编辑]

考虑三个变量 的以下数据:

X Y Z
2 1 0
4 2 0
15 3 1
20 4 1

计算变量 和 之间的皮尔逊相关系数约为 0.970;而使用上述公式计算 和 之间的偏相关系数(控制 )则为 0.919。以下是使用 R语言 进行的计算:

> x <- c(2, 4, 15, 20)
> y <- c(1, 2,  3,  4)
> z <- c(0, 0,  1,  1)

# 将 x 对 z 进行回归并计算残差
> res_x <- lm(x ~ z)$residuals

# 将 y 对 z 进行回归并计算残差
> res_y <- lm(y ~ z)$residuals

# 计算残差的相关性
> cor(res_x, res_y)
# [1] 0.919145

# 显示这与 x 和 y 之间的直接相关性不同
> cor(x, y)
# [1] 0.9695016

使用递推公式

[编辑]

求解线性回归问题在计算上可能非常昂贵。实际上, 阶偏相关(即 )可以很容易地从三个 阶偏相关计算得出。零阶偏相关 定义为普通的相关系数 。

对于任意 ,有:[3]

如果单纯地将此计算实现为递归算法,会产生指数级的时间复杂度。然而,由于该计算具有重叠子问题性质,使用动态规划或简单地缓存递归调用的结果可以产生 的复杂度。

特别地,当 是单个变量时,公式简化为:

使用矩阵求逆

[编辑]

偏相关也可以用联合精度矩阵(Precision matrix)来表示。考虑一组随机变量 。我们想要计算在给定其他所有变量 的情况下,变量 和 之间的偏相关。

假设(联合/完整)协方差矩阵 是正定矩阵,因此是可逆矩阵。定义精度矩阵为 ,则:

1

计算此式需要求协方差矩阵 的逆 ,时间复杂度为 。值得注意的是,只需一次矩阵求逆即可获得 中所有变量对之间的偏相关系数。

解释

[编辑]

几何解释

[编辑]
偏相关的几何解释(以 个观测值即二维平面为例)

设三个变量 (其中 是“控制”或“额外变量”)是从 个变量 的联合概率分布中选出的。进一步设 是从 的联合概率分布中抽取的 个 维独立同分布观测值。

考虑由观测值形成的 维向量 、 和 。 可以证明,来自 对 的线性回归的残差 ,如果视为一个 维向量 (在附图中记为 ),与 生成的向量 的标量积为零。这意味着残差向量位于垂直于 的 维超平面 上。

同理也适用于 的残差向量 。所需的偏相关就是向量 和 在垂直于 的超平面上的投影 和 之间夹角 的余弦。[4]: ch. 7 

作为条件独立性测试

[编辑]

假设所有涉及的变量都是多元高斯分布的,偏相关 为零当且仅当 在给定 的条件下与 条件独立。[1] 这一性质在一般情况下不成立。

为了检验样本偏相关 是否意味着总体偏相关不为 0,可以使用偏相关的费希尔变换(Fisher's z-transform):

零假设是 ,针对双尾备择假设 。如果下式成立,则拒绝 :

其中 是具有零均值和单位标准差的高斯分布的累积分布函数, 是显著性水平, 是样本大小。

半偏相关

[编辑]

半偏相关(Semipartial correlation,或 part correlation)统计量与偏相关统计量类似;两者都比较两个变量在控制某些因素后的变异。然而,计算半偏相关时,第三个变量仅针对 或 中的一个保持常数,而不是同时针对两者。[5] 偏相关比较的是一个变量的唯一变异与另一个变量的唯一变异,而半偏相关比较的是一个变量的唯一变异(移除了与 相关的变异)与另一个变量的未过滤变异。

半偏相关可以被视为更具有实际相关性,因为它相对于因变量(响应变量)的总变异进行了缩放。相反,它在理论上的用处较小,因为它对自变量的唯一贡献的作用不那么精确。

与 的半偏相关的绝对值总是小于或等于 与 的偏相关。原因如下:假设从 中移除了 与 的相关性,得到残差向量 。在计算半偏相关时, 仍然包含唯一方差和由于其与 关联而产生的方差。但是 由于与 不相关,只能解释 方差中唯一的一部分,而不能解释与 相关的那部分。相比之下,对于偏相关,只有 ( 方差中与 无关的部分)需要被解释,因此原本 无法解释的那类方差在 中已经不存在了。

时间序列分析中的应用

[编辑]

在时间序列分析中,时间序列的偏自相关函数(Partial autocorrelation function, PACF,有时也称为“偏相关函数”)定义为滞后 时的偏相关:

该函数用于确定自回归(AR)过程的适当滞后长度。

带有收缩估计的偏相关

[编辑]

当样本量小于变量数量(即高维数据设置)时,估计偏相关具有挑战性。在这种情况下,样本协方差 是病态的,求其逆矩阵 会出现问题。

收缩估计(Shrinkage estimation)方法可以改善 或 的估计,从而产生更可靠的偏相关估计。一个例子是 Ledoit-Wolf 收缩估计量:[6]

其中 是样本协方差矩阵, 是目标矩阵(例如对角矩阵),收缩强度 。

Ledoit-Wolf 收缩下的偏相关估计为:[7]

其中 是 的逆矩阵元素。这种方法应用于金融和基因组学等多个领域。

参见

[编辑]

参考文献

[编辑]
  1. ^ 1.0 1.1 Baba, Kunihiro; Ritei Shibata; Masaaki Sibuya. Partial correlation and conditional correlation as measures of conditional independence. Australian and New Zealand Journal of Statistics. 2004, 46 (4): 657–664. S2CID 123130024. doi:10.1111/j.1467-842X.2004.00360.x. 
  2. ^ Guilford J. P., Fruchter B. Fundamental statistics in psychology and education. Tokyo: McGraw-Hill Kogakusha, LTD. 1973. 
  3. ^ Kim, Seongho. ppcor: An R Package for a Fast Calculation to Semi-partial Correlation Coefficients. Communications for Statistical Applications and Methods. November 2015, 22 (6): 665–674. ISSN 2287-7843. PMC 4681537 可免费查阅. PMID 26688802. doi:10.5351/CSAM.2015.22.6.665. 
  4. ^ Rummel, R. J. Understanding Correlation. 1976 [2026-01-22]. (原始内容存档于2025-01-10). 
  5. ^ Partial and Semipartial Correlation. (原始内容存档于2014-02-06). 
  6. ^ Ledoit, O., & Wolf, M. (2004). "A well-conditioned estimator for large-dimensional covariance matrices". Journal of Multivariate Analysis, 88(2), 365–411. https://doi.org/10.1016/S0047-259X(03)00096-4
  7. ^ Schäfer, J., & Strimmer, K. (2005). "A shrinkage approach to large-scale covariance matrix estimation and implications for functional genomics". Statistical applications in genetics and molecular biology, 4(1). https://doi.org/10.2202/1544-6115.1175

外部链接

[编辑]