提示 :此条目的主题不是
部分决定系数 (Coefficient of partial determination)。
在概率论 和统计学 中,偏相关 (: )度量了两个随机变量 在移除了其他控制变量(Confounding variables)的影响后的相关 程度。
在确定两个感兴趣变量之间的数值关系时,如果存在与这两个变量都相关的混杂变量 ,直接计算它们的相关系数 可能会产生误导性结果 (伪相关)。通过计算偏相关系数控制混杂变量,可以避免这种误导性信息。这正是多元线性回归 中包含其他右侧变量的动机;虽然多元回归给出了效应值 的无偏 结果,但它并不直接给出一个数值来度量两个感兴趣变量之间关系的强度。
例如,给定关于个人消费、收入和财富的经济数据,如果希望分析消费与收入之间的关系,而在计算相关系数时未能控制“财富”这一变量,可能会得到误导性的结果。因为收入可能与财富相关,而财富又与消费相关;直接测量的消费与收入之间的相关性可能会被这些其他相关性所“污染”。使用偏相关可以避免这个问题。
与普通的相关系数一样,偏相关系数的取值范围也是从 -1 到 1。
值 -1 表示在控制某些变量后,存在完全的负相关(即一个变量值越高,另一个变量值越低);
值 1 表示完全的正线性关系;
值 0 表示没有线性关系。
如果随机变量的联合分布 是多元正态分布 、其他椭圆分布 、多元超几何分布、多元负超几何分布、多项分布或狄利克雷分布,则偏相关与条件相关 一致,但一般情况下两者并不相同。[ 1]
形式上,给定一组
n
{\displaystyle n}
个控制变量
Z
=
{
Z
1
,
Z
2
,
…
,
Z
n
}
{\displaystyle \mathbf {Z} =\{Z_{1},Z_{2},\dots ,Z_{n}\}}
,变量
X
{\displaystyle X}
和
Y
{\displaystyle Y}
之间的偏相关系数
ρ
X
Y
⋅
Z
{\displaystyle \rho _{XY\cdot \mathbf {Z} }}
定义为:
X
{\displaystyle X}
关于
Z
{\displaystyle \mathbf {Z} }
的线性回归 的残差
e
X
{\displaystyle e_{X}}
与
Y
{\displaystyle Y}
关于
Z
{\displaystyle \mathbf {Z} }
的线性回归的残差
e
Y
{\displaystyle e_{Y}}
之间的相关系数 。
一阶偏相关(即
n
=
1
{\displaystyle n=1}
时)是相关系数与可移除相关系数之积的差,除以可移除相关系数的相异系数(coefficient of alienation)之积。[ 2]
计算样本偏相关的一种简单方法是求解两个相关的线性回归 问题,并计算残差之间的相关性 。
设
X
{\displaystyle X}
和
Y
{\displaystyle Y}
为取实数值的随机变量,
Z
{\displaystyle \mathbf {Z} }
为
n
{\displaystyle n}
维向量值随机变量。设
x
i
,
y
i
,
z
i
{\displaystyle x_{i},y_{i},\mathbf {z} _{i}}
表示从实随机变量
X
,
Y
,
Z
{\displaystyle X,Y,\mathbf {Z} }
的联合分布 中抽取的
N
{\displaystyle N}
个独立同分布 (i.i.d.)观测值中的第
i
{\displaystyle i}
个(其中
z
i
{\displaystyle \mathbf {z} _{i}}
增加了一个 1 以允许回归中的常数项)。
求解线性回归问题相当于找到
(
n
+
1
)
{\displaystyle (n+1)}
维回归系数向量
w
X
∗
{\displaystyle \mathbf {w} _{X}^{*}}
和
w
Y
∗
{\displaystyle \mathbf {w} _{Y}^{*}}
,使得:
w
X
∗
=
arg
min
w
{
∑
i
=
1
N
(
x
i
−
⟨
w
,
z
i
⟩
)
2
}
{\displaystyle \mathbf {w} _{X}^{*}=\arg \min _{\mathbf {w} }\left\{\sum _{i=1}^{N}(x_{i}-\langle \mathbf {w} ,\mathbf {z} _{i}\rangle )^{2}\right\}}
w
Y
∗
=
arg
min
w
{
∑
i
=
1
N
(
y
i
−
⟨
w
,
z
i
⟩
)
2
}
{\displaystyle \mathbf {w} _{Y}^{*}=\arg \min _{\mathbf {w} }\left\{\sum _{i=1}^{N}(y_{i}-\langle \mathbf {w} ,\mathbf {z} _{i}\rangle )^{2}\right\}}
其中
N
{\displaystyle N}
是观测数量,
⟨
w
,
z
i
⟩
{\displaystyle \langle \mathbf {w} ,\mathbf {z} _{i}\rangle }
是向量
w
{\displaystyle \mathbf {w} }
和
z
i
{\displaystyle \mathbf {z} _{i}}
之间的标量积 。
残差为:
e
X
,
i
=
x
i
−
⟨
w
X
∗
,
z
i
⟩
{\displaystyle e_{X,i}=x_{i}-\langle \mathbf {w} _{X}^{*},\mathbf {z} _{i}\rangle }
e
Y
,
i
=
y
i
−
⟨
w
Y
∗
,
z
i
⟩
{\displaystyle e_{Y,i}=y_{i}-\langle \mathbf {w} _{Y}^{*},\mathbf {z} _{i}\rangle }
样本偏相关系数即为这些新生成的残差 值之间的样本相关系数 :
ρ
^
X
Y
⋅
Z
=
N
∑
i
=
1
N
e
X
,
i
e
Y
,
i
−
∑
i
=
1
N
e
X
,
i
∑
i
=
1
N
e
Y
,
i
N
∑
i
=
1
N
e
X
,
i
2
−
(
∑
i
=
1
N
e
X
,
i
)
2
N
∑
i
=
1
N
e
Y
,
i
2
−
(
∑
i
=
1
N
e
Y
,
i
)
2
=
N
∑
i
=
1
N
e
X
,
i
e
Y
,
i
N
∑
i
=
1
N
e
X
,
i
2
N
∑
i
=
1
N
e
Y
,
i
2
.
{\displaystyle {\begin{aligned}{\hat {\rho }}_{XY\cdot \mathbf {Z} }&={\frac {N\sum _{i=1}^{N}e_{X,i}e_{Y,i}-\sum _{i=1}^{N}e_{X,i}\sum _{i=1}^{N}e_{Y,i}}{{\sqrt {N\sum _{i=1}^{N}e_{X,i}^{2}-\left(\sum _{i=1}^{N}e_{X,i}\right)^{2}}}~{\sqrt {N\sum _{i=1}^{N}e_{Y,i}^{2}-\left(\sum _{i=1}^{N}e_{Y,i}\right)^{2}}}}}\\&={\frac {N\sum _{i=1}^{N}e_{X,i}e_{Y,i}}{{\sqrt {N\sum _{i=1}^{N}e_{X,i}^{2}}}~{\sqrt {N\sum _{i=1}^{N}e_{Y,i}^{2}}}}}.\end{aligned}}}
在第一个表达式中,减号后的三项都等于 0,因为它们包含普通最小二乘法 回归的残差和(必定为 0)。
考虑三个变量
X
,
Y
,
Z
{\displaystyle X,Y,Z}
的以下数据:
X
Y
Z
2
1
0
4
2
0
15
3
1
20
4
1
计算变量
X
{\displaystyle X}
和
Y
{\displaystyle Y}
之间的皮尔逊相关系数 约为 0.970;而使用上述公式计算
X
{\displaystyle X}
和
Y
{\displaystyle Y}
之间的偏相关系数(控制
Z
{\displaystyle Z}
)则为 0.919。以下是使用 R语言 进行的计算:
> x <- c ( 2 , 4 , 15 , 20 )
> y <- c ( 1 , 2 , 3 , 4 )
> z <- c ( 0 , 0 , 1 , 1 )
# 将 x 对 z 进行回归并计算残差
> res_x <- lm ( x ~ z ) $ residuals
# 将 y 对 z 进行回归并计算残差
> res_y <- lm ( y ~ z ) $ residuals
# 计算残差的相关性
> cor ( res_x , res_y )
# [1] 0.919145
# 显示这与 x 和 y 之间的直接相关性不同
> cor ( x , y )
# [1] 0.9695016
求解线性回归问题在计算上可能非常昂贵。实际上,
n
{\displaystyle n}
阶偏相关(即
|
Z
|
=
n
{\displaystyle |\mathbf {Z} |=n}
)可以很容易地从三个
(
n
−
1
)
{\displaystyle (n-1)}
阶偏相关计算得出。零阶偏相关
ρ
X
Y
⋅
∅
{\displaystyle \rho _{XY\cdot \varnothing }}
定义为普通的相关系数
ρ
X
Y
{\displaystyle \rho _{XY}}
。
对于任意
Z
0
∈
Z
{\displaystyle Z_{0}\in \mathbf {Z} }
,有:[ 3]
ρ
X
Y
⋅
Z
=
ρ
X
Y
⋅
Z
∖
{
Z
0
}
−
ρ
X
Z
0
⋅
Z
∖
{
Z
0
}
ρ
Z
0
Y
⋅
Z
∖
{
Z
0
}
1
−
ρ
X
Z
0
⋅
Z
∖
{
Z
0
}
2
1
−
ρ
Z
0
Y
⋅
Z
∖
{
Z
0
}
2
{\displaystyle \rho _{XY\cdot \mathbf {Z} }={\frac {\rho _{XY\cdot \mathbf {Z} \setminus \{Z_{0}\}}-\rho _{XZ_{0}\cdot \mathbf {Z} \setminus \{Z_{0}\}}\rho _{Z_{0}Y\cdot \mathbf {Z} \setminus \{Z_{0}\}}}{{\sqrt {1-\rho _{XZ_{0}\cdot \mathbf {Z} \setminus \{Z_{0}\}}^{2}}}{\sqrt {1-\rho _{Z_{0}Y\cdot \mathbf {Z} \setminus \{Z_{0}\}}^{2}}}}}}
如果单纯地将此计算实现为递归算法 ,会产生指数级的时间复杂度 。然而,由于该计算具有重叠子问题 性质,使用动态规划 或简单地缓存递归调用的结果可以产生
O
(
n
3
)
{\displaystyle {\mathcal {O}}(n^{3})}
的复杂度。
特别地,当
Z
{\displaystyle Z}
是单个变量时,公式简化为:
ρ
X
Y
⋅
Z
=
ρ
X
Y
−
ρ
X
Z
ρ
Z
Y
1
−
ρ
X
Z
2
1
−
ρ
Z
Y
2
{\displaystyle \rho _{XY\cdot Z}={\frac {\rho _{XY}-\rho _{XZ}\rho _{ZY}}{{\sqrt {1-\rho _{XZ}^{2}}}{\sqrt {1-\rho _{ZY}^{2}}}}}}
偏相关也可以用联合精度矩阵 (Precision matrix)来表示。考虑一组随机变量
V
=
{
X
1
,
…
,
X
n
}
{\displaystyle \mathbf {V} =\{X_{1},\dots ,X_{n}\}}
。我们想要计算在给定其他所有变量
V
∖
{
X
i
,
X
j
}
{\displaystyle \mathbf {V} \setminus \{X_{i},X_{j}\}}
的情况下,变量
X
i
{\displaystyle X_{i}}
和
X
j
{\displaystyle X_{j}}
之间的偏相关。
假设(联合/完整)协方差矩阵
Σ
=
(
σ
i
j
)
{\displaystyle \Sigma =(\sigma _{ij})}
是正定矩阵 ,因此是可逆矩阵 。定义精度矩阵为
Ω
=
(
p
i
j
)
=
Σ
−
1
{\displaystyle \Omega =(p_{ij})=\Sigma ^{-1}}
,则:
ρ
X
i
X
j
⋅
V
∖
{
X
i
,
X
j
}
=
−
p
i
j
p
i
i
p
j
j
{\displaystyle \rho _{X_{i}X_{j}\cdot \mathbf {V} \setminus \{X_{i},X_{j}\}}=-{\frac {p_{ij}}{\sqrt {p_{ii}p_{jj}}}}}
1
计算此式需要求协方差矩阵
Σ
{\displaystyle \Sigma }
的逆
Σ
−
1
{\displaystyle \Sigma ^{-1}}
,时间复杂度为
O
(
n
3
)
{\displaystyle {\mathcal {O}}(n^{3})}
。值得注意的是,只需一次矩阵求逆即可获得
V
{\displaystyle \mathbf {V} }
中所有变量对之间的偏相关系数。
偏相关的几何解释(以
N
=
3
{\displaystyle N=3}
个观测值即二维平面为例)
设三个变量
X
,
Y
,
Z
{\displaystyle X,Y,Z}
(其中
Z
{\displaystyle Z}
是“控制”或“额外变量”)是从
n
{\displaystyle n}
个变量
V
{\displaystyle \mathbf {V} }
的联合概率分布中选出的。进一步设
v
i
,
1
≤
i
≤
N
{\displaystyle \mathbf {v} _{i},1\leq i\leq N}
是从
V
{\displaystyle \mathbf {V} }
的联合概率分布中抽取的
N
{\displaystyle N}
个
n
{\displaystyle n}
维独立同分布 观测值。
考虑由观测值形成的
N
{\displaystyle N}
维向量
x
{\displaystyle \mathbf {x} }
、
y
{\displaystyle \mathbf {y} }
和
z
{\displaystyle \mathbf {z} }
。
可以证明,来自
X
{\displaystyle X}
对
Z
{\displaystyle \mathbf {Z} }
的线性回归的残差
e
X
,
i
{\displaystyle e_{X,i}}
,如果视为一个
N
{\displaystyle N}
维向量
e
X
{\displaystyle \mathbf {e} _{X}}
(在附图中记为
r
X
{\displaystyle \mathbf {r} _{X}}
),与
Z
{\displaystyle \mathbf {Z} }
生成的向量
z
{\displaystyle \mathbf {z} }
的标量积 为零。这意味着残差向量位于垂直于
z
{\displaystyle \mathbf {z} }
的
(
N
−
1
)
{\displaystyle (N-1)}
维超平面
S
z
{\displaystyle S_{\mathbf {z} }}
上。
同理也适用于
Y
{\displaystyle Y}
的残差向量
e
Y
{\displaystyle \mathbf {e} _{Y}}
。所需的偏相关就是向量
x
{\displaystyle \mathbf {x} }
和
y
{\displaystyle \mathbf {y} }
在垂直于
z
{\displaystyle \mathbf {z} }
的超平面上的投影
e
X
{\displaystyle \mathbf {e} _{X}}
和
e
Y
{\displaystyle \mathbf {e} _{Y}}
之间夹角
ϕ
{\displaystyle \phi }
的余弦 。[ 4] : ch. 7
假设所有涉及的变量都是多元高斯分布 的,偏相关
ρ
X
Y
⋅
Z
{\displaystyle \rho _{XY\cdot \mathbf {Z} }}
为零当且仅当
X
{\displaystyle X}
在给定
Z
{\displaystyle \mathbf {Z} }
的条件下与
Y
{\displaystyle Y}
条件独立 。[ 1] 这一性质在一般情况下不成立。
为了检验 样本偏相关
ρ
^
X
Y
⋅
Z
{\displaystyle {\hat {\rho }}_{XY\cdot \mathbf {Z} }}
是否意味着总体偏相关不为 0,可以使用偏相关的费希尔变换 (Fisher's z-transform):
z
(
ρ
^
X
Y
⋅
Z
)
=
1
2
ln
(
1
+
ρ
^
X
Y
⋅
Z
1
−
ρ
^
X
Y
⋅
Z
)
{\displaystyle z({\hat {\rho }}_{XY\cdot \mathbf {Z} })={\frac {1}{2}}\ln \left({\frac {1+{\hat {\rho }}_{XY\cdot \mathbf {Z} }}{1-{\hat {\rho }}_{XY\cdot \mathbf {Z} }}}\right)}
零假设 是
H
0
:
ρ
X
Y
⋅
Z
=
0
{\displaystyle H_{0}:\rho _{XY\cdot \mathbf {Z} }=0}
,针对双尾备择假设
H
A
:
ρ
X
Y
⋅
Z
≠
0
{\displaystyle H_{A}:\rho _{XY\cdot \mathbf {Z} }\neq 0}
。如果下式成立,则拒绝
H
0
{\displaystyle H_{0}}
:
N
−
|
Z
|
−
3
⋅
|
z
(
ρ
^
X
Y
⋅
Z
)
|
>
Φ
−
1
(
1
−
α
/
2
)
{\displaystyle {\sqrt {N-|\mathbf {Z} |-3}}\cdot |z({\hat {\rho }}_{XY\cdot \mathbf {Z} })|>\Phi ^{-1}(1-\alpha /2)}
其中
Φ
{\displaystyle \Phi }
是具有零均值 和单位标准差 的高斯分布 的累积分布函数 ,
α
{\displaystyle \alpha }
是显著性水平 ,
N
{\displaystyle N}
是样本大小 。
半偏相关 (Semipartial correlation,或 part correlation)统计量与偏相关统计量类似;两者都比较两个变量在控制某些因素后的变异。然而,计算半偏相关时,第三个变量仅针对
X
{\displaystyle X}
或
Y
{\displaystyle Y}
中的一个保持常数,而不是同时针对两者。[ 5] 偏相关比较的是一个变量的唯一变异与另一个变量的唯一变异,而半偏相关比较的是一个变量的唯一变异(移除了与
Z
{\displaystyle Z}
相关的变异)与另一个变量的未过滤变异。
半偏相关可以被视为更具有实际相关性,因为它相对于因变量(响应变量)的总变异进行了缩放。相反,它在理论上的用处较小,因为它对自变量的唯一贡献的作用不那么精确。
X
{\displaystyle X}
与
Y
{\displaystyle Y}
的半偏相关的绝对值总是小于或等于
X
{\displaystyle X}
与
Y
{\displaystyle Y}
的偏相关。原因如下:假设从
X
{\displaystyle X}
中移除了
X
{\displaystyle X}
与
Z
{\displaystyle Z}
的相关性,得到残差向量
e
x
{\displaystyle e_{x}}
。在计算半偏相关时,
Y
{\displaystyle Y}
仍然包含唯一方差和由于其与
Z
{\displaystyle Z}
关联而产生的方差。但是
e
x
{\displaystyle e_{x}}
由于与
Z
{\displaystyle Z}
不相关,只能解释
Y
{\displaystyle Y}
方差中唯一的一部分,而不能解释与
Z
{\displaystyle Z}
相关的那部分。相比之下,对于偏相关,只有
e
y
{\displaystyle e_{y}}
(
Y
{\displaystyle Y}
方差中与
Z
{\displaystyle Z}
无关的部分)需要被解释,因此原本
e
x
{\displaystyle e_{x}}
无法解释的那类方差在
e
y
{\displaystyle e_{y}}
中已经不存在了。
在时间序列 分析中,时间序列的偏自相关函数 (Partial autocorrelation function, PACF,有时也称为“偏相关函数”)定义为滞后
h
{\displaystyle h}
时的偏相关:
φ
(
h
)
=
ρ
X
0
X
h
⋅
{
X
1
,
…
,
X
h
−
1
}
{\displaystyle \varphi (h)=\rho _{X_{0}X_{h}\,\cdot \,\{X_{1},\,\dots \,,X_{h-1}\}}}
该函数用于确定自回归 (AR)过程的适当滞后长度。
当样本量小于变量数量(即高维数据设置)时,估计偏相关具有挑战性。在这种情况下,样本协方差
Σ
^
{\displaystyle {\hat {\Sigma }}}
是病态 的,求其逆矩阵
Ω
^
{\displaystyle {\hat {\Omega }}}
会出现问题。
收缩估计 (Shrinkage estimation)方法可以改善
Σ
^
{\displaystyle {\hat {\Sigma }}}
或
Ω
^
{\displaystyle {\hat {\Omega }}}
的估计,从而产生更可靠的偏相关估计。一个例子是 Ledoit-Wolf 收缩估计量:[ 6]
Σ
^
[
λ
]
=
λ
T
+
(
1
−
λ
)
Σ
{\displaystyle {\hat {\Sigma }}^{[\lambda ]}=\lambda T+(1-\lambda )\Sigma }
其中
Σ
^
{\displaystyle {\hat {\Sigma }}}
是样本协方差矩阵,
T
{\displaystyle T}
是目标矩阵(例如对角矩阵),收缩强度
λ
∈
(
0
,
1
)
{\displaystyle \lambda \in (0,1)}
。
Ledoit-Wolf 收缩下的偏相关估计为:[ 7]
P
^
i
j
[
λ
]
=
Ω
^
i
j
[
λ
]
Ω
^
i
i
[
λ
]
Ω
^
j
j
[
λ
]
{\displaystyle {\hat {P}}_{ij}^{[\lambda ]}={\frac {{\hat {\Omega }}_{ij}^{[\lambda ]}}{\sqrt {{\hat {\Omega }}_{ii}^{[\lambda ]}{\hat {\Omega }}_{jj}^{[\lambda ]}}}}}
其中
Ω
^
i
j
[
λ
]
{\displaystyle {\hat {\Omega }}_{ij}^{[\lambda ]}}
是
Σ
^
i
j
[
λ
]
{\displaystyle {\hat {\Sigma }}_{ij}^{[\lambda ]}}
的逆矩阵元素。这种方法应用于金融和基因组学等多个领域。
^ 1.0 1.1 Baba, Kunihiro; Ritei Shibata; Masaaki Sibuya. Partial correlation and conditional correlation as measures of conditional independence. Australian and New Zealand Journal of Statistics . 2004, 46 (4): 657–664. S2CID 123130024 . doi:10.1111/j.1467-842X.2004.00360.x .
^ Guilford J. P., Fruchter B. Fundamental statistics in psychology and education . Tokyo: McGraw-Hill Kogakusha, LTD. 1973.
^ Kim, Seongho. ppcor: An R Package for a Fast Calculation to Semi-partial Correlation Coefficients . Communications for Statistical Applications and Methods. November 2015, 22 (6): 665–674. ISSN 2287-7843 . PMC 4681537 . PMID 26688802 . doi:10.5351/CSAM.2015.22.6.665 .
^ Rummel, R. J. Understanding Correlation . 1976 [2026-01-22 ] . (原始内容存档 于2025-01-10).
^ Partial and Semipartial Correlation . (原始内容 存档于2014-02-06).
^ Ledoit, O., & Wolf, M. (2004). "A well-conditioned estimator for large-dimensional covariance matrices". Journal of Multivariate Analysis , 88(2), 365–411. https://doi.org/10.1016/S0047-259X(03)00096-4
^ Schäfer, J., & Strimmer, K. (2005). "A shrinkage approach to large-scale covariance matrix estimation and implications for functional genomics". Statistical applications in genetics and molecular biology , 4(1). https://doi.org/10.2202/1544-6115.1175