跳至內容

偏相關

本頁使用了標題或全文手工轉換
維基百科,自由的百科全書

在機率論和統計學中,偏相關(:)度量了兩個隨機變數在移除了其他控制變量(Confounding variables)的影響後的相關程度。

在確定兩個感興趣變量之間的數值關係時,如果存在與這兩個變量都相關的混雜變量,直接計算它們的相關係數可能會產生誤導性結果(偽相關)。通過計算偏相關係數控制混雜變量,可以避免這種誤導性資訊。這正是多元線性迴歸中包含其他右側變量的動機;雖然多元迴歸給出了效果量的不偏結果,但它並不直接給出一個數值來度量兩個感興趣變量之間關係的強度。

例如,給定關於個人消費、收入和財富的經濟數據,如果希望分析消費與收入之間的關係,而在計算相關係數時未能控制「財富」這一變量,可能會得到誤導性的結果。因為收入可能與財富相關,而財富又與消費相關;直接測量的消費與收入之間的相關性可能會被這些其他相關性所「污染」。使用偏相關可以避免這個問題。

與普通的相關係數一樣,偏相關係數的取值範圍也是從 -1 到 1。

  • 值 -1 表示在控制某些變量後,存在完全的負相關(即一個變量值越高,另一個變量值越低);
  • 值 1 表示完全的正線性關係;
  • 值 0 表示沒有線性關係。

如果隨機變數的聯合分布是多元常態分布、其他橢圓分布、多元超幾何分布、多元負超幾何分布、多項分布或狄利克雷分布,則偏相關與條件相關一致,但一般情況下兩者並不相同。[1]

正式定義

[編輯]

形式上,給定一組 個控制變量 ,變量 和 之間的偏相關係數 定義為: 關於 的線性迴歸的殘差 與 關於 的線性迴歸的殘差 之間的相關係數。

一階偏相關(即 時)是相關係數與可移除相關係數之積的差,除以可移除相關係數的相異係數(coefficient of alienation)之積。[2]

計算方法

[編輯]

使用線性迴歸

[編輯]

計算樣本偏相關的一種簡單方法是求解兩個相關的線性迴歸問題,並計算殘差之間的相關性。

設 和 為取實數值的隨機變數, 為 維向量值隨機變數。設 表示從實隨機變數 的聯合分布中抽取的 個獨立同分布(i.i.d.)觀測值中的第 個(其中 增加了一個 1 以允許迴歸中的常數項)。

求解線性迴歸問題相當於找到 維迴歸係數向量 和 ,使得:

其中 是觀測數量, 是向量 和 之間的純量積。

殘差為:

樣本偏相關係數即為這些新生成的殘差值之間的樣本相關係數:

在第一個表達式中,減號後的三項都等於 0,因為它們包含普通最小平方法迴歸的殘差和(必定為 0)。

示例

[編輯]

考慮三個變量 的以下數據:

X Y Z
2 1 0
4 2 0
15 3 1
20 4 1

計算變量 和 之間的皮爾森相關係數約為 0.970;而使用上述公式計算 和 之間的偏相關係數(控制 )則為 0.919。以下是使用 R語言 進行的計算:

> x <- c(2, 4, 15, 20)
> y <- c(1, 2,  3,  4)
> z <- c(0, 0,  1,  1)

# 将 x 对 z 进行回归并计算残差
> res_x <- lm(x ~ z)$residuals

# 将 y 对 z 进行回归并计算残差
> res_y <- lm(y ~ z)$residuals

# 计算残差的相关性
> cor(res_x, res_y)
# [1] 0.919145

# 显示这与 x 和 y 之间的直接相关性不同
> cor(x, y)
# [1] 0.9695016

使用遞推公式

[編輯]

求解線性迴歸問題在計算上可能非常昂貴。實際上, 階偏相關(即 )可以很容易地從三個 階偏相關計算得出。零階偏相關 定義為普通的相關係數 。

對於任意 ,有:[3]

如果單純地將此計算實現為遞迴算法,會產生指數級的時間複雜度。然而,由於該計算具有重疊子問題性質,使用動態規劃或簡單地緩存遞迴調用的結果可以產生 的複雜度。

特別地,當 是單個變量時,公式簡化為:

使用矩陣求逆

[編輯]

偏相關也可以用聯合精度矩陣(Precision matrix)來表示。考慮一組隨機變數 。我們想要計算在給定其他所有變量 的情況下,變量 和 之間的偏相關。

假設(聯合/完整)共變異數矩陣 是正定矩陣,因此是可逆矩陣。定義精度矩陣為 ,則:

1

計算此式需要求共變異數矩陣 的逆 ,時間複雜度為 。值得注意的是,只需一次矩陣求逆即可獲得 中所有變量對之間的偏相關係數。

解釋

[編輯]

幾何解釋

[編輯]
偏相關的幾何解釋(以 個觀測值即二維平面為例)

設三個變量 (其中 是「控制」或「額外變量」)是從 個變量 的聯合機率分布中選出的。進一步設 是從 的聯合機率分布中抽取的 個 維獨立同分布觀測值。

考慮由觀測值形成的 維向量 、 和 。 可以證明,來自 對 的線性迴歸的殘差 ,如果視為一個 維向量 (在附圖中記為 ),與 生成的向量 的純量積為零。這意味著殘差向量位於垂直於 的 維超平面 上。

同理也適用於 的殘差向量 。所需的偏相關就是向量 和 在垂直於 的超平面上的投影 和 之間夾角 的餘弦。[4]: ch. 7 

作為條件獨立性測試

[編輯]

假設所有涉及的變量都是多元高斯分布的,偏相關 為零若且唯若 在給定 的條件下與 條件獨立。[1] 這一性質在一般情況下不成立。

為了檢定樣本偏相關 是否意味著母體偏相關不為 0,可以使用偏相關的費雪轉換(Fisher's z-transform):

虛無假說是 ,針對雙尾對立假說 。如果下式成立,則拒絕 :

其中 是具有零均值和單位標準差的高斯分布的累積分布函數, 是顯著水準, 是樣本大小。

半偏相關

[編輯]

半偏相關(Semipartial correlation,或 part correlation)統計量與偏相關統計量類似;兩者都比較兩個變量在控制某些因素後的變異。然而,計算半偏相關時,第三個變量僅針對 或 中的一個保持常數,而不是同時針對兩者。[5] 偏相關比較的是一個變量的唯一變異與另一個變量的唯一變異,而半偏相關比較的是一個變量的唯一變異(移除了與 相關的變異)與另一個變量的未過濾變異。

半偏相關可以被視為更具有實際相關性,因為它相對於應變數(響應變量)的總變異進行了縮放。相反,它在理論上的用處較小,因為它對自變數的唯一貢獻的作用不那麼精確。

與 的半偏相關的絕對值總是小於或等於 與 的偏相關。原因如下:假設從 中移除了 與 的相關性,得到殘差向量 。在計算半偏相關時, 仍然包含唯一變異數和由於其與 關聯而產生的變異數。但是 由於與 不相關,只能解釋 變異數中唯一的一部分,而不能解釋與 相關的那部分。相比之下,對於偏相關,只有 ( 變異數中與 無關的部分)需要被解釋,因此原本 無法解釋的那類變異數在 中已經不存在了。

時間序列分析中的應用

[編輯]

在時間序列分析中,時間序列的偏自我相關函數(Partial autocorrelation function, PACF,有時也稱為「偏相關函數」)定義為滯後 時的偏相關:

該函數用於確定自我迴歸(AR)過程的適當滯後長度。

帶有收縮估計的偏相關

[編輯]

當樣本量小於變量數量(即高維數據設置)時,估計偏相關具有挑戰性。在這種情況下,樣本共變異數 是病態的,求其逆矩陣 會出現問題。

收縮估計(Shrinkage estimation)方法可以改善 或 的估計,從而產生更可靠的偏相關估計。一個例子是 Ledoit-Wolf 收縮估計量:[6]

其中 是樣本共變異數矩陣, 是目標矩陣(例如對角矩陣),收縮強度 。

Ledoit-Wolf 收縮下的偏相關估計為:[7]

其中 是 的逆矩陣元素。這種方法應用於金融和基因組學等多個領域。

參見

[編輯]

參考文獻

[編輯]
  1. ^ 1.0 1.1 Baba, Kunihiro; Ritei Shibata; Masaaki Sibuya. Partial correlation and conditional correlation as measures of conditional independence. Australian and New Zealand Journal of Statistics. 2004, 46 (4): 657–664. S2CID 123130024. doi:10.1111/j.1467-842X.2004.00360.x. 
  2. ^ Guilford J. P., Fruchter B. Fundamental statistics in psychology and education. Tokyo: McGraw-Hill Kogakusha, LTD. 1973. 
  3. ^ Kim, Seongho. ppcor: An R Package for a Fast Calculation to Semi-partial Correlation Coefficients. Communications for Statistical Applications and Methods. November 2015, 22 (6): 665–674. ISSN 2287-7843. PMC 4681537 可免費查閱. PMID 26688802. doi:10.5351/CSAM.2015.22.6.665. 
  4. ^ Rummel, R. J. Understanding Correlation. 1976 [2026-01-22]. (原始內容存檔於2025-01-10). 
  5. ^ Partial and Semipartial Correlation. (原始內容存檔於2014-02-06). 
  6. ^ Ledoit, O., & Wolf, M. (2004). "A well-conditioned estimator for large-dimensional covariance matrices". Journal of Multivariate Analysis, 88(2), 365–411. https://doi.org/10.1016/S0047-259X(03)00096-4
  7. ^ Schäfer, J., & Strimmer, K. (2005). "A shrinkage approach to large-scale covariance matrix estimation and implications for functional genomics". Statistical applications in genetics and molecular biology, 4(1). https://doi.org/10.2202/1544-6115.1175

外部連結

[編輯]