因果推論與研究設計
前面各章所發展的模型,無論是迴歸、結構方程、多層次或成長曲線,其估計的核心多為變項間的關聯與條件期望。然而,行為科學的許多根本問題本質上是因果的:某介入是否改善了學習、某風險因子是否導致了症狀、某政策是否產生了效果。這些問題無法僅靠「關聯有多強」來回答,因為關聯可源於因果,也可源於混淆、選擇或反向因果。「相關不蘊含因果」是一句人人會說的箴言,但它只是起點而非終點:現代因果推論的貢獻,正在於提供一套嚴謹的形式語言,讓「在什麼條件下,關聯可被詮釋為因果」這一問題得到精確的回答。
本章對因果推論作一系統的處理。首先建立兩個奠基性的框架:Rubin 的潛在結果框架與 Pearl 的因果圖,二者互補地界定了因果效果、識別的假設、以及混淆的結構。其次,闡明「控制變項」這一看似無害的操作何以可能製造而非消除偏誤,並系統呈現隨機化實驗、傾向分數、工具變項、差異中差異與迴歸不連續等識別策略。再者,處理因果中介、未測混淆的敏感度分析、以及結構方程模型與因果宣稱的關係。最後,論及縱貫因果推論的難處與可操弄性這一測量的哲學爭議。貫穿全章的核心訊息是:因果結論從不單由資料所給定,而總是資料與一組不可由資料本身檢驗的因果假設共同推得,方法的價值在於使這些假設明確、可辯護、且其後果可分析。
從相關到因果:問題的根本困難
因果推論的困難有其邏輯根源。欲知某介入對某個體的因果效果,理想上須比較「該個體接受介入」與「同一個體未接受介入」兩種情形下的結果之差。但任一個體在同一時點只能處於其一,另一情形的結果永遠無法觀測。Holland (1986) 將此稱為因果推論的根本問題(fundamental problem of causal inference):個體層次的因果效果本質上不可觀測,因為它涉及一個反事實(counterfactual)的、未曾發生的結果。
這一困難意味著,因果推論不可能是純粹的資料描述,而必然涉及對未觀測之反事實的推斷。統計方法之所以能夠回應,是因為雖然個體效果不可識別,群體平均的因果效果在適當假設下卻可以識別。理解因果推論,因此就是理解「哪些假設,能讓可觀測的關聯支撐起對不可觀測之反事實的推斷」。
潛在結果框架
潛在結果框架,源自 Rubin (1974) 並延續 Neyman 的傳統,為因果效果提供了精確的定義。其核心是為每一個體設想在不同處理下的多個「潛在結果」,而因果效果即為這些潛在結果之差。
設個體 i 面對二元處理 W_i\in\{0,1\},並有兩個潛在結果:接受處理下的 Y_i(1) 與未接受下的 Y_i(0)。個體層次的因果效果定義為
然而觀測到的僅為對應於實際處理的那一個結果:
另一潛在結果則為反事實、不可觀測,此即根本問題。群體層次的平均處理效果(average treatment effect, ATE)\tau = E[Y_i(1)-Y_i(0)] 仍可能識別。關鍵在於,天真的組間差異並不等於因果效果:
末項為選擇(或混淆)偏誤:它是處理組與對照組在「皆未受處理時」的基線差異。唯有當此項為零,觀測到的組間差才等於因果效果。
這個分解是理解一切因果推論策略的關鍵。所有的識別策略,無論是隨機化、調整、工具或設計,本質上都是使選擇偏誤項為零(或可估計並扣除)的不同手段。因果推論的方法論,因而可統一地理解為「消除或量化選擇偏誤」的技藝。
識別的三個假設
要從觀測資料識別平均因果效果,潛在結果框架依賴三個核心假設。第一是穩定單位處理值假設(stable unit treatment value assumption, SUTVA):一個體的潛在結果不受他人所受處理的影響(無干擾,no interference),且處理僅有單一、明確界定的版本。此假設在傳染、社會互動或溢出效果存在時可能受威脅。第二是可忽略性(ignorability),又稱無混淆性(unconfoundedness):在給定一組可觀測共變項 X 後,處理指派與潛在結果獨立,即 \{Y(0),Y(1)\}\perp W\mid X。其實質意涵是「在 X 相同的個體中,誰受處理如同隨機」,這要求所有同時影響處理與結果的混淆因子皆已被 X 涵蓋。第三是重疊(overlap),又稱正值性(positivity):在 X 的每一水準上,接受與不接受處理的機率皆嚴格介於 0 與 1 之間,即 0<P(W=1\mid X)<1,否則某些個體無可資比較的對象。
這三個假設的地位截然不同。重疊性可由資料檢驗(檢視各共變項水準上的處理分布);SUTVA 部分可由設計保障;但可忽略性在觀測研究中原則上不可由資料檢驗,因為它斷言「不存在未被 X 涵蓋的混淆因子」,而未觀測者依定義無法從資料中察見。這是觀測性因果推論的阿基里斯之踵,也是後文敏感度分析所欲應對的核心。
因果圖與 do 運算
潛在結果框架長於界定效果與推導估計,但對「哪些變項構成混淆、應納入 X」的判斷,圖模型的語言更為直觀有力。Pearl (2009) 發展的因果有向無環圖(directed acyclic graph, DAG),以節點表變項、有向邊表直接因果,將因果假設編碼為可視覺化、可推演的結構。
以可觀測共變項 X 為條件,若可忽略性 \{Y(0),Y(1)\}\perp W\mid X 與重疊性成立,則各處理下的平均潛在結果可由觀測條件期望識別:
從而 ATE 可估。隨機化實驗使處理 W 無條件地獨立於潛在結果,故可忽略性由設計自動成立,無須依賴 X。
在圖模型中,Pearl 以 do 運算 do(W=w) 表徵「外生地設定處理」的介入,並以後門準則(back-door criterion)判定調整集:若 X 阻斷了 W 與 Y 之間所有指向 W 的路徑(後門路徑),且 X 不含 W 的任何後代,則
此式與潛在結果框架的識別公式完全一致,後門準則即可忽略性的圖形對應:二框架在此殊途同歸。
DAG 的實用價值,在於它把「該控制什麼」從直覺判斷轉為可依規則推演的圖形操作。特別是,它清楚地區分了三種結構迥異的第三變項:混淆因子、中介變項與對撞因子,而三者對「是否應控制」給出截然不同的指示。Rohrer (2018) 為心理學讀者提供了以 DAG 澄清此類問題的優良導引。
混淆、對撞與「控制」的陷阱
「控制」(統計調整)常被誤認為越多越好,彷彿納入更多共變項總能更接近因果。這是一個危險的誤解。一個共變項在因果結構中的角色,決定了控制它是消除偏誤還是製造偏誤,三種角色摘要於表 31.1。
| 角色 | 圖結構 | 控制的後果 |
|---|---|---|
| 混淆因子 | W \leftarrow C \rightarrow Y | 應控制;不控制則有混淆偏誤 |
| 中介變項 | W \rightarrow M \rightarrow Y | 控制會阻斷部分效果、偏誤總效果 |
| 對撞因子 | W \rightarrow K \leftarrow Y | 控制會誘發假關聯(對撞偏誤) |
註. C 為混淆因子、M 為中介變項、K 為對撞因子。箭頭表因果方向。是否控制中介,取決於所欲估計者為總效果或直接效果。 混淆因子(W\leftarrow C\rightarrow Y)同時影響處理與結果,不控制它會使關聯混入非因果成分,故應納入調整集。中介變項(W\rightarrow M\rightarrow Y)位於因果路徑之上,若目標為總效果,控制它會錯誤地扣除經由 M 傳遞的那部分因果效果,造成過度控制偏誤。最違反直覺的是對撞因子(W\rightarrow K\leftarrow Y):K 是 W 與 Y 的共同結果,二者原本無關,但一旦以 K 為條件(控制它、或以它篩選樣本),便會在 W 與 Y 之間誘發一個純屬人為的關聯,此即對撞偏誤(collider bias)。許多著名的悖論,包括伯克森悖論與若干選擇效應,皆可歸因於無意間對對撞因子設限。這說明「控制變項」絕非中性的保險措施,而須以明確的因果結構為依據。
共變數調整與 Lord 悖論
在準實驗與觀測研究中,一個極常見的做法是以共變數分析(analysis of covariance, ANCOVA)調整前測或基線差異,藉此淨化出處理的效果。然而,共變數調整並非中性的技術,其結果的因果詮釋取決於一組不可由資料檢驗的假設。這一點最鮮明地體現於 Lord (1967) 所提出的悖論:兩位統計學家分析同一筆學生自入學到學年末體重變化的資料,一位比較兩性別組的變化分數,發現兩組平均變化並無差異,因而斷言性別對體重變化無效果;另一位以入學體重為共變數對學年末體重做 ANCOVA,卻發現顯著的組間差異,因而得出相反結論。兩種分析在代數上皆正確,卻導向矛盾的實質結論。
Lord 悖論的潛在結果解析揭示,這並非統計技術的錯誤,而是兩種分析回答了不同的因果問題,並各自預設了不同且不可檢驗的假設。變化分數取向假定若無處理、兩組本會有相同的平均變化;ANCOVA 取向則假定在相同基線下、兩組本會有相同的學年末結果。當處理(此處為性別)並非隨機分派、且與基線相關時,這兩個假設一般不能同時成立,資料本身也無力在其間仲裁,因為它們所涉及的皆是未曾觀測的反事實。此一悖論因而是本章核心訊息的縮影,即因果結論從不單由資料給定,而總是資料與所選因果估計量及其識別假設的共同產物。本書對此採明確的分工,即共變數調整與變化分數的代數性質、及其在實驗設計中的角色屬第十章的範疇,本章則負責其潛在結果的識別解析。
隨機化實驗:為何是黃金標準
隨機化實驗之所以被奉為因果推論的黃金標準,其理由可由前述框架精確地說明。將處理隨機分派,使處理指派在期望上與所有前處理特徵(無論可觀測與否)獨立,因而潛在結果與處理無條件獨立,可忽略性由設計成立,選擇偏誤項在期望上為零。至關重要的是,隨機化同時中和了已知與未知的混淆因子,這是任何觀測性調整都無法保證的:調整只能處理被測到的混淆,未測者則束手無策。隨機化並非萬能,它仍可能受不完全遵從、流失、或違反 SUTVA 的干擾所威脅,但它為因果識別所提供的無條件可忽略性,是其不可取代的優勢所在。此一邏輯與第十章所述 Fisher 的實驗設計三原則(隨機化、區集、重複)一脈相承:隨機化保障可忽略性,區集吸收已知的異質以提升精確度,重複則使誤差變異得以估計。由此觀之,實驗設計與因果識別實為一體兩面,即設計本身就是一種識別策略,好的設計把識別所需的假設,由不可檢驗的信念轉化為由研究者主動施加、因而可辯護的程序。
傾向分數
在無法隨機化的觀測研究中,若可忽略性在一組共變項 X 下成立,仍可藉調整逼近因果效果。當 X 維度甚高時,直接分層或匹配變得困難,Rosenbaum & Rubin (1983) 的傾向分數提供了優雅的降維之道。
傾向分數定義為給定共變項下接受處理的條件機率:
Rosenbaum & Rubin (1983) 證明其兩個關鍵性質。其一為平衡性:以傾向分數為條件,處理與共變項獨立,W\perp X\mid e(X)。其二為降維:若可忽略性在 X 下成立,則在純量 e(X) 下亦成立,\{Y(0),Y(1)\}\perp W\mid e(X)。故調整一個純量的傾向分數,即足以移除所有可觀測共變項所致的偏誤。
傾向分數可用於匹配、分層或加權。逆機率加權(inverse probability weighting, IPW)估計式為
其在可忽略性與重疊性下為 ATE 的無偏估計,因 E\!\left[\dfrac{W\,Y}{e(X)}\right] = E[Y(1)]。進一步地,雙重穩健(doubly robust)估計式結合傾向模型與結果模型,只要二者之一設定正確即為一致,提供了對模型誤設的部分保險。
傾向分數的效力有其邊界:它僅能平衡可觀測的共變項,對未測混淆無能為力。因此傾向分數方法縮小、但不消除觀測研究與隨機化實驗之間的鴻溝,其可信度最終仍取決於可忽略性這一不可檢驗的假設。
工具變項
當存在未測混淆、可忽略性不成立時,調整策略全盤失效。工具變項(instrumental variable, IV)提供了一條不同的識別路徑:借助一個外生的變異來源,繞過未測混淆。一個有效的工具 Z 須滿足三個條件:與處理相關(相關性)、僅透過處理影響結果而無其他路徑(排除限制,exclusion restriction)、且本身不受混淆(外生性)。在此類條件下,工具中「如同隨機」的變異可被用以識別因果效果。Angrist et al. (1996) 將 IV 嵌入潛在結果框架,闡明在額外的單調性假設下,IV 所識別的並非全體的 ATE,而是局部平均處理效果(local average treatment effect, LATE):即那些「因工具而改變處理狀態」的順從者(compliers)次群體的平均效果。這一釐清具深遠意義,它指出 IV 的估計標的是一個特定且未必具普遍代表性的子群,其外推須審慎。工具變項在計量經濟學中以兩階段最小平方實作,而其邏輯與結構方程模型中的識別問題緊密相通。
工具變項的效力完全繫於假設的可信度,尤其是排除限制,它同樣不可由資料檢驗。一個看似合理卻暗中透過其他管道影響結果的「工具」,會產生嚴重且難以察覺的偏誤;而過弱的工具(與處理相關甚微)則導致不穩定的估計。工具變項因而是強力卻脆弱的方法。
自然實驗與準實驗設計
當隨機化不可行、又缺乏有效工具時,研究者可訴諸利用自然發生之外生變異的準實驗設計。差異中差異(difference-in-differences, DiD)比較處理組與對照組在介入前後的結果變化之差,藉「取差分」消去不隨時間變動的組間混淆,其核心識別假設是平行趨勢(parallel trends):若無介入,兩組結果本會呈平行的時間變化。此假設援引縱貫資料(第二十八、二十九章),但本身不可直接檢驗,僅能以介入前的趨勢佐證。迴歸不連續(regression discontinuity, RD)則利用某連續指派變項越過一門檻即決定處理的情形,比較門檻兩側鄰近個體的結果:在門檻附近,個體落於哪一側可視為如同隨機,其識別假設是結果對指派變項的期望在門檻處連續。各設計的核心識別假設對照於表 31.2。
| 策略 | 核心識別假設 |
|---|---|
| 隨機化實驗 | 隨機分派(無條件可忽略性) |
| 傾向分數/迴歸調整 | 可忽略性+重疊性 |
| 工具變項 | 相關性+排除限制+單調性 |
| 差異中差異 | 平行趨勢 |
| 迴歸不連續 | 結果於門檻處連續 |
註. 各策略以不同的可辯護假設換取因果識別;除重疊性與部分設計的輔助檢驗外,多數核心假設不可由資料直接檢驗。 這些設計的共同精神,是尋找一個「如同隨機」的外生變異來源,以近似隨機化所提供的可忽略性。它們擴展了因果推論的適用範圍,但每一種都以一組特定且多不可檢驗的假設為代價。Shadish et al. (2002) 在 Campbell 的效度威脅傳統中,對此類設計及其對內在效度威脅的防禦,作了經典而系統的整理,與第八、九章的效度架構一脈相承。
四類效度:實驗傳統的整合視角
前述的各種識別策略,可置於 Campbell 傳統的效度類型學中獲得整合的理解。Shadish et al. (2002) 將實驗與準實驗研究的效度區分為四類,各對應一種不同的推論威脅。內在效度(internal validity)關乎處理與結果之間的關聯是否確為因果,正是本章各識別策略所直接處理的核心,混淆、選擇與對撞等偏誤皆屬對內在效度的威脅。統計結論效度(statistical conclusion validity)關乎所宣稱的關聯是否在統計上站得住腳,涉及檢定力、多重比較與效果量的估計,與第八章的推論議題相接。
另外兩類效度則把視野推向因果宣稱的邊界。外在效度(external validity)關乎所得的因果結論能否推廣到其他人群、情境與時間,這正是第九章抽樣與外在推論所處理的問題;一個內在效度無懈可擊的隨機化實驗,其結論仍可能因樣本的特殊性而難以外推,工具變項所識別的局部平均處理效果尤其凸顯了這一限制。構念效度(construct validity)則關乎所操弄的處理與所測量的結果是否確為研究者宣稱的那些構念,這使因果推論直接倚賴第七章的效度論證:若處理或結果的構念界定含糊,則無論因果識別多麼嚴謹,其結論所指涉的因果關係本身即是模糊的。四類效度的區分提醒研究者,一項因果研究的可信度,並非僅由內在效度單獨決定,而須在四個面向上分別辯護。
因果中介分析
中介分析欲拆解一個因果效果經由某中介變項傳遞的部分(間接效果)與其餘部分(直接效果),是心理學檢驗歷程理論的核心工具。第十六章已介紹其在結構方程中的傳統做法,然而 Baron & Kenny (1986) 式的迴歸取向,其係數乘積雖在估計上便利,卻預設了強而常未言明的因果假設。因果中介分析以潛在結果重新界定中介效果,將間接與直接效果形式化為自然間接效果(natural indirect effect)與自然直接效果(natural direct effect),二者涉及對「若處理改變、但中介固定於其在某處理下之值」這類巢狀反事實的推斷。
Imai et al. (2010) 提出的一般化因果中介框架,闡明了此類效果得以識別所需的序列可忽略性(sequential ignorability):不僅處理相對於結果須無混淆,中介相對於結果亦須在給定處理與前處理共變項後無混淆。後者尤其嚴苛,因為即便處理經隨機化,中介卻幾乎從不隨機,處理後才發生、且可能與結果共享未測原因的中介變項,使中介的可忽略性極難成立。此框架的貢獻,在於把中介分析的因果詮釋所需的假設攤在明處,從而揭示了許多常規中介宣稱的脆弱:一個統計上顯著的間接效果,遠不足以支撐「M 因果地中介了 W 對 Y 的效果」這一實質結論。
未測混淆的敏感度分析
既然可忽略性這一觀測研究的核心假設不可檢驗,一個務實且負責任的做法,是評估「結論對違反此假設的穩健程度」,即敏感度分析。其問題意識為:一個未測混淆因子須強到何種程度,才足以推翻既有的結論?VanderWeele & Ding (2017) 提出的 E 值(E-value)將此形式化為一個直觀的指標:它是未測混淆因子須同時與處理及結果具備的最小關聯強度(以風險比為尺度),方能將觀測到的效果完全解釋為虛假。E 值越大,表示要推翻結論所需的未測混淆越強、結論越穩健;E 值接近 1,則些微的未測混淆即可能顛覆結論。敏感度分析不能證明因果,但它將「可能存在未測混淆」這一空泛的質疑,轉化為可量化、可討論的具體命題,是觀測性因果研究不可或缺的一環。
結構方程模型與因果
結構方程模型(第十五、十六章)常被期待用以「檢驗因果模型」,但其與因果的關係充滿誤解。最根本的一點是:SEM 本身並不能由關聯建立因果。一個 SEM 的路徑係數要具有因果詮釋,須先假定該模型的因果結構為真,包括變項間的方向、以及不存在未納入的共同原因(外生誤差不相關的假設)。模型與資料適配良好,並不驗證這些因果假設,因為如第十六章所述,往往存在多個適配等量卻因果結構迥異的等價模型 (MacCallum et al., 1993),資料無力在其間仲裁。
Bollen & Pearl (2013) 系統澄清了關於 SEM 與因果的八個迷思,論證 SEM 的結構係數在其假設成立時確有因果意義,但此意義來自模型所編碼的因果假設,而非來自適配本身。將 SEM 與因果圖對接,有助於明確一個路徑模型究竟預設了哪些因果假設、哪些可檢驗、哪些純屬設定。此外,測量誤差會使結構係數產生系統性偏誤,這也是何以潛在變項的 SEM 在處理測量誤差上,較以觀測分數迴歸更有利於因果推論,但前提仍是測量模型與結構假設皆正確。
縱貫與因果:交叉延宕模型及其批判
時間先後常被視為因果的線索,縱貫資料因而被寄望能支持較強的因果推論。交叉延宕模型(cross-lagged panel model, CLPM)是心理學長期倚重的工具:以各變項在前一時點的值預測另一變項在後一時點的值,並將該交叉延宕係數詮釋為前瞻性的「效果」。然而 Hamaker et al. (2015) 提出了具影響力的批判:傳統 CLPM 混淆了個體間的穩定差異與個體內的動態歷程,其交叉延宕係數同時承載了這兩種性質不同的變異,因而未必反映所欲的個體內因果過程。其提出的隨機截距交叉延宕模型(random-intercept CLPM, RI-CLPM)藉納入隨機截距,將穩定的個體間差異自個體內動態中分離,此一組間組內分離的邏輯,正與第二十八章多層次模型的中心化與 Mundlak 取向相通;隨機截距交叉延宕模型作為刻畫個體內互鎖關係的縱貫工具,其較完整的處理見第二十九章。
更進一步,當處理本身隨時間變動、且存在同樣隨時間變動的混淆因子時,因果推論面臨一個標準調整無法處理的難題:一個時變的混淆因子,可能同時是先前處理的結果、又是後續處理與結果的共同原因,形成處理與混淆的回饋。此時逕自控制該時變混淆,反而會阻斷部分處理效果並誘發對撞偏誤,須改用邊際結構模型等專為時變處理設計的方法。此類問題在密集縱貫資料中尤為突出,其與動態建模的交織屬第三十章的範疇,本章僅作概觀性的提示。
更根本地,時間先後既非因果的充分條件、亦非其保證。所謂 Granger 因果本質上是預測性的,回答「前者是否有助預測後者」,而非干涉論意義下的因果。縱貫設計雖排除了最粗糙的反向因果、並提供時序上的前提,卻無法自動排除未測混淆,也無法保證個體內的關聯即為因果。縱貫資料使因果推論更有依據,但不使其自動成立。
因果與可操弄性:測量的哲學問題
因果推論觸及一個對心理學尤為切身的哲學爭議:因果是否以可操弄性為前提。在潛在結果的嚴格觀點下,Y_i(1) 與 Y_i(0) 的定義預設了一個明確界定的介入,Holland (1986) 因而有「無操弄即無因果」(no causation without manipulation)之說。依此,種族、性別、年齡等屬性因缺乏明確的「操弄」,其「因果效果」在此框架下難以良好定義。與此相對,Bollen & Pearl (2013) 及圖模型傳統認為此要求過於嚴苛,主張因果圖可表徵不可操弄之屬性的因果角色。
此爭議對心理學有直接而深刻的意涵,因為心理學所欲研究因果的,多為憂鬱、智力、動機等潛在構念,而「操弄一個構念」意味著什麼,往往並不明確。這使因果推論與本書前半的核心主題緊密相接:構念效度(第七章)是因果宣稱的前提。一個界定含糊的構念,其「因果效果」也必然含糊;追問「對這個變項施予介入,究竟意味著什麼」,是對因果宣稱的一種必要的紀律,它迫使研究者釐清所欲估計的因果量是否具有良好定義。因果推論於是不僅是統計問題,更回頭質問測量本身:唯有先能清楚地界定並測量一個構念,才談得上嚴謹地推論它的因果作用。
小結
本章對因果推論作了自框架到方法、再到哲學前提的系統鋪陳。核心上,因果推論奠基於潛在結果與因果圖兩個互補框架,其共同的識別問題可統一理解為消除或量化選擇偏誤;而識別所依賴的假設,尤其是可忽略性與排除限制,多不可由資料檢驗,這使因果結論總是資料與假設的共同產物。方法上,本章涵蓋隨機化實驗、傾向分數、工具變項、差異中差異與迴歸不連續等識別策略,並釐清了「控制變項」在混淆、中介與對撞三種角色下的截然後果。進一步,本章處理了因果中介的嚴苛假設、未測混淆的敏感度分析、結構方程與因果的關係、縱貫因果的難處、以及可操弄性這一觸及測量根基的爭議。對本章各主題的完整處理,可參潛在結果傳統的 Imbens & Rubin (2015)、現代因果推論的 Hernán & Robins (2020)、以及中介與交互作用的 VanderWeele (2015)。全章的核心訊息是:因果推論的嚴謹,不在於某種神奇的統計技術,而在於使因果假設明確、可辯護、且其後果可分析;而對心理學而言,這份嚴謹最終回指向測量本身的清晰。下一章將把推論的單位從單一研究提升到整個文獻,探討如何以後設分析系統性地彙整眾多研究的證據,並正視發表偏誤與異質性等研究整合所特有的挑戰。